ИИ для математических доказательств: 7 гипотез за неделю и риски
Что именно произошло — семь новых результатов за четыре дня
На этой неделе один исследователь опубликовал перечень из семи математических гипотез и теорем, которые были либо доказаны, либо опровергнуты с помощью современных генеративных моделей. Все случаи произошли в течение четырёх дней, хотя неделя ещё не завершилась.
Источник: Пример контрпримера к 30-летней гипотезе с транскриптом чата GPT
| № | Гипотеза / теорема | ИИ‑модель, использованная для решения | Тип результата | Краткое описание |
|---|---|---|---|---|
| 1 | Гипотеза Якобиана (размерность 3) | Claude Fable 5 | Опровержение | Найден контрпример в трёхмерном случае; двумерный случай остаётся открытым. |
| 2 | Гипотеза о гауссовых моментах (n ≥ 3) | ChatGPT + Claude | Опровержение | Явные контрпримеры построены для всех размерностей ≥ 3. |
| 3 | Гипотеза Балабдауи‑Веллнера о плотности Чернова | GPT‑5.6 Sol | Доказательство | Полностью сгенерированное доказательство, опубликовано в виде скрипта. |
| 4 | Гипотеза Каваути (модуль 4) | Claude Fable 5 | Доказательство | Доказательство построено без внешних подсказок, только запросами к модели. |
| 5 | Гипотеза Черны для однокластерных автоматов положительного уровня | OpenAI Codex | Доказательство | Автоматически сгенерированный код проверил условие для всех известных случаев. |
| 6 | Теорема об улучшенной сходимости стохастического многоградиентного спуска | Не указана (AI‑поиск) | Доказательство | Оценка скорости сходимости улучшена до O(T⁻¹). |
| 7 | Теорема о спектральном крае квартичной модели SYK | GPT‑5.6 | Доказательство | Модель помогла сформулировать аргументы, необходимые для полного доказательства. |
Все перечисленные результаты сопровождаются полными транскриптами диалогов с ИИ, где автор задавал от четырёх до пяти последовательных запросов типа «найди наиболее неочевидный контрпример». Ни один из примеров не требовал сложных промптов‑инженерии, а лишь простую задачу «сделай прорыв».
Почему это важно сейчас для бизнеса
- Сокращение времени исследования – традиционный процесс доказательства гипотез может занимать годы. Примеры выше показывают, что в течение нескольких дней ИИ способен генерировать контрпримеры или полные доказательства. Для компании, инвестирующей в R&D, это значит ускорение вывода новых продуктов или патентов.
- Снижение затрат на человеческий труд – каждый из перечисленных кейсов заменил бы работу нескольких специалистов‑математиков. При средней ставке ≈ 200 000 ₽ в месяц экономия может достигать сотен тысяч рублей за один проект.
- Повышение конкурентоспособности – возможность быстро проверять гипотезы в области криптографии, финансовой математики или оптимизации открывает новые рыночные ниши. Компании, которые внедрят такой подход, получат преимущество в скорости вывода инноваций.
- Уменьшение зависимости от внешних экспертов – автоматизированный поиск контрпримеров позволяет проводить предварительные проверки без привлечения дорогостоящих консультантов.
- Риски, связанные с доступом к моделям – большинство упомянутых ИИ‑сервисов находятся за границей, требуют платных подписок и могут быть недоступны из‑за санкций. Поэтому необходимо заранее оценить юридические и финансовые условия их использования.
Как превратить эксперимент в повторяемый рабочий процесс
- Определите задачу в виде чёткой формулировки
- Пример: «Найдите контрпример к гипотезе X в размерности 3».
- Формулировка должна быть однозначной, без лишних уточнений.
- Выберите подходящую модель
- Для задач, требующих генерации кода (например, автоматов), лучше использовать Codex.
- Для чисто аналитических доказательств подойдёт Claude Fable 5 или GPT‑5.6.
- Создайте минимальный набор запросов
- Первый запрос: «Сделай прорыв и найди контрпример».
- Последующие запросы уточняют полученный результат («проверь, удовлетворяет ли он условию Y»).
- Записывайте каждый диалог
- Храните полные транскрипты в системе контроля версий (Git). Это позволит воспроизводить процесс и проверять корректность.
- Автоматизируйте проверку полученных результатов
- Напишите небольшие скрипты (Python, Julia) для проверки контрпримеров или доказательств.
- Интегрируйте их в CI/CD‑pipeline, чтобы каждый новый результат проходил автоматический тест.
- Оцените достоверность
- Привлеките независимого эксперта для верификации критических шагов.
- Сравните полученный результат с известными теоремами или опубликованными доказательствами.
- Документируйте затраты
- Учтите стоимость запросов к API, время инженеров, расходы на хранение данных.
Пример рабочего шаблона (для менеджера)
| Шаг | Действие | Инструмент | Ожидаемый результат |
|---|---|---|---|
| 1 | Формулировка задачи | Текстовый документ | Чёткое описание гипотезы |
| 2 | Выбор модели | Claude Fable 5, GPT‑5.6, Codex | Выбранный сервис с учётом стоимости |
| 3 | Запуск запросов | API‑клиент | Текстовый ответ модели |
| 4 | Запись диалога | Git‑репозиторий | Полный журнал общения |
| 5 | Проверка результата | Python‑скрипт | Автоматический тест «пройден/не пройден» |
| 6 | Верификация экспертом | Внутренний reviewer | Подтверждённый вывод |
| 7 | Финальный отчёт | PDF/Confluence | Документ для руководства |
Где находятся ограничения и риски
| Риск | Причина | Как смягчить |
|---|---|---|
| Недоступность модели | Санкции, блокировка API, отсутствие локального билда | Заключить договор с локальным провайдером, использовать открытые модели (например, LLaMA) в качестве резервного варианта. |
| Непроверенный результат | ИИ может сгенерировать «правдоподобный», но ошибочный вывод | Обязательно проводить независимую проверку, использовать формальные системы (Coq, Lean) для критических доказательств. |
| Стоимость запросов | Платные тарифы могут быстро расти при большом числе токенов | Ограничить длину запросов, использовать «few‑shot»‑промпты, вести учёт расходов в реальном времени. |
| Юридические ограничения | Передача конфиденциальных данных в облако может нарушать закон | Анонимизировать данные, использовать модели, размещённые в РФ, или локальные инстансы. |
| Переоценка возможностей | Публичные примеры могут быть отобранными, а не репрезентативными | Проводить пилотные проекты на небольших задачах, сравнивать с традиционными методами. |
Что сделать уже на этой неделе — практический чек‑лист
- [ ] Сформулировать одну текущую исследовательскую задачу в виде короткой, однозначной формулировки.
- [ ] Проверить доступность выбранной модели (Claude Fable 5, GPT‑5.6, Codex) через официальные каналы и оценить стоимость 1 000 токенов.
- [ ] Создать репозиторий в GitLab/GitHub для хранения диалогов и скриптов проверки.
- [ ] Запустить первый запрос к модели и сохранить полный транскрипт.
- [ ] Написать простой скрипт‑валидатор (например, проверка контрпримера на удовлетворение условия гипотезы).
- [ ] Провести внутреннюю проверку результата коллегой‑математиком или специалистом‑аналитиком.
Если после выполнения всех пунктов результат выглядит убедительным, планируйте масштабирование процесса на остальные открытые задачи отдела R&D. Если возникли проблемы (например, модель недоступна или результат не проходит проверку), пересмотрите выбор инструмента или вернитесь к традиционному подходу.
Источники
Темы журнала
Что почитать дальше
- GPT‑5.6 от OpenAI: новые модели Sol, Terra, Luna, режим Ultra и trusted access
- GPT-5.6 и Codex против Claude: сравнение для выбора AI-инструмента разработки
- Многоуровневое автоматическое ревью кода в Claude Code: от быстрой проверки до облачной песочницы
- Claude Opus 5 для бизнеса: цена API, риски доступа и проверка ROI
- Kimi вместо Claude: проверка скорости, качества и стоимости для бизнеса