Эксперимент Claude с гипотезой Римана: полтора дня автономной работы ИИ-агента

Claude и гипотеза Римана: полтора дня автономной работы ИИ-агента

ИИ-инструменты 12 авг. 2026 г.

Сотрудник Anthropic Джаред Самнер — тот самый, кто создал JavaScript-рантайм bun — поставил исследовательской версии Claude задачу, которую математики не могут решить больше 160 лет: «докажи гипотезу Римана». Гипотезу модель не доказала. Но за полтора дня автономной работы, по описанию эксперимента, она улучшила существующий результат: доля нулей дзета-функции, доказанно лежащих на критической линии, выросла с 41,6% до 67%. Для бизнеса важна не математика, а механика: агент работал без содержательных подсказок, сам искал идеи, проверял их и собирал доказательство из старых теорем. Это повод пересмотреть, какие задачи в компании уже можно отдавать ИИ-агентам «на длинную дистанцию» — и какие проверки при этом обязательны.

Источник: t.me

Что именно произошло

По описанию эксперимента, картина выглядит так. Самнер дал исследовательской версии Claude одну формулировку — решить гипотезу Римана — и дальше почти не вмешивался в содержание. Модель работала в двух длинных сессиях общей длительностью около полутора дней, запуская собственных субагентов — параллельные копии, которые проверяли отдельные идеи.

Промты в процессе не содержали математики. Это были короткие команды вроде «keep going», «believe in yourself», «try again» и иногда «push it». То есть человек не подсказывал направление — он только не давал процессу остановиться.

Результат, по описанию: модель сама нашла способ усилить классический результат о нулях дзета-функции Римана. Раньше было доказано, что не менее 41,6% нулей лежат на критической линии; агент довёл оценку до 67%, комбинируя существующие теоремы и написав доказательство целиком самостоятельно.

Важная оговорка: это не доказательство гипотезы Римана. Гипотеза утверждает, что на критической линии лежат все нетривиальные нули. Улучшение доли с 41,6% до 67% — это прогресс в оценке, а не решение проблемы тысячелетия. И сам результат на момент публикации описан только в публичном рассказе об эксперименте — независимого рецензирования он пока не прошёл.

Почему это важно не только математикам

Бизнес-читателю стоит увидеть здесь не «ИИ решает науку», а смену режима работы агента. Классический сценарий использования LLM в компании — короткий диалог: вопрос, ответ, правка, ответ. Здесь показан другой режим: агент получает цель, сам строит план, порождает подзадачи, проверяет гипотезы, отбрасывает тупики и продолжает часами.

Три следствия для практики:

  1. Длинные задачи перестают требовать постоянного оператора. Если агент способен полтора дня удерживать цель без содержательных подсказок, то задачи вроде «проверь все договоры на типовые риски» или «собери и сверь данные из сорока источников» переходят из категории «нужен аналитик на неделю» в категорию «нужен запуск, лимит бюджета и проверка результата».
  2. Роль человека смещается с «пиши промты» на «ставь цель и проверяй». В эксперименте содержательный вклад человека был нулевым после постановки задачи. Ценность человека — в формулировке цели и в верификации итога.
  3. Стоимость ошибки растёт вместе с автономностью. Агент, который полтора дня работает без присмотра, может полтора дня уверенно идти в неверном направлении. В математике это стоит только вычислительных ресурсов. В финансах, закупках или юридических документах — реальных денег.

Как превратить это в рабочий метод

Из эксперимента можно извлечь переносимый приём, не привязанный к математике. Условно его можно назвать «длинная сессия с минимальным вмешательством»:

  • Сформулируйте цель, а не инструкцию. «Реши гипотезу Римана» — это цель. «Возьми теорему X и примени к Y» — инструкция. Эксперимент показывает: сильный агент эффективнее, когда ему дают цель и свободу выбора пути.
  • Задайте критерий приёмки заранее. В математике критерий встроенный: доказательство либо выводится, либо нет. В бизнес-задаче критерий нужно написать человеку: как выглядит готовый результат, какие источники допустимы, что считается ошибкой.
  • Вмешивайтесь только для продолжения, не для направления. Команды «продолжай» и «попробуй ещё раз» дешевле, чем микроменеджмент, и не сужают поиск агента.
  • Проверяйте итог независимо. Результат агента — это черновик экспертного уровня, а не готовое решение. В эксперименте доказательство всё равно должны проверить математики.
Что меняется Почему важно бизнесу Что проверить
Агент работает часами без оператора Аналитические задачи выполняются без постоянного участия сотрудника Стоимость длинной сессии и лимиты расхода
Человек ставит цель, а не пишет инструкции Снижается требование к «промт-навыкам» команды Умеет ли команда формулировать критерии приёмки
Агент сам порождает и проверяет гипотезы Исследовательские и due-diligence-задачи ускоряются Есть ли независимая проверка итога
Ошибка может накапливаться незаметно Риск в финансовых и юридических задачах Точки остановки и промежуточный контроль

Где ограничения и риски

Первое ограничение — верификация самого результата. Утверждение о 67% нулей на критической линии пока существует в виде публичного рассказа об эксперименте. До независимой проверки математическим сообществом это предварительный результат. Это хорошая иллюстрация общего правила: вывод автономного агента требует такой же проверки, как работа сильного, но непроверенного подрядчика.

Второе — математика — особая среда. В ней есть встроенный механизм проверки: доказательство можно верифицировать формально. В большинстве бизнес-задач такого механизма нет. Агент, анализирующий рынок или пишущий юридическое заключение, не получит автоматического «верно/неверно» — проверку должен обеспечить человек.

Третье — стоимость и доступ. Полтора дня работы исследовательского агента с субагентами — это значительный расход вычислительных ресурсов. Для российских компаний добавляются вопросы доступа к зарубежным сервисам, оплаты и стабильности аккаунтов. Прежде чем строить процесс на длинных агентных сессиях, нужно посчитать экономику одного запуска и сравнить её со стоимостью часа работы сотрудника.

Четвёртое — не переносите результат на слабые задачи. Успех на задаче с чётким критерием истины не гарантирует успеха там, где критерий размыт: стратегия, переговоры, креатив.

Что сделать на этой неделе

Не нужно ждать, пока ИИ «докажет гипотезу Римана» окончательно. Практический шаг — проверить режим длинной автономной сессии на одной своей задаче с проверяемым результатом.

Чек-лист для руководителя или оператора процесса:

  • [ ] Выберите одну задачу, где результат можно проверить объективно: сверка данных, аудит документов, поиск противоречий в отчётах.
  • [ ] Сформулируйте цель одним предложением и письменно зафиксируйте критерий приёмки: что считается готовым результатом и что — ошибкой.
  • [ ] Установите лимит: время сессии и максимальный расход на запуск.
  • [ ] Запустите агента и вмешивайтесь только командами продолжения, не подсказывая содержание.
  • [ ] Передайте итог на независимую проверку сотруднику, который не участвовал в запуске.
  • [ ] Сравните: время и стоимость сессии против времени и стоимости ручного выполнения той же задачи.

Если агент справился и экономика сошлась — у компании появился повторяемый приём для целого класса задач. Если нет — вы дёшево узнали границу применимости, что тоже результат.

Источники

Темы журнала

Что почитать дальше

Теги