Claude и гипотеза Римана: полтора дня автономной работы ИИ-агента
Сотрудник Anthropic Джаред Самнер — тот самый, кто создал JavaScript-рантайм bun — поставил исследовательской версии Claude задачу, которую математики не могут решить больше 160 лет: «докажи гипотезу Римана». Гипотезу модель не доказала. Но за полтора дня автономной работы, по описанию эксперимента, она улучшила существующий результат: доля нулей дзета-функции, доказанно лежащих на критической линии, выросла с 41,6% до 67%. Для бизнеса важна не математика, а механика: агент работал без содержательных подсказок, сам искал идеи, проверял их и собирал доказательство из старых теорем. Это повод пересмотреть, какие задачи в компании уже можно отдавать ИИ-агентам «на длинную дистанцию» — и какие проверки при этом обязательны.
Источник: t.me
Что именно произошло
По описанию эксперимента, картина выглядит так. Самнер дал исследовательской версии Claude одну формулировку — решить гипотезу Римана — и дальше почти не вмешивался в содержание. Модель работала в двух длинных сессиях общей длительностью около полутора дней, запуская собственных субагентов — параллельные копии, которые проверяли отдельные идеи.
Промты в процессе не содержали математики. Это были короткие команды вроде «keep going», «believe in yourself», «try again» и иногда «push it». То есть человек не подсказывал направление — он только не давал процессу остановиться.
Результат, по описанию: модель сама нашла способ усилить классический результат о нулях дзета-функции Римана. Раньше было доказано, что не менее 41,6% нулей лежат на критической линии; агент довёл оценку до 67%, комбинируя существующие теоремы и написав доказательство целиком самостоятельно.
Важная оговорка: это не доказательство гипотезы Римана. Гипотеза утверждает, что на критической линии лежат все нетривиальные нули. Улучшение доли с 41,6% до 67% — это прогресс в оценке, а не решение проблемы тысячелетия. И сам результат на момент публикации описан только в публичном рассказе об эксперименте — независимого рецензирования он пока не прошёл.
Почему это важно не только математикам
Бизнес-читателю стоит увидеть здесь не «ИИ решает науку», а смену режима работы агента. Классический сценарий использования LLM в компании — короткий диалог: вопрос, ответ, правка, ответ. Здесь показан другой режим: агент получает цель, сам строит план, порождает подзадачи, проверяет гипотезы, отбрасывает тупики и продолжает часами.
Три следствия для практики:
- Длинные задачи перестают требовать постоянного оператора. Если агент способен полтора дня удерживать цель без содержательных подсказок, то задачи вроде «проверь все договоры на типовые риски» или «собери и сверь данные из сорока источников» переходят из категории «нужен аналитик на неделю» в категорию «нужен запуск, лимит бюджета и проверка результата».
- Роль человека смещается с «пиши промты» на «ставь цель и проверяй». В эксперименте содержательный вклад человека был нулевым после постановки задачи. Ценность человека — в формулировке цели и в верификации итога.
- Стоимость ошибки растёт вместе с автономностью. Агент, который полтора дня работает без присмотра, может полтора дня уверенно идти в неверном направлении. В математике это стоит только вычислительных ресурсов. В финансах, закупках или юридических документах — реальных денег.
Как превратить это в рабочий метод
Из эксперимента можно извлечь переносимый приём, не привязанный к математике. Условно его можно назвать «длинная сессия с минимальным вмешательством»:
- Сформулируйте цель, а не инструкцию. «Реши гипотезу Римана» — это цель. «Возьми теорему X и примени к Y» — инструкция. Эксперимент показывает: сильный агент эффективнее, когда ему дают цель и свободу выбора пути.
- Задайте критерий приёмки заранее. В математике критерий встроенный: доказательство либо выводится, либо нет. В бизнес-задаче критерий нужно написать человеку: как выглядит готовый результат, какие источники допустимы, что считается ошибкой.
- Вмешивайтесь только для продолжения, не для направления. Команды «продолжай» и «попробуй ещё раз» дешевле, чем микроменеджмент, и не сужают поиск агента.
- Проверяйте итог независимо. Результат агента — это черновик экспертного уровня, а не готовое решение. В эксперименте доказательство всё равно должны проверить математики.
| Что меняется | Почему важно бизнесу | Что проверить |
|---|---|---|
| Агент работает часами без оператора | Аналитические задачи выполняются без постоянного участия сотрудника | Стоимость длинной сессии и лимиты расхода |
| Человек ставит цель, а не пишет инструкции | Снижается требование к «промт-навыкам» команды | Умеет ли команда формулировать критерии приёмки |
| Агент сам порождает и проверяет гипотезы | Исследовательские и due-diligence-задачи ускоряются | Есть ли независимая проверка итога |
| Ошибка может накапливаться незаметно | Риск в финансовых и юридических задачах | Точки остановки и промежуточный контроль |
Где ограничения и риски
Первое ограничение — верификация самого результата. Утверждение о 67% нулей на критической линии пока существует в виде публичного рассказа об эксперименте. До независимой проверки математическим сообществом это предварительный результат. Это хорошая иллюстрация общего правила: вывод автономного агента требует такой же проверки, как работа сильного, но непроверенного подрядчика.
Второе — математика — особая среда. В ней есть встроенный механизм проверки: доказательство можно верифицировать формально. В большинстве бизнес-задач такого механизма нет. Агент, анализирующий рынок или пишущий юридическое заключение, не получит автоматического «верно/неверно» — проверку должен обеспечить человек.
Третье — стоимость и доступ. Полтора дня работы исследовательского агента с субагентами — это значительный расход вычислительных ресурсов. Для российских компаний добавляются вопросы доступа к зарубежным сервисам, оплаты и стабильности аккаунтов. Прежде чем строить процесс на длинных агентных сессиях, нужно посчитать экономику одного запуска и сравнить её со стоимостью часа работы сотрудника.
Четвёртое — не переносите результат на слабые задачи. Успех на задаче с чётким критерием истины не гарантирует успеха там, где критерий размыт: стратегия, переговоры, креатив.
Что сделать на этой неделе
Не нужно ждать, пока ИИ «докажет гипотезу Римана» окончательно. Практический шаг — проверить режим длинной автономной сессии на одной своей задаче с проверяемым результатом.
Чек-лист для руководителя или оператора процесса:
- [ ] Выберите одну задачу, где результат можно проверить объективно: сверка данных, аудит документов, поиск противоречий в отчётах.
- [ ] Сформулируйте цель одним предложением и письменно зафиксируйте критерий приёмки: что считается готовым результатом и что — ошибкой.
- [ ] Установите лимит: время сессии и максимальный расход на запуск.
- [ ] Запустите агента и вмешивайтесь только командами продолжения, не подсказывая содержание.
- [ ] Передайте итог на независимую проверку сотруднику, который не участвовал в запуске.
- [ ] Сравните: время и стоимость сессии против времени и стоимости ручного выполнения той же задачи.
Если агент справился и экономика сошлась — у компании появился повторяемый приём для целого класса задач. Если нет — вы дёшево узнали границу применимости, что тоже результат.
Источники
Темы журнала
Что почитать дальше
- Claude от Anthropic для верификации чипов: кейс UST с экономией 70% времени
- Гранты Anthropic на редкие заболевания: как получить $50 000 на Claude
- Бесплатный Claude API для стартапов: как получить кредиты Anthropic
- Kimi вместо Claude: проверка скорости, качества и стоимости для бизнеса
- Claude Opus 5 для бизнеса: цена API, риски доступа и проверка ROI