Наши первые отправленные решения математических задач First Proof

Мы делимся нашими попытками доказательств для First Proof — математического соревнования, созданного для проверки того, способны ли ИИ создавать проверяемые доказательства для задач из узкоспециализированных областей.
Мы запустили внутреннюю модель на всех 10 задачах First Proof — математического вызова исследовательского уровня, призванного проверить, способны ли системы ИИ выдавать правильные и проверяемые попытки доказательств. В отличие от задач с короткими ответами или олимпиадного типа, эти задачи требуют выстраивания комплексных логических цепочек в специализированных областях, а их правильность сложно установить без экспертной оценки. Авторы задач First Proof являются ведущими экспертами в своих областях, и по меньшей мере пара задач оставались нерешенными в течение многих лет до того, как авторы нашли к ним подходы. Академический отдел, чья специализация тесно пересекается с данными предметными областями, теоретически мог бы решить многие из этих задач за одну неделю.
Мы опубликовали наши попытки доказательств в субботу, 14 февраля 2026 года, в 12:00 по тихоокеанскому времени. Основываясь на отзывах экспертов, мы полагаем, что по меньшей мере пять предложенных моделью вариантов (задачи № 4, 5, 6, 9 и 10) имеют высокие шансы оказаться верными, в то время как несколько других всё ещё находятся на рассмотрении. Изначально мы считали, что наше решение задачи № 2, скорее всего, было правильным. Опираясь на официальные комментарии организаторов First Proof и дальнейший анализ экспертного сообщества, теперь мы полагаем, что оно ошибочно. Мы признательны за проявленный интерес и с нетерпением ждем дальнейшего обсуждения. Полный набор наших доказательств можно найти здесь. Препринт включает все десять попыток доказательств, а также недавно добавленное приложение с паттернами промптов и примерами, призванными продемонстрировать наше ручное взаимодействие с моделями в процессе работы.
Мы убеждены, что новаторские фундаментальные исследования — это, пожалуй, важнейший способ оценки возможностей ИИ-моделей следующего поколения. Бенчмарки полезны, но они могут упускать из виду некоторые из самых сложных аспектов исследований: поддержание длинных цепочек рассуждений, выбор правильных абстракций, работу с неоднозначностью в формулировках задач и построение аргументов, способных выдержать строгую экспертную проверку. Сложные задачи на переднем крае науки, такие как First Proof, помогают нам тестировать эти возможности в условиях, когда правильность нетривиальна для верификации, а сценарии сбоев несут в себе полезную информацию.
«В настоящее время мы обучаем новую модель, одной из главных задач которой является повышение уровня строгости рассуждений. Цель состоит в том, чтобы модель могла непрерывно размышлять в течение многих часов и сохранять высокую уверенность в своих выводах. Когда были объявлены задачи First Proof, это показалось идеальным полигоном для испытаний, и за выходные я решил попробовать свои силы. Модель уже смогла решить две задачи (№ 9 и № 10). По мере обучения её возможности росли, и в итоге она решила — по нашим оценкам — по меньшей мере еще три. Мы были особенно рады, когда она справилась с задачей № 6, а два дня спустя — с задачей № 4, так как эти проблемы были из областей, хорошо знакомых многим из нас. Невероятно наблюдать, как модель изо дня в день становится заметно умнее».
— Джеймс Р. Ли (исследователь OpenAI, направление рассуждений)
Мы запускали модель при минимальном вмешательстве человека. При формировании запросов к разным версиям модели в процессе обучения мы иногда предлагали повторить стратегии, которые казались перспективными в предыдущих попытках. В некоторых случаях мы просили модель расширить или прояснить части доказательства после получения отзывов экспертов, чтобы логику было проще проверить. Мы также использовали ChatGPT для верификации, форматирования и улучшения стиля. Для некоторых задач мы представляем лучший из нескольких вариантов, выбранный на основе человеческого суждения. Это был стремительный спринт, и наш процесс был не столь упорядоченным, каким бы нам хотелось видеть его в условиях надлежащим образом контролируемой оценки. Мы с нетерпением ждем обсуждения с организаторами First Proof более строгого эксперимента и структуры оценки для будущих итераций.
Эта работа опирается на предыдущие результаты применения передовых моделей для рассуждений в математике и естественных науках. В июле 2025 года мы достигли результатов уровня золотой медали на Международной математической олимпиаде с помощью универсальной модели рассуждений (35 из 42 баллов). В ноябре 2025 года мы поделились материалом »Первые эксперименты по ускорению науки с помощью GPT‑5» — серией тематических исследований, в которых GPT‑5 помогла исследователям добиться конкретного прогресса в математике, физике, биологии и других областях, а также рассказали об обнаруженных ограничениях. Совсем недавно мы сообщили о сотрудничестве в области физики, в рамках которого GPT‑5.2 предложила кандидатное выражение для формулы амплитуды глюонов, которое затем было формально доказано внутренней моделью и верифицировано авторами.
Мы рассчитываем на более тесное взаимодействие с сообществом по вопросам оценки рассуждений исследовательского уровня, включая экспертные отзывы на эти попытки, и рады возможности внедрить эти новые возможности в будущих общедоступных моделях.
Автор
Полный текст статьи читайте на OpenAI
