Наши первые отправленные решения математических задач First Proof

oai_Science_First_Proof_SEO_Open_Graph_1

Мы делимся нашими попытками доказательств для First Proof — математического соревнования, созданного для проверки того, способны ли ИИ создавать проверяемые доказательства для задач из узкоспециализированных областей.

Посмотреть наши варианты доказательств

Мы запустили внутреннюю модель на всех 10 задачах First Proof — математического вызова исследовательского уровня, призванного проверить, способны ли системы ИИ выдавать правильные и проверяемые попытки доказательств. В отличие от задач с короткими ответами или олимпиадного типа, эти задачи требуют выстраивания комплексных логических цепочек в специализированных областях, а их правильность сложно установить без экспертной оценки. Авторы задач First Proof являются ведущими экспертами в своих областях, и по меньшей мере пара задач оставались нерешенными в течение многих лет до того, как авторы нашли к ним подходы. Академический отдел, чья специализация тесно пересекается с данными предметными областями, теоретически мог бы решить многие из этих задач за одну неделю.

Мы опубликовали наши попытки доказательств в субботу, 14 февраля 2026 года, в 12:00 по тихоокеанскому времени. Основываясь на отзывах экспертов, мы полагаем, что по меньшей мере пять предложенных моделью вариантов (задачи № 4, 5, 6, 9 и 10) имеют высокие шансы оказаться верными, в то время как несколько других всё ещё находятся на рассмотрении. Изначально мы считали, что наше решение задачи № 2, скорее всего, было правильным. Опираясь на официальные комментарии организаторов First Proof и дальнейший анализ экспертного сообщества, теперь мы полагаем, что оно ошибочно. Мы признательны за проявленный интерес и с нетерпением ждем дальнейшего обсуждения. Полный набор наших доказательств можно найти здесь. Препринт включает все десять попыток доказательств, а также недавно добавленное приложение с паттернами промптов и примерами, призванными продемонстрировать наше ручное взаимодействие с моделями в процессе работы.

Мы убеждены, что новаторские фундаментальные исследования — это, пожалуй, важнейший способ оценки возможностей ИИ-моделей следующего поколения. Бенчмарки полезны, но они могут упускать из виду некоторые из самых сложных аспектов исследований: поддержание длинных цепочек рассуждений, выбор правильных абстракций, работу с неоднозначностью в формулировках задач и построение аргументов, способных выдержать строгую экспертную проверку. Сложные задачи на переднем крае науки, такие как First Proof, помогают нам тестировать эти возможности в условиях, когда правильность нетривиальна для верификации, а сценарии сбоев несут в себе полезную информацию.

«В настоящее время мы обучаем новую модель, одной из главных задач которой является повышение уровня строгости рассуждений. Цель состоит в том, чтобы модель могла непрерывно размышлять в течение многих часов и сохранять высокую уверенность в своих выводах. Когда были объявлены задачи First Proof, это показалось идеальным полигоном для испытаний, и за выходные я решил попробовать свои силы. Модель уже смогла решить две задачи (№ 9 и № 10). По мере обучения её возможности росли, и в итоге она решила — по нашим оценкам — по меньшей мере еще три. Мы были особенно рады, когда она справилась с задачей № 6, а два дня спустя — с задачей № 4, так как эти проблемы были из областей, хорошо знакомых многим из нас. Невероятно наблюдать, как модель изо дня в день становится заметно умнее».

— Джеймс Р. Ли (исследователь OpenAI, направление рассуждений)

Мы запускали модель при минимальном вмешательстве человека. При формировании запросов к разным версиям модели в процессе обучения мы иногда предлагали повторить стратегии, которые казались перспективными в предыдущих попытках. В некоторых случаях мы просили модель расширить или прояснить части доказательства после получения отзывов экспертов, чтобы логику было проще проверить. Мы также использовали ChatGPT для верификации, форматирования и улучшения стиля. Для некоторых задач мы представляем лучший из нескольких вариантов, выбранный на основе человеческого суждения. Это был стремительный спринт, и наш процесс был не столь упорядоченным, каким бы нам хотелось видеть его в условиях надлежащим образом контролируемой оценки. Мы с нетерпением ждем обсуждения с организаторами First Proof более строгого эксперимента и структуры оценки для будущих итераций.

Эта работа опирается на предыдущие результаты применения передовых моделей для рассуждений в математике и естественных науках. В июле 2025 года мы достигли результатов уровня золотой медали на Международной математической олимпиаде с помощью универсальной модели рассуждений (35 из 42 баллов). В ноябре 2025 года мы поделились материалом »Первые эксперименты по ускорению науки с помощью GPT‑5» — серией тематических исследований, в которых GPT‑5 помогла исследователям добиться конкретного прогресса в математике, физике, биологии и других областях, а также рассказали об обнаруженных ограничениях. Совсем недавно мы сообщили о сотрудничестве в области физики, в рамках которого GPT‑5.2 предложила кандидатное выражение для формулы амплитуды глюонов, которое затем было формально доказано внутренней моделью и верифицировано авторами.

Мы рассчитываем на более тесное взаимодействие с сообществом по вопросам оценки рассуждений исследовательского уровня, включая экспертные отзывы на эти попытки, и рады возможности внедрить эти новые возможности в будущих общедоступных моделях.

Автор

OpenAI

Полный текст статьи читайте на OpenAI