Развитие науки и математики с помощью GPT‑5.2

GPT-5.2_MathScience_16x9__1_.png?w=1600&

GPT‑5.2 — наша самая мощная модель для работы в области математики и науки.

Читать научную статью

Одна из наших надежд, связанных с развитием мощного ИИ, заключается в том, что он ускорит научные исследования на благо каждого, помогая ученым изучать больше идей, быстрее проверять их и воплощать открытия в реальные результаты.

В течение прошлого года мы тесно сотрудничали с учеными в области математики, физики, биологии и компьютерных наук, чтобы понять, где ИИ может помочь, а где он все еще несовершенен. В прошлом месяце мы опубликовали статью, в которой собраны первые примеры применения GPT-5 в математике, физике, биологии, компьютерных науках, астрономии и материаловедении, показывающие, что GPT-5 уже начала вносить свой вклад в реальные научные исследования. С выходом GPT‑5.2 мы начинаем замечать, что эти достижения становятся более стабильными и надежными.

Повышенная производительность там, где важна точность

GPT‑5.2 Pro и GPT‑5.2 Thinking — наши самые мощные на сегодняшний день модели для научной и математической работы.

Прочные навыки математических рассуждений лежат в основе надежности научной и технической работы. Они позволяют моделям следовать многошаговой логике, поддерживать согласованность величин и избегать скрытых ошибок, которые могут накапливаться в ходе реального анализа — от симуляций и статистики до прогнозирования и моделирования. Улучшения в таких бенчмарках, как FrontierMath, отражают не узкий навык, а более сильное общее мышление и способность к абстракции — возможности, которые напрямую переносятся в такие научные рабочие процессы, как написание кода, анализ данных и проектирование экспериментов.

Эти возможности также тесно связаны с прогрессом на пути к общему искусственному интеллекту (AGI). Система, способная надежно рассуждать с помощью абстракций, сохранять последовательность на протяжении длинных цепочек мыслей и обобщать данные в различных областях, демонстрирует черты, фундаментальные для AGI — не специфические для конкретных задач трюки, а широкие, переносимые навыки рассуждения, которые имеют значение в науке, инженерии и принятии решений в реальном мире.

Мы считаем, что GPT‑5.2 Pro и GPT‑5.2 Thinking — лучшие в мире модели для помощи ученым и ускорения их работы. В бенчмарке GPQA Diamond, представляющем собой вопросы и ответы университетского уровня сложности, устойчивые к поиску в Google, GPT‑5.2 Pro достигает результата в 93,2%, за ней следует GPT‑5.2 Thinking с показателем 92,4%.

В GPQA Diamondмодели отвечают на вопросы с вариантами ответов по физике, химии и биологии. Инструменты не использовались, а уровень усилий на рассуждения был установлен на максимум.

В FrontierMath (уровни 1–3), тесте по математике экспертного уровня, GPT‑5.2 Thinking установила новый рекорд, решив 40,3% задач.

В FrontierMathмодели решают математические задачи экспертного уровня. Был включен инструмент Python, а уровень усилий на рассуждения установлен на максимум.

Пример из практики

GPT‑5.2 сильна не только в решении научных задач университетского уровня. Теперь мы регулярно видим, как наши передовые модели предлагают решения ранее нерешенных и все более тонких задач в математике и естественных науках.

В этом примере мы описываем, как GPT‑5.2 Pro помогла решить открытую исследовательскую задачу в теории статистического обучения, описанную в новой статье On Learning-Curve Monotonicity for Maximum Likelihood Estimators («О монотонности кривых обучения для оценок максимального правдоподобия»).

Вопрос («Если вы собираете больше данных, становятся ли ваши результаты надежно лучше?») возникает всякий раз, когда вы обучаете модель на данных. Вы можете построить кривую обучения, которая отслеживает среднюю ошибку по мере добавления новых примеров. В лучшем случае кривая является монотонной. Больше данных означает меньше ошибок на каждом шаге. Именно такого поведения люди ожидают и часто предполагают.

Но за последние несколько лет исследователи поняли, что эта интуиция может подводить. Направление исследований, заложенное открытой задачей, поставленной на Конференции по теории обучения (COLT) в 2019 году Вирингом (Viering), Мей (Mey) и Лугом (Loog), показало, что ответ часто оказывается отрицательным. Даже очень простые и «послушные» модельные установки могут иметь немонотонные кривые обучения, когда добавление данных увеличивает ожидаемую ошибку. Этот сюрприз вызвал волну последующих публикаций. В них был расширен список условий, при которых происходят такие развороты, и предложены все более сложные методы, призванные восстановить монотонное поведение.

Тем не менее, один из самых базовых случаев оставался неразрешенным. Что происходит в самой чистой учебной ситуации, когда статистическая модель фактически верна, а данные подчиняются привычному закону нормального распределения (кривой колокола) с известным средним, но неизвестным стандартным отклонением? Исследователи уже знали, что небольшие изменения в этой настройке могут нарушить монотонное поведение. Но для этого ключевого случая ответ оставался неизвестным.

Наша новая статья демонстрирует, что в этих идеальных условиях интуиция торжествует: обучение предсказуемо улучшается с ростом объема данных, а не ведет себя неожиданным или нестабильным образом. Необычность этой статьи заключается в том, как было получено доказательство. Авторы не разрабатывали стратегию, а затем не просили модель заполнить пропущенные шаги. Они не предоставляли промежуточных аргументов или наброска доказательства. Вместо этого они попросили GPT‑5.2 Pro напрямую решить открытую задачу, а затем тщательно проверили доказательство, включая рецензирование и валидацию внешними профильными экспертами.

Затем авторы задали простые дополнительные вопросы, чтобы проверить, насколько далеко может зайти эта идея. GPT‑5.2 Pro распространила результат за пределы исходной задачи на пространства более высокой размерности и другие распространенные статистические модели. На протяжении всего процесса роль человека сводилась к проверке и ясности изложения, а не к созданию математического каркаса.

Взгляд в будущее

Этот результат указывает на перспективное направление того, как системы искусственного интеллекта могут поддерживать научные исследования, особенно в областях с аксиоматическими теоретическими основами, таких как математика и теоретическая информатика. В подобных условиях передовые модели могут помочь в исследовании доказательств, проверке гипотез и выявлении связей, на обнаружение которых у человека могло бы уйти много сил.

В то же время эти системы не являются самостоятельными исследователями. Экспертная оценка, верификация и понимание предметной области остаются необходимыми условиями. Даже очень способные модели могут совершать ошибки или опираться на невысказанные предположения. Но они также способны выдавать детальные, структурированные аргументы, которые заслуживают тщательного изучения и доработки человеком. Достижение надежного прогресса с помощью ИИ поэтому зависит от рабочих процессов, в которых валидация, прозрачность и сотрудничество остаются неотъемлемой частью процесса.

Рассматриваемый как тематическое исследование, этот результат иллюстрирует зарождающийся подход к исследовательской практике. Такие модели, как GPT‑5.2, могут служить инструментом поддержки математических рассуждений и ускорения исследований на ранних этапах, в то время как ответственность за корректность, интерпретацию и контекст остается за исследователями-людьми. При осторожном использовании такие системы могут помочь оптимизировать важнейшие аспекты теоретической работы, не вытесняя при этом центральную роль человеческого суждения в научных изысканиях.

Автор

OpenAI

Полный текст статьи читайте на OpenAI