Предварительный просмотр GPT‑5.6 Sol: модель нового поколения

_.png?w=1600&h=900&fit=fill
Читать публикацию о запуске

Мы начинаем ограниченный предварительный просмотр моделей серии GPT‑5.6: флагманской модели Sol; Terra — сбалансированной модели для повседневной работы; и Luna — быстрой и доступной модели. Terra обладает конкурентоспособной производительностью по сравнению с GPT‑5.5, будучи при этом в 2 раза дешевле, а Luna обеспечивает высокую производительность при минимальных затратах.

GPT‑5.6 Sol выпускается с набором средств обеспечения безопасности, самым надежным за всю историю компании. Мы усилили защиту от действий повышенного риска, опасных киберзапросов и многократного нецелевого использования, а также в течение нескольких недель выявляли уязвимости, проводили стресс-тестирование нашей системы и укрепляли ее защиту от атак из реального мира.

Мы выступаем за широкий доступ и планируем сделать модели GPT‑5.6 Sol, Terra и Luna общедоступными в ближайшие недели. В рамках нашего постоянного взаимодействия с правительством США мы предварительно представили наши планы и возможности моделей перед сегодняшним запуском. По их просьбе мы начинаем с ограниченного предварительного просмотра для небольшой группы доверенных партнеров, участие которых согласовано с правительством, прежде чем проводить более широкий релиз. В ходе этого предварительного просмотра мы продолжим тестирование и тесное взаимодействие с партнерами, продвигаясь к более широкой доступности. Мы считаем, что подобный процесс правительственного доступа не должен стать долгосрочной нормой. Он лишает лучших инструментов пользователей, разработчиков, предприятия, специалистов по киберзащите и глобальных партнеров, которым они необходимы. Мы предпринимаем этот краткосрочный шаг, так как считаем его наиболее надежным путем к более широкой доступности в ближайшие недели, одновременно работая с Администрацией над созданием базы для Указа по кибербезопасности (Executive Order) и повторяемого процесса для будущих релизов моделей.

Возможности

GPT‑5.6 Sol — наша самая мощная модель на сегодняшний день. Чтобы дать представление о производительности модели, мы публикуем набор оценок, подчеркивающих улучшенные возможности агентов в области написания кода, биологии и кибербезопасности. Дополнительные оценки безопасности и готовности доступны в нашем системном паспорте. Мы поделимся расширенным пакетом результатов оценки, когда сделаем модель общедоступной.

В GPT‑5.6 мы представляем новую процедуру рассуждения max, которая дает Sol максимум времени для глубоких размышлений. Кроме того, мы внедряем новый режим ultra, который выходит за рамки возможностей одного агента за счет использования субагентов для ускорения выполнения сложных задач.

В задачах, связанных с написанием кода, GPT‑5.6 Sol устанавливает новый уровень производительности в бенчмарке Terminal‑Bench 2.1, который проверяет работу с командной строкой, требующую планирования, итераций и координации инструментов.

GPT‑5.6 Sol также демонстрирует значительные улучшения в биологических исследованиях. В тесте GeneBench v1, который оценивает долгосрочные геномные и количественно-биологические анализы, модель показывает лучшие результаты, чем GPT‑5.5, используя при этом меньше токенов.

GPT‑5.6 Sol — наша самая мощная модель в области кибербезопасности. Она расширяет границы соотношения производительности и эффективности для долгосрочных задач безопасности, включая исследование уязвимостей и эксплуатацию. В тесте ExploitBench² модель GPT‑5.6 Sol не уступает Mythos Preview, расходуя при этом всего около ⅓ выходных токенов. В бенчмарке ExploitGym3, созданном исследователями из Калифорнийского университета в Беркли в сотрудничестве с OpenAI и другими передовыми лабораториями, модели GPT‑5.6 Sol, Terra и Luna демонстрируют существенное улучшение кибервозможностей по мере усиления рассуждений.

Расширенные кибервозможности с более надежными средствами защиты

Мы разработали GPT‑5.6 Sol, Terra и Luna с нашими самыми надежными средствами защиты на сегодняшний день, конфигурации которых соответствуют возможностям каждой модели. По мере роста возможностей модели мы проектируем систему безопасности так, чтобы она все лучше противостояла реальному давлению со стороны злоумышленников, сохраняя при этом доступ к легитимной работе — такой как проверка кода, исследование уязвимостей, разработка патчей, отладка, обучение безопасности и защитное тестирование. Наша цель — сделать запрещенную наступательную деятельность более сложной, неопределенной и обнаруживаемой без неоправданного ограничения этих полезных сценариев использования. Основываясь на нашей оценке модели и средств защиты, мы ожидаем значительной пользы для легитимной защитной работы при существенном ограничении запрещенного наступательного применения.

GPT‑5.6 Sol лучше помогает людям находить и исправлять уязвимости, чем надежно проводить сквозные атаки. По мере дальнейшего развития этих возможностей нашим приоритетом является обеспечение того, чтобы они попадали к защитникам и приносили им пользу — тем, кто может использовать эти инструменты для поиска слабых мест, разработки патчей и общего укрепления систем.

GPT‑5.6 Sol не пересекает критический порог в сфере кибербезопасности (Cyber Critical) в соответствии с нашей методологией готовности (Preparedness Framework). В ходе оценки с использованием Chromium и Firefox модель обнаружила ошибки и примитивы эксплуатации (строительные блоки эксплойта), но не смогла автономно создать рабочий полноцепочечный эксплойт в проверенных условиях. Тем не менее пороговые значения бенчмарков не могут учесть все возможные способы использования модели или ее комбинации с другими инструментами. Эта неопределенность, наряду с общим качественным скачком возможностей модели, является причиной того, что мы объединяем расширенные возможности модели с более надежными мерами безопасности и поэтапным релизом. Подробную информацию о наших мерах защиты мы публикуем в системном паспорте превью GPT‑5.6.

Многоуровневый стек средств защиты

Ни одно отдельное средство защиты не является достаточным против целенаправленного или адаптивного злоупотребления. В превью GPT‑5.6 мы используем многоуровневые средства защиты (точные конфигурации различаются в зависимости от моделей) и подвергаем их стресс-тестированию на предмет реальных атак. Они включают в себя встроенные в модель средства защиты, проверки в реальном времени в процессе генерации, сигналы на уровне учетной записи, дифференцированный доступ, мониторинг, принудительное исполнение правил и непрерывное тестирование.

Модель GPT‑5.6 обучена отказывать в предоставлении запрещенной помощи в киберсфере, в том числе когда пользователи пытаются замаскировать свои намерения или обойти защиту (джейлбрейк). Эти защитные механизмы на уровне модели создают первую границу вокруг того, в чем модель должна и не должна помогать.

Классификаторы киберугроз и биологических рисков в режиме реального времени обеспечивают еще один уровень, оценивая результат по мере его генерации. В случаях повышенного риска при обнаружении потенциального нарушения генерация может быть приостановлена, пока более крупная модель рассуждений проверяет диалог и его контекст. Если результат оценивается как недопустимый, он блокируется до того, как попадет к пользователю.

Помеченная активность также может инициировать проверку на уровне учетной записи по связанным диалогам и сигналам риска в соответствии с нашими условиями и политиками в отношении хранения и проверки контента. Выход за рамки отдельного диалога помогает нашим системам отличать устойчивое вредоносное поведение от легитимной работы по обеспечению безопасности двойного назначения, где похожие технические концепции могут появляться в совершенно разных контекстах.

В совокупности эти уровни делают общий подход более надежным, чем любое отдельное средство защиты само по себе. Поведение модели снижает вероятность вредоносных ответов, системы реального времени могут вмешиваться во время генерации, проверка на уровне учетной записи позволяет выявлять более масштабные паттерны, а дифференцированный доступ сохраняет важную защитную работу, не делая наиболее чувствительные возможности общедоступными по умолчанию.

Особенно в период предварительного просмотра пользователи могут столкнуться с защитными механизмами, которые блокируют или отклоняют некоторые запросы. Другие запросы могут занимать больше времени из-за приостановки генерации для дополнительной проверки. Средства защиты могут время от времени вмешиваться в легитимную работу, особенно в областях двойного назначения, где защитная и наступательная деятельность на первый взгляд может выглядеть одинаково.

Это часть того, для тестирования чего предназначен предварительный просмотр. Мы хотим понять не только то, ограничивают ли средства защиты злоупотребления, но и могут ли легитимные пользователи по-прежнему надежно и эффективно выполнять обычную работу. Отзывы в ходе превью помогут нам сократить количество ненужных блокировок и задержек, улучшить интерпретацию контекста средствами защиты и обеспечить более плавный опыт перед более широким релизом.

Мы также работаем с корпоративными клиентами над долгосрочными подходами, включая обнаружение с сохранением конфиденциальности, средства управления безопасностью под управлением клиента и доступ, откалиброванный с учетом риска клиента, пользователя или рабочей нагрузки, чтобы повысить безопасность при соблюдении корпоративных требований к конфиденциальности.

Повышение устойчивости с помощью автоматизированного ред-тиминга

Средства защиты также должны оставаться эффективными, когда злоумышленники адаптируют свои тактики. Защита, которая работает только на фиксированном наборе известных атак, недостаточно надежна для передовой модели.

Именно поэтому мы направляем на обеспечение безопасности больше интеллектуальных ресурсов и вычислительной мощности, чем когда-либо прежде, используя наши собственные модели для поиска уязвимостей и более быстрого совершенствования средств защиты. Мы выделили более 700 000 часов GPU в эквиваленте A100 на автоматизированный ред-тиминг (red teaming), нацеленный на поиск универсальных обходов защиты: атак, способных работать во многих промптах или контекстах, а не только в одной узкой среде. Сосредоточение внимания на этих более сложных, общих атаках позволило нам протестировать средства защиты за пределами фиксированного набора известных сбоев. Это также позволяет нам исследовать гораздо больше паттернов атак, чем способно охватить исключительно ручное тестирование, выявлять паттерны сбоев на более ранних этапах и сокращать путь от обнаружения уязвимости до ее устранения.

В дополнение к автоматизированному ред-тимингу мы сотрудничали со сторонними тестерами для проведения масштабного экспертного ручного ред-тиминга, который продолжится и в период превью. Ручной ред-тиминг дополняет автоматизированную работу, тестируя средства защиты против творческих экспертов, пытающихся злоупотребить моделью способами, которые наши системы могут не предвидеть.

Ни одна оценка не может охватить каждую конфигурацию продукта, многоэтапную атаку или рабочий процесс реального мира. Поэтому мы поддерживаем процесс быстрого реагирования для воспроизведения, оценки, приоритизации и устранения вновь обнаруженных обходов защиты, а затем добавляем их в наши текущие оценки, чтобы иметь возможность тестировать систему на аналогичные сбои в будущем.

Доступность и цены

Во время превью модели GPT‑5.6 будут первоначально доступны через API и Codex для избранной группы доверенных партнеров и организаций. В скором времени мы планируем сделать их более широко доступными для пользователей ChatGPT, Codex и API.

В этой новой системе наименований, представленной в GPT‑5.6, число обозначает поколение модели, в то время как Sol, Terra и Luna обозначают устойчивые уровни возможностей, которые могут развиваться в собственном темпе. В совокупности это семейство предоставляет пользователям и разработчикам более четкий выбор в отношении интеллекта, скорости и стоимости.

Модели GPT‑5.6 оцениваются из расчета за 1 млн токенов для трех размеров моделей: Sol стоит $5 за ввод / $30 за вывод; Terra стоит $2,50 за ввод / $15 за вывод; и Luna стоит $1 за ввод / $6 за вывод. GPT‑5.6 также представляет более предсказуемое кэширование промптов, включая поддержку явных контрольных точек кэша и минимальное время жизни кэша в 30 минут. Для GPT‑5.6 и более поздних моделей запись в кэш тарифицируется по ставке, в 1,25 раза превышающей тариф модели для ввода без кэширования, в то время как чтение из кэша продолжает получать скидку 90% на кэшированный ввод.

Мы также запускаем GPT‑5.6 Sol на Cerebras со скоростью до 750 токенов в секунду в июле, предоставляя передовой интеллект клиентам с беспрецедентной скоростью. По мере расширения емкости доступ первоначально будет ограничен для избранных клиентов.

Мы рады продолжить обучение на основе этого периода предварительного просмотра и вскоре представить GPT‑5.6 Sol, Terra и Luna более широкой аудитории.

1. Мы оцениваем задержку (latency) и стоимость API, анализируя поведение наших моделей в продакшене и моделируя автономную работу. Эти оценки учитывают детали вызовов инструментов, выбранные токены и входные токены. Реальные результаты могут существенно отличаться и зависят от многих факторов, не учтенных в нашей симуляции. Мы симулируем задержку на высоких скоростях API и стоимость по стандартным расценкам API.

2. Все модели оцениваются с использованием обертки API ExploitBench с 5 сидами (seeds) и непрерывностью рассуждений.

3. Мы запустили ExploitGym на нашем альфа-API, который выдает ответы быстрее, чем наш публичный API, а затем выполнили пересчет для соответствия публичному API. При пересчете задержек до скоростей, ожидаемых для нашего публичного API, это приводит к тому, что некоторые расчетные задержки превышают лимиты времени в 2 и 6 часов, несмотря на то, что они корректно соблюдались во время прогона оценки. Для получения более высокой скорости при работе, чувствительной ко времени, мы предлагаем приоритетную обработку⁠ в API и быстрый режим⁠ в Codex.

4. Модели без указанных выходных токенов, задержки или стоимости отображаются на графике в виде горизонтальных пунктирных линий.

Автор

OpenAI

Полный текст статьи читайте на OpenAI