Новые инструменты и функции в Responses API

CoT_Art_1x1.png?w=1600&h=900&fit=fill

Сегодня мы добавляем новые встроенные инструменты в Responses API — наш основной программный интерфейс (API) для создания агентных приложений. Это включает поддержку всех удаленных серверов Model Context Protocol (MCP), а также такие инструменты, как генерация изображений, интерпретатор кода (Code Interpreter), и улучшения для поиска по файлам. Эти инструменты доступны в наших сериях моделей GPT-4o, GPT-4.1 и рассуждающих моделях серии OpenAI o. Модели o3 и o4-mini теперь могут вызывать инструменты и функции напрямую в рамках своей цепочки рассуждений (chain-of-thought) в Responses API, выдавая более богатые по контексту и актуальные ответы. Использование o3 и o4-mini с Responses API сохраняет токены рассуждений между запросами и вызовами инструментов, что повышает интеллектуальность моделей и снижает затраты и задержки для разработчиков.

Мы также представляем новые функции в Responses API, которые повышают надежность, прозрачность и конфиденциальность для предприятий и разработчиков. К ним относятся фоновый режим для более надежной и асинхронной обработки долго выполняющихся задач, поддержка сводок рассуждений и поддержка зашифрованных элементов рассуждений

С момента выпуска Responses API в марте 2025 года с такими инструментами, как веб-поиск, поиск по файлам и использование компьютера (computer use), сотни тысяч разработчиков использовали этот API для обработки триллионов токенов в наших моделях. Клиенты использовали API для создания самых разных агентских приложений, в том числе кодинг-агента от Zencoder, рыночного агента экономической разведки для прямых инвестиций и инвестиционного банкинга от Revi и образовательного ассистента от MagicSchool AI — все они используют веб-поиск для извлечения актуальной и релевантной информации в свое приложение. Теперь разработчики могут создавать еще более полезные и надежные агенты благодаря доступу к новым инструментам и функциям, выпущенным сегодня.

Новая поддержка удаленных серверов MCP

Мы добавляем поддержку удаленных серверов MCP в Responses API, продолжая развитие после выпуска поддержки MCP в Agents SDK. MCP — это открытый протокол, который стандартизирует способ предоставления контекста языковым моделям (LLM) со стороны приложений. Поддерживая серверы MCP в Responses API, разработчики смогут подключать наши модели к инструментам, размещенным на любом MCP-сервере, с помощью всего нескольких строк кода. Вот несколько примеров того, как разработчики могут использовать удаленные серверы MCP с Responses API уже сегодня:

Популярные удаленные серверы MCP включают в себя Cloudflare, HubSpot, Intercom, PayPal, Plaid, Shopify, Stripe, Square, Twilio, Zapier и многие другие. Мы ожидаем, что экосистема удаленных серверов MCP будет быстро расти в ближайшие месяцы, что облегчит разработчикам создание мощных агентов, способных подключаться к инструментам и источникам данных, на которые их пользователи уже полагаются. Чтобы наилучшим образом поддержать экосисхему и внести свой вклад в этот развивающийся стандарт, OpenAI также вошла в состав руководственного комитета по MCP.

Чтобы узнать, как запустить собственный удаленный сервер MCP, ознакомьтесь с этим руководством от Cloudflare. Чтобы узнать, как использовать инструмент MCP в Responses API, ознакомьтесь с этим руководством в нашем API Cookbook.

Обновления генерации изображений, интерпретатора кода и поиска по файлам

Благодаря встроенным инструментам в Responses API разработчики могут легко создавать более способных агентов с помощью всего одного вызова API. Вызывая несколько инструментов в процессе рассуждения, модели теперь демонстрируют значительно более высокую производительность вызова инструментов в стандартных для отрасли бенчмарках, таких как Humanity«s Last Exam (источник). Сегодня мы добавляем новые инструменты, в том числе:

  • Генерация изображений: Помимо использования Images API, разработчики теперь могут получить доступ к нашей новейшей модели генерации изображенийgpt-image-1—в качестве инструмента в Responses API. Этот инструмент поддерживает потоковую передачу в реальном времени, позволяя разработчикам видеть превью изображения в процессе его создания, и многошаговое редактирование, позволяющее давать модели запросы на детальную доработку этих изображений шаг за шагом. Узнать больше.
  • Интерпретатор кода (Code Interpreter): Разработчики теперь могут использовать инструмент Code Interpreter в рамках Responses API. Этот инструмент полезен для анализа данных, решения сложных математических и программных задач, а также для помощи моделям в глубоком понимании и манипулировании изображениями (например, мышление с помощью изображений). Способность таких моделей, как o3 и o4-mini, использовать инструмент Code Interpreter в своей цепочке рассуждений привела к повышению производительности в ряде бенчмарков, включая Humanity«s Last Exam (источник). Узнать больше.
  • Поиск по файлам (File search): Разработчики теперь могут получить доступ к инструменту file search в наших рассуждающих моделях. Поиск по файлам позволяет разработчикам извлекать релевантные фрагменты своих документов в контекст модели на основе пользовательского запроса. Мы также представляем обновления для инструмента поиска по файлам, которые позволяют разработчикам выполнять поиск по нескольким векторным хранилищам и поддерживают фильтрацию атрибутов с помощью массивов. Узнать больше.

Новые функции в Responses API

В дополнение к новым инструментам мы также добавляем поддержку новых функций в Responses API, в том числе:

  • Фоновый режим (Background mode): Как видно в таких агентных продуктах, как Codex, deep research и Operator, рассуждающим моделям может потребоваться несколько минут для решения сложных задач. Разработчики теперь могут использовать фоновый режим для создания аналогичных сценариев на таких моделях, как o3, не беспокоясь о тайм-аутах или других проблемах с подключением — фоновый режим запускает эти задачи асинхронно. Разработчики могут либо опрашивать эти объекты на предмет завершения, либо запускать потоковую передачу событий всякий раз, когда их приложению требуется получить актуальное состояние. Узнать больше.

Python

1
response = client.responses.create(
2
model="o3",
3
input="Write me an extremely long story.",
4
reasoning={ "effort": "high" },
5
background=True
6
)
  • Сводки рассуждений (Reasoning summaries): Responses API теперь может генерировать краткие сводки внутренней цепочки рассуждений модели на естественном языке, аналогичные тем, что вы видите в ChatGPT. Это облегчает разработчикам отладку, аудит и создание более качественного пользовательского опыта. Сводки рассуждений доступны без дополнительной платы. Узнать больше.

Python

1
response = client.responses.create(
2
model="o4-mini",
3
tools=[
4
{
5
"type": "code_interpreter",
6
"container": {"type": "auto"}
7
}
8
],
9
instructions=(
10
"You are a personal math tutor. "
11
"When asked a math question, run code to answer the question."
12
),
13
input="I need to solve the equation `3x + 11 = 14`. Can you help me?",
14
reasoning={"summary": "auto"}
15
)
  • Зашифрованные элементы рассуждений (Encrypted reasoning items): Клиенты, имеющие право нанулевое хранение данных (ZDR), теперь могут повторно использовать элементы рассуждений в разных запросах API — без сохранения каких-либо элементов рассуждений на серверах OpenAI. Для таких моделей, как o3 и o4-mini, повторное использование элементов рассуждений между вызовами функций повышает интеллектуальность, сокращает использование токенов и увеличивает показатели попадания в кэш, что приводит к снижению затрат и задержек. Узнать больше.

Python

1
response = client.responses.create(
2
model="o3",
3
input="Implement a simple web server in Rust from scratch.",
4
store=False,
5
include=["reasoning.encrypted_content"]
6
)

Цены и доступность

Все эти инструменты и функции теперь доступны в Responses API и поддерживаются в моделях серий GPT‑4o, GPT‑4.1, а также в наших моделях рассуждений OpenAI o-series (o1, o3, o3‑mini и o4-mini). Генерация изображений поддерживается только в модели o3 нашей линейки моделей рассуждений.

Цены на существующие инструменты остаются прежними. Генерация изображений стоит 5,00 долл. США за 1 млн входных текстовых токенов, 10,00 долл. США за 1 млн входных токенов изображений и 40,00 долл. США за 1 млн выходных токенов изображений (предоставляется скидка 75% на кэшированные входные токены). Интерпретатор кода (Code Interpreter) стоит 0,03 долл. США за контейнер. Поиск по файлам стоит 0,10 долл. США за 1 ГБ векторного хранилища в день и 2,50 долл. США за 1 тыс. вызовов инструментов. Вызовы удаленного инструмента сервера MCP не требуют дополнительных затрат — вы платите только за выходные токены из API. Узнайте больше о ценообразовании в нашей документации.

Мы с нетерпением ждем возможности увидеть, что вы создадите!

Автор

OpenAI

Полный текст статьи читайте на OpenAI