Добавление поддержки зрительного восприятия в API дообучения
Теперь разработчики могут дообучать GPT‑4o с использованием изображений и текста для улучшения возможностей зрительного восприятия

Обновление от 8 мая 2026 г.: OpenAI сворачивает платформу дообучения (fine-tuning). Платформа больше недоступна новым пользователям, однако существующие пользователи платформы дообучения смогут создавать задачи на обучение в течение ближайших месяцев. Все дообученные модели останутся доступными для инференса до момента устаревания их базовых моделей. Полный график доступен здесь.
Сегодня мы представляем дообучение с поддержкой зрительного восприятия для GPT‑4o
С момента первоначального запуска дообучения для GPT‑4o сотни тысяч разработчиков настраивали наши модели, используя исключительно текстовые наборы данных, чтобы повысить производительность при решении специфических задач. Однако во многих случаях дообучение моделей только на тексте не обеспечивает ожидаемого прироста эффективности.
Как это работает
Процесс дообучения с поддержкой зрения аналогичен текстовому дообучению: разработчики могут подготовить наборы данных изображений в соответствии с надлежащим форматом, а затем загрузить этот набор данных на нашу платформу. Они могут улучшить производительность GPT‑4o в задачах компьютерного зрения, используя всего 100 изображений, и добиться еще более высоких результатов при большем объеме текстовых и визуальных данных.
JSON
1{2 "messages": [3 { "role": "system", "content": "You are an assistant that identifies uncommon cheeses." },4 { "role": "user", "content": "What is this cheese?" },5 { "role": "user", "content": [6 {7 "type": "image_url",8 "image_url": {9 "url": "https://upload.wikimedia.org/wikipedia/commons/3/36/Danbo_Cheese.jpg"10 }11 }12 ] 13 },14 { "role": "assistant", "content": "Danbo" }15 ]16}17
Мы сотрудничали с небольшой группой проверенных партнеров, чтобы лучше понять реальные сценарии применения дообучения с поддержкой зрения. Мы рады продемонстрировать несколько примеров того, что им удалось создать.
Grab улучшает распознавание и понимание изображений на дороге
Grab, ведущая компания по доставке еды и заказу поездок, преобразует панорамные снимки улиц, собранные их водителями, в картографические данные. Эти данные используются для работы сервиса GrabMaps, который обеспечивает функционирование всех их операций в Юго-Восточной Азии. Используя дообучение с поддержкой зрения всего на 100 примерах, компания Grab научила GPT‑4o корректно определять местоположение дорожных знаков и подсчитывать разделительные полосы для оптимизации своих картографических данных. В результате Grab смогла улучшить точность подсчета полос движения на 20% и точность локализации знаков ограничения скорости на 13% по сравнению с базовой моделью GPT‑4o, что позволило автоматизировать картографические процессы, ранее выполнявшиеся вручную.

Пример знака ограничения скорости, успешно распознанного дообученной моделью GPT‑4o с поддержкой зрения, который был ошибочно помечен базовой моделью GPT‑4o.
Automat повышает успешность работы десктопных ботов для автоматизации бизнес-процессов
Automat, компания в сфере корпоративной автоматизации, разрабатывает десктопные и веб-агенты, которые обрабатывают документы и выполняют действия на основе интерфейса пользователя (UI) для автоматизации бизнес-процессов. С помощью дообучения с поддержкой зрения и набора данных, состоящего из снимков экрана, Automat обучила GPT‑4o находить элементы интерфейса на экране по текстовому описанию на естественном языке. Это позволило повысить процент успешных операций их RPA-агента с 16,60% до 61,67%, что означает прирост производительности на 272% по сравнению с базовой GPT‑4o. Кроме того, Automat обучила GPT‑4o всего на 200 изображениях неструктурированных страховых документов, добившись роста F1-меры на 7% в задачах извлечения информации.
Пример успешного определения десктопным ботом центра элементов пользовательского интерфейса с помощью дообучения с поддержкой зрения на снимках веб-сайтов.
Coframe повышает качество создания цифрового контента
Coframe разрабатывает ассистента на базе ИИ для роста и инжиниринга, который помогает компаниям непрерывно создавать и тестировать вариации своих веб-сайтов и пользовательских интерфейсов для оптимизации бизнес-метрик. Ключевой частью этой задачи является автономная генерация новых брендированных разделов сайта на основе остального веб-ресурса. Coframe поручила GPT‑4o генерировать код для следующего раздела сайта на основе изображений и существующего кода. Дообучив GPT‑4o с использованием изображений и кода, они улучшили способность модели генерировать веб-сайты с единым визуальным стилем и корректной версткой на 26% по сравнению с базовой GPT‑4o.

Существующий веб-сайт, которому модель должна соответствовать.

Результат работы базовой модели GPT‑4o.

Результат работы модели GPT‑4o, дообученной на зрительных и текстовых данных, который ближе соответствует стилю страницы.
Безопасность и конфиденциальность
Мы непрерывно проводим автоматизированную оценку безопасности дообученных моделей и отслеживаем их использование, чтобы гарантировать соответствие приложений нашим правилам безопасности. Как и все сервисы API, дообучение с поддержкой зрения подпадает под действие наших обязательств в отношении корпоративной конфиденциальности. Дообученные модели остаются полностью под вашим контролем с полным правом собственности на ваши бизнес-данные. Мы не обучаем наши модели на входных или выходных данных, используемых в этом сервисе, без вашего прямого разрешения.
Доступность и цены
Возможности дообучения с поддержкой зрения доступны сегодня всем разработчикам на платных уровнях использования. Эти функции поддерживаются на последнем снимке (snapshot) модели GPT‑4o — gpt-4o-2024-08-06. Разработчики могут расширить существующие данные для дообучения изображений, используя тот же формат, что и для наших эндпоинтов чата.
Мы предоставляем 1 миллион токенов обучения в день бесплатно до 31 октября 2024 года для дообучения GPT‑4o с использованием изображений. После 31 октября 2024 года обучение в рамках дообучения GPT‑4o будет стоить $25 за 1 млн токенов, а инференс — $3,75 за 1 млн входных токенов и $15 за 1 млн выходных токенов. Входные изображения сначала разбиваются на токены в зависимости от размера изображения, а затем тарифицируются по той же ставке за токен, что и текстовые входы. Более подробную информацию можно найти на странице ценообразования API.
Чтобы начать работу, перейдите в панель управления дообучением, нажмите «Создать» (create) и выберите gpt-4o-2024-08-06 из выпадающего списка базовых моделей. Чтобы узнать, как дообучать GPT‑4o с изображениями, посетите нашу документацию.
Автор
Сноски
Полный текст статьи читайте на OpenAI
