Мышление с помощью изображений

OpenAI o3 и o4-mini — это новейшие модели визуального рассуждения в нашей серии o. Впервые наши модели способны не просто видеть изображения, но и мыслить с их помощью в ходе формирования цепочки рассуждений.
Подобно нашей более ранней модели OpenAI o1, o3 и o4-mini обучены дольше размышлять перед выдачей ответа и используют продолжительную внутреннюю цепочку рассуждений. Модели o3 и o4-mini расширяют эту возможность, задействуя в рассуждениях изображения. Это достигается за счет трансформации загруженных пользователем картинок с помощью специальных инструментов, позволяющих кадрировать их, приближать, поворачивать и применять другие простые методы обработки. Что еще важнее, эти функции работают «из коробки», без необходимости использовать отдельные специализированные модели.
Усовершенствованный визуальный интеллект ChatGPT помогает решать более сложные задачи, анализируя изображения тщательнее, точнее и надежнее, чем когда-либо прежде. Он может бесшовно объединять продвинутые рассуждения с такими инструментами, как веб-поиск и манипуляции с изображениями — автоматическое масштабирование, кадрирование, отражение или улучшение качества. Это позволяет извлекать полезную информацию даже из несовершенных фотографий. Например, можно загрузить фото набора задач по экономике для получения пошаговых объяснений или поделиться скриншотом ошибки сборки, чтобы быстро провести анализ ее первопричин.
Такой подход открывает новое измерение для масштабирования вычислений во время тестирования (test-time compute scaling), органично объединяя визуальные и текстовые рассуждения. Это находит отражение в их передовой производительности на мультимодальных бенчмарках, что знаменует собой важный шаг на пути к мультимодальным рассуждениям.
Визуальные рассуждения в действии
Мышление с помощью изображений позволяет взаимодействовать с ChatGPT еще проще. Вы можете задавать вопросы с помощью фотографий, не беспокоясь о позиционировании объектов — перевернут ли текст вверх ногами или на одном снимке изображено сразу несколько задач по физике. Даже если объекты не очевидны с первого взгляда, визуальные рассуждения позволяют модели приблизить изображение для лучшего рассмотрения.
Все примеры были выполнены с использованием OpenAI o3.
Наши новейшие модели визуального рассуждения работают в тандеме с другими инструментами, такими как анализ данных на Python, веб-поиск и генерация изображений, творчески и эффективно решая более сложные задачи. Это наш первый опыт предоставления пользователям мультимодального агентного опыта.
Результаты тестирования на бенчмарках
Чтобы продемонстрировать улучшение визуальных рассуждений по сравнению с нашими предыдущими мультимодальными моделями, мы протестировали OpenAI o3 и o4-mini на разнообразном наборе экзаменов для людей и бенчмарков машинного обучения. Эти новые модели визуального рассуждения значительно превосходят своих предшественников на всех протестированных мультимодальных задачах.
Все модели оценивались при высоких настройках «усилий на рассуждение» — аналогично таким вариантам, как «o4-mini-high» в ChatGPT.
В частности, мышление с помощью изображений (без использования веб-поиска) приводит к значительным улучшениям во всех оцениваемых нами бенчмарках восприятия. Наши модели установили новые стандарты производительности в ответах на вопросы по точным наукам, технологии, инженерии и математике (STEM) (MMMU, MathVista), чтении и анализе графиков (CharXiv), базовых элементах восприятия (VLMs are Blind), а также визуальномисследовании (V*). На бенчмарке V* наш подход к визуальным рассуждениям достигает точности 95.7%, фактически исчерпывая сложность данного теста.
Ограничения и дальнейшие шаги
Мышление с помощью изображений в настоящее время имеет следующие ограничения:
- Чрезмерно длинные цепочки рассуждений: Модели могут выполнять избыточные или ненужные вызовы инструментов и шаги по манипуляции с изображениями, что приводит к излишне длинным цепочкам мыслей.
- Ошибки восприятия: Модели по-прежнему могут совершать базовые ошибки восприятия. Даже когда вызовы инструментов корректно продвигают процесс рассуждения, неверная визуальная интерпретация может привести к неверному окончательному ответу.
- Надежность: Модели могут использовать различные процессы визуального рассуждения при множественных попытках решения одной задачи, некоторые из которых могут приводить к неверным результатам.
OpenAI o3 и o4-mini существенно расширяют возможности визуального рассуждения, представляя собой важный шаг к более широким мультимодальным рассуждениям. Эти модели обеспечивают лучшую в своем классе точность в задачах визуального восприятия, позволяя решать вопросы, которые ранее были недосягаемы.
Мы постоянно совершенствуем возможности моделей по рассуждению с использованием изображений, делая их более лаконичными, менее избыточными и более надежными. Мы рады продолжать наши исследования в области мультимодальных рассуждений и ждем, когда пользователи смогут оценить, как эти улучшения помогут им в повседневной работе.
Обновление от 16 апреля: результаты для o3 на бенчмарках Charxiv-r, Mathvista и vlmsareblind были обновлены с учетом изменений системного промпта, отсутствовавших в первоначальной оценке.
Авторы
Участники разработки
Aditya Ramesh, Aidan Clark, Aleksandra Spyra, Alex Tachard Passos, Alexander Kirillov, Ali Kalami, Amy McDonald Sandjideh, Andrei Gheorghe, Andrew Gibiansky, Andrew Tulloch, Angela Baek, Anubha Srivastava, Avital Oliver, Behrooz Ghorbani, Ben Leimberger, Borys Minaiev, Bowen Cheng, Brandon McKinzie, Carpus Chang, Cary Hudson, Casey Chu, Charlotte Cole, Chen Shen, Dan Roberts, Dana Palmie, Daniel Kappler, David Medina, Edmund Wong, Eric Mitchell, Eric Ning, Freddie Sulit, Haiming Bao, Haitang Hu, Hongyu Ren, Hyeonwoo Noh, Jakub Pachocki, James Betker, James Qin, Jamie Kiros, Jason Ai, Jerry Tworek, Jessica Liang, Ji Lin, Jiahui Yu, Jianfeng Wang, Joseph Mo, Kenji Hata, Kevin King, Kristian Georgiev, Kshitij Gupta, Lauren Yang, Li Jing, Lin Yang, Linden Li, Mark Chen, Martin Li, Max Schwarzer, Mia Glaese, Michael Malek, Minnia Feng, Nacho Soto, Nat McAleese, Niko Felix, Peter Faiman, Prafulla Dhariwal, Rajkumar Samuel, Rapha Gontijo Lopes, Ravi Teja Mullapudi, Reiichiro Nakano, Rennie Song, Ricky Xu, Sam Altman, Sean Fitzgerald, Shengjia Zhao, Shengli Hu, Shuchao Bi, Spencer Papay, Szi-chieh Yu, Wenda Zhou, Yang Lu, Yara Khakbaz, Yunxing Dai, Zhishuai Zhang
Полный текст статьи читайте на OpenAI
