GPT‑4o mini: развитие экономичного интеллекта

Представляем нашу самую экономичную небольшую модель
OpenAI стремится сделать искусственный интеллект максимально доступным. Сегодня мы анонсируем GPT‑4o mini — нашу самую экономичную небольшую модель. Мы ожидаем, что GPT‑4o mini значительно расширит спектр приложений на базе ИИ, сделав интеллектуальные технологии гораздо более доступными по цене. GPT‑4o mini набирает 82% в тесте MMLU и в настоящее время превосходит GPT‑41 по предпочтениям пользователей в чатах согласно рейтингу LMSYS. Ее стоимость составляет 15 центов за миллион входных токенов и 60 центов за миллион выходных токенов, что на порядок дешевле предыдущих передовых моделей и более чем на 60% дешевле GPT‑3.5 Turbo.
GPT‑4o mini обеспечивает выполнение широкого спектра задач благодаря своей низкой стоимости и задержке. Она отлично подходит для приложений, которые объединяют или распараллеливают вызовы нескольких моделей (например, вызов нескольких API), передают модели большие объемы контекста (например, всю кодовую базу или историю переписки) или взаимодействуют с клиентами посредством быстрых текстовых ответов в реальном времени (например, чат-боты техподдержки).
Сегодня GPT‑4o mini поддерживает текст и работу с изображениями в API, а поддержка ввода и вывода текста, изображений, видео и аудио появится в будущем. Модель имеет окно контекста на 128 тыс. токенов, поддерживает до 16 тыс. выходных токенов на запрос и обладает знаниями по октябрь 2023 года. Благодаря усовершенствованному токенизатору, разделяемому с GPT‑4o, обработка неанглоязычных текстов стала еще более экономичной.
Небольшая модель с превосходным пониманием текста и мультимодальным мышлением
GPT‑4o mini превосходит GPT‑3.5 Turbo и другие небольшие модели в академических бенчмарках как по текстовому интеллекту, так и по мультимодальным рассуждениям, а также поддерживает тот же диапазон языков, что и GPT‑4o. Она также демонстрирует высокую эффективность при вызове функций (function calling), что позволяет разработчикам создавать приложения, которые могут извлекать данные или взаимодействовать с внешними системами, и улучшенную работу с длинным контекстом по сравнению с GPT‑3.5 Turbo.
GPT‑4o mini прошла оценку по нескольким ключевым бенчмаркам2.
Задачи на рассуждение: GPT‑4o mini превосходит другие небольшие модели в задачах на логическое мышление, задействующих как текст, так и зрение, набирая 82,0% в бенчмарке текстового интеллекта и рассуждений MMLU по сравнению с 77,9% у Gemini Flash и 73,8% у Claude Haiku.
Навыки в математике и программировании: GPT‑4o mini отлично справляется с математическими рассуждениями и написанием кода, превосходя предыдущие небольшие модели на рынке. В бенчмарке MGSM, измеряющем математические способности, GPT‑4o mini набрала 87,0% по сравнению с 75,5% у Gemini Flash и 71.7% у Claude Haiku. В тесте HumanEval, оценивающем навыки программирования, GPT‑4o mini показала результат 87,2% против 71,5% у Gemini Flash и 75,9% у Claude Haiku.
Мультимодальные рассуждения: GPT‑4o mini также демонстрирует высокие результаты в MMMU (бенчмарк мультимодальных рассуждений), набирая 59,4% по сравнению с 56,1% у Gemini Flash и 50,2% у Claude Haiku.
Оценки модели по результатам тестов
В процессе разработки модели мы сотрудничали с рядом доверенных партнеров, чтобы лучше понять сценарии использования и ограничения GPT‑4o mini. Мы работали с такими компаниями, как Ramp и Superhuman, которые отметили, что GPT‑4o mini работает значительно лучше, чем GPT‑3.5 Turbo, при решении таких задач, как извлечение структурированных данных из чеков или генерация высококачественных ответов на электронные письма с учетом истории переписки.
Встроенные меры безопасности
Безопасность закладывается в наши модели с самого начала и подкрепляется на каждом этапе разработки. На этапе предварительного обучения мы фильтруем информацию, которую наши модели не должны изучать или воспроизводить (например, язык вражды, контент для взрослых, сайты, специализирующиеся на сборе персональных данных, и спам). На этапе пост-обучения мы настраиваем поведение модели в соответствии с нашими правилами, используя такие методы, как обучение с подкреплением на основе отзывов человека (RLHF), для повышения точности и надежности ответов модели.
GPT‑4o mini имеет те же встроенные средства защиты, что и GPT‑4o. Мы тщательно оценили их с помощью автоматизированных и экспертных проверок в соответствии с нашей концепцией готовности (Preparedness Framework) и в русле наших добровольных обязательств. Более 70 внешних экспертов в таких областях, как социальная психология и дезинформация, тестировали GPT‑4o для выявления потенциальных рисков; мы устранили эти проблемы и планируем поделиться подробностями в готовящейся карточке системы GPT‑4o и отчете о готовности. Выводы экспертных оценок помогли повысить безопасность как GPT‑4o, так и GPT‑4o mini.
Опираясь на полученный опыт, наши команды также работали над повышением безопасности GPT‑4o mini с использованием новых методов, основанных на наших исследованиях. GPT‑4o mini в API стала первой моделью, в которой применен наш метод иерархии инструкций. Это помогает улучшить способность модели противостоять взлому (jailbreak), внедрению промптов (prompt injections) и извлечению системных инструкций. Благодаря этому ответы модели становятся надежнее, а ее использование в масштабных приложениях — безопаснее.
Мы продолжим следить за тем, как используется GPT‑4o mini, и повышать безопасность модели по мере выявления новых рисков.
Доступность и стоимость
GPT‑4o mini теперь доступна как текстовая и мультимодальная модель (с поддержкой зрения) в Assistants API, Chat Completions API и Batch API. Разработчики платят 15 центов за 1 млн входных токенов и 60 центов за 1 млн выходных токенов (что примерно эквивалентно 2500 страницам обычной книги). В ближайшие дни мы планируем запустить поддержку точной настройки (fine-tuning) для GPT‑4o mini.
В ChatGPT пользователи бесплатных тарифов, а также тарифов Plus и Team смогут получить доступ к GPT‑4o mini уже сегодня вместо GPT‑3.5. Корпоративные пользователи (Enterprise) получат доступ на следующей неделе в рамках нашей миссии по обеспечению доступности преимуществ ИИ для всех.
Что дальше
За последние несколько лет мы стали свидетелями выдающихся успехов в развитии интеллекта ИИ в сочетании со значительным снижением затрат. Например, стоимость одного токена в GPT‑4o mini снизилась на 99% по сравнению с text-davinci-003 — менее способной моделью, представленной в 2022 году. Мы намерены и дальше следовать этому курсу: снижать затраты и одновременно расширять возможности моделей.
Мы предвидим будущее, в котором модели будут органично интегрированы в каждое приложение и на каждый веб-сайт. GPT‑4o mini прокладывает разработчикам путь к более эффективному и доступному созданию и масштабированию мощных приложений на базе ИИ. Будущее искусственного интеллекта становится все более доступным, надежным и встроенным в наш ежедневный цифровой опыт, и мы рады продолжать удерживать лидерство в этом направлении.
Автор
Благодарности
Руководители проекта: Джейкоб Меник (Jacob Menick), Кевин Лу (Kevin Lu), Шэнцзя Чжао (Shengjia Zhao), Эрик Уоллес (Eric Wallace), Хунюй Жэнь (Hongyu Ren), Хайтан Ху (Hайtang Hu), Ник Статас (Nick Stathas), Фелипе Петроски Сух (Felipe Petroski Such)
Руководитель программы: Мианна Чен (Mianna Chen)
Вклады участников отмечены на странице https://openai.com/gpt-4o-contributions/
Сноски
- 1
По состоянию на 18 июля 2024 года более ранняя версия GPT-4o mini превосходит GPT-4T 01–25.
- 2
Показатели оценки для GPT-4o mini рассчитаны с использованием нашего репозитория simple-evals с системным промптом ассистента API. Для моделей конкурентов мы берем максимальное значение из их заявленных цифр (если таковые имеются), таблицы лидеров HELM и результатов нашей собственной репликации через simple-evals.
Полный текст статьи читайте на OpenAI
