Представляем генерацию изображений в 4o
Откройте для себя полезную и ценную генерацию изображений с помощью изначально мультимодальной модели, способной выдавать точные, аккуратные и фотореалистичные результаты.
Эта публикация о запуске устарела.
Актуальную информацию о возможностях работы с изображениями см. здесь:
В OpenAI мы всегда верили, что генерация изображений должна быть базовой функцией наших языковых моделей. Именно поэтому мы встроили наш самый передовой генератор изображений в GPT‑4o. Результат — генерация изображений, которые не просто красивы, но и полезны.
Полезная генерация изображений
От первых наскальных рисунков до современных инфографик — люди использовали визуальные образы для общения, убеждения и анализа, а не просто для украшения. Современные генеративные модели способны создавать сюрреалистичные, захватывающие дух сцены, однако им сложно даются прикладные изображения, которые люди используют для обмена информацией и ее создания. От логотипов до диаграмм — изображения могут передавать точный смысл, если они дополнены символами, отсылающими к общему языку и опыту.
Генерация изображений в GPT‑4o превосходно справляется с точным рендерингом текста, четким следованием промптам и использованием встроенной базы знаний 4o и контекста чата, включая преобразование загруженных изображений или использование их в качестве визуального вдохновения. Эти возможности упрощают создание именно тех изображений, которые вы себе представляете, помогая эффективнее общаться с помощью визуальных средств и превращая генерацию изображений в практичный инструмент, обладающий точностью и мощью.
Улучшенные возможности
Мы обучили наши модели на совместном распределении онлайн-изображений и текста, научив их не просто тому, как изображения соотносятся с языком, но и как они соотносятся друг с другом. В сочетании с интенсивным пост-обучением это позволило получить модель с поразительной визуальной беглостью, способную создавать полезные, согласованные и контекстно-зависимые изображения.
Рендеринг текста
Лучше один раз увидеть, чем сто раз услышать, но иногда добавление нескольких слов в нужном месте может усилить смысл изображения. Способность модели 4o сочетать точные символы с визуальными образами превращает генерацию изображений в инструмент визуальной коммуникации.
Многошаговая генерация
Поскольку генерация изображений теперь является встроенной функцией GPT‑4o, вы можете дорабатывать изображения в ходе естественного диалога. GPT‑4o может опираться на изображения и текст в контексте чата, обеспечивая последовательность на всех этапах. Например, если вы разрабатываете персонажа для видеоигры, его внешность останется согласованной в течение нескольких итераций по мере доработки и экспериментов.
Следование инструкциям
Генерация изображений в GPT‑4o точно следует подробным промптам с вниманием к деталям. В то время как другие системы с трудом справляются с ~5–8 объектами, GPT‑4o может работать с 10–20 различными объектами. Более тесная привязка объектов к их свойствам и взаимосвязям обеспечивает лучший контроль.
Контекстное обучение
GPT‑4o может анализировать загруженные пользователем изображения и учиться на них, органично интегрируя их детали в свой контекст для создания новых изображений.
Знания об окружающем мире
Встроенная генерация изображений позволяет 4o связывать свои знания в тексте и изображениях, в результате чего модель кажется более умной и эффективной.
Фотореализм и стиль
Обучение на изображениях, отражающих огромное разнообразие визуальных стилей, позволяет модели создавать или преобразовывать изображения с высокой степенью убедительности.




](https://images.ctfassets.net/kftzwdyauwt9/2R9czqCiP1nqec6UED0AJd/0f24e9e9299c871ffd3d5b76f5635d16/roope-car.png?w=3840&q=90&fm=webp)






Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.
Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.
Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.
Ограничения
Наша модель не идеальна. Нам известно о ряде ограничений, над устранением которых мы будем работать путем усовершенствования модели после ее первоначального запуска.
Безопасность
В соответствии с нашей спецификацией модели (Model Spec), мы стремимся максимизировать творческую свободу, поддерживая такие ценные варианты использования, как разработка игр, исторические исследования и образование, и при этом поддерживая строгие стандарты безопасности. В то же время по-прежнему крайне важно блокировать запросы, нарушающие эти стандарты. Ниже приведены результаты оценки дополнительных областей риска, в которых мы работаем над обеспечением безопасного контента высокой полезности и поддержкой более широкого творческого самовыражения пользователей.
Происхождение с помощью C2PA и внутренний обратимый поиск
Все сгенерированные изображения содержат метаданные C2PA, которые идентифицируют изображение как созданное с помощью GPT‑4o, в целях обеспечения прозрачности. Мы также создали внутренний поисковый инструмент, который использует технические атрибуты созданных изображений, чтобы помочь проверить, создано ли содержимое нашей моделью.
Блокировка нежелательного контента
Мы продолжаем блокировать запросы на создание изображений, которые могут нарушать наши правила в отношении контента, такие как материалы с изображением сексуального насилия над детьми и сексуальные дипфейки. Когда в контексте фигурируют изображения реальных людей, у нас действуют более строгие ограничения в отношении того, какие изображения могут быть созданы, с особенно надежными средствами защиты от наготы и жестокого насилия. Как и при любом запуске, работа над безопасностью никогда не завершается, а представляет собой постоянную область инвестиций. По мере того как мы будем узнавать больше о реальном использовании этой модели, мы будем соответствующим образом корректировать нашу политику.
Подробнее о нашем подходе читайте в приложении к системной карте GPT‑4o.
Использование рассуждений для обеспечения безопасности
Аналогично нашей работе по сознательному выравниванию (deliberative alignment), мы обучили LLM с возможностью логического рассуждения работать непосредственно на основе написанных человеком и понятных спецификаций безопасности. Мы использовали эту рассуждающую LLM во время разработки, чтобы помочь нам выявлять и устранять двусмысленности в наших правилах. Наряду с нашими мультимодальными достижениями и существующими методами безопасности, разработанными для ChatGPT и Sora, это позволяет нам модерировать как входной текст, так и выходные изображения в соответствии с нашими правилами.
Доступ и доступность
Генерация изображений с помощью 4o становится доступна начиная с сегодняшнего дня для пользователей Plus, Pro, Team и Free в качестве генератора изображений по умолчанию в ChatGPT, а в ближайшее время доступ появится для Enterprise и Edu. Она также доступна для использования в Sora. Для тех, кто хранит в своем сердце особую любовь к DALL·E, к ней по-прежнему можно получить доступ через специальный DALL·E GPT.
Разработчики скоро смогут генерировать изображения с помощью GPT‑4o через API, при этом доступ будет открываться в течение ближайших нескольких недель.
Создание и настройка изображений так же просты, как общение с помощью GPT‑4o — просто опишите, что вам нужно, указав любые детали, такие как соотношение сторон, точные цвета с использованием шестнадцатеричных кодов (hex-кодов) или прозрачный фон. Поскольку эта модель создает более детализированные изображения, рендеринг картинок занимает больше времени, часто до одной минуты.
](https://images.ctfassets.net/kftzwdyauwt9/4mDKmV3ex9OT8wyAFGDAQS/1b0e1baacb80125e1f92e66dbdf1e32a/Alex_Duffy1.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/30DNW3QcEb1BosJhJqPAfA/56e4708045e63d40d5fe31c122da2bfb/August_Kamp_2.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2ukMfLwQHGEnwMbS43M3Hf/6f5fa57419fdc16ca603e41c1ac290ff/August_Kamp_3.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2KZaGKW5emVRwnYBMcMYCP/560cd7d513aed92b4a943b66b6b5e836/August_Kamp_4.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2PVNlktDwuJJgAlrviWfF1/bf374f33e21c41e770068f4f66a22394/August_Kamp_5.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/39oS3hSQqMSqHHNAS0q3DB/0624bcc17a3e7a3fd318a1eb5c63146e/August_Kamp.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/5WdHD3ToXx1mj13bjDhdQh/46c283533309492585f3538a5ed3a2fd/August_Kamp_1_.png?w=3840&q=90&fm=webp)

](https://images.ctfassets.net/kftzwdyauwt9/37BlQeBhtmTAazdT7LyRIU/7e6472d3ba12c22748cf14a670c0a725/Copy_of_Isa.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2pRf2V2Zmd1YF7GfBtfRwG/92ac8188795fcdd4be9152a27a971289/Copy_of_Isa2.png?w=3840&q=90&fm=webp)


](https://images.ctfassets.net/kftzwdyauwt9/2D1UY4SXAHAxN0uCGT4KCd/43da3a5152c1a823fdf2bed6acea5cf8/Derya_Unutmaz1.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/1jRz4YFkVwGIVQC6yz5DJV/af2ed5507df32860b8b82a4a326c437e/Derya2.jpg?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/1hakInZjBH5SENKVLD68Gl/0140eb82eae9e5cd2f1fbc7ef8f5c46c/Derya3.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/3viXLb1u1ZsUXju6gc0Izh/51b37635165df801077399b26e6c0ff5/Elene_6.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/6EoS1QOv0KOi4aESduy0cU/12705b1ca86abce06bf7366f98e9a8c7/Elene_Chekurishvili.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/5sKaN7iVvtLlzGJQtFmfMg/4ef6d51d2e54d4effd3019401401deb1/Elene3.jpeg?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/1iA7pHLA84KDCRIuoG5pTk/ae8e52600bfbd53a10a749dcd78b2382/Elene4.jpeg?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/5MPmWWYE3fDk6M5QSpA0X8/ac729246785fc8d052be4427085bbcda/Elene5.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2CrXaGuZ3fcCIyKNcDaiRr/26fb7c949919a2de82f7b8340ad4e708/Eugenio_Marongiu.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/6JJh92fHC6diXnnj0rz6DP/53a43e30200729a648cfda1faa6328a5/Eugenio2.png?w=3840&q=90&fm=webp)



](https://images.ctfassets.net/kftzwdyauwt9/tZr3EpmNfrkZBQAIYMffM/d85415f7a01a49718adf2509bb9ad8f1/Minh_Do1.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/1TQS4fCbgIOjdnML4u6i5o/bc81b9ff76e503e32b69dbf447a967e6/niceaunties.png?w=3840&q=90&fm=webp)


](https://images.ctfassets.net/kftzwdyauwt9/1TYYxCnSFWzwoEOHJ7OlfC/767ce4ec94b972138598cce0be1e8d79/Roope_2.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/2Gr22uAGGIQjmDBQt2ccKx/620417fa3b9667f7e95a1fd98c692203/Roope_3.png?w=3840&q=90&fm=webp)
](https://images.ctfassets.net/kftzwdyauwt9/5neXFSFNWbbdhruFManjbU/3a084e08790a90af52cb7005372539b9/Roope_Rainisto1.png?w=3840&q=90&fm=webp)







автор работы: Алекс Даффи (Alex Duffy)
автор работы: Алекс Даффи (Alex Duffy)
автор работы: Алекс Даффи (Alex Duffy)
Повтор прямой трансляции
Автор
Руководство
Габриэль Го (Gabriel Goh): Генерация изображений
Джеки Шеннон (Jackie Shannon): Продукт ChatGPT
Мэнчао Чжун (Mengchao Zhong), Уэйн Чанг (Wayne Chang): Инженерная разработка ChatGPT
Рохан Сахаи (Rohan Sahai): Продукт и инженерная разработка Sora
Брендан Куинн (Brendan Quinn), Томер Кафтан (Tomer Kaftan): Инференс
Прафулла Дхаривал (Prafulla Dhariwal): Мультимодальная организация
Исследования
Фундаментальные исследования
Аллан Жабри, Давид Медина, Габриэль Го, Кэндзи Хата, Лу Лю, Прафулла Дхаривал
Основные исследования
Адитья Рамеш, Алекс Никол, Кейси Чу, Чэн Лу, Дянь Ан Яп, Хиву Джун, Джеймс Беткер, Цзяньфэн Ван, Лонг Оуян, Ли Цзин, Весам Манассра
Участники исследований
Эйден Лоу, Брэндон Маккинзи, Чарли Нэш, Хуэйвэнь Чан, Ишан Гулраджани, Джейми Кирос, Цзи Линь, Кшитидж Гупта, Ян Сон
Поведение модели
Лаврентия Романюк
Мультимодальная организация
Эндрю Гибянский, Ян Лу
Данные
Руководители направления данных
Жильда Шабо, Джеймс Парк Леннон
Данные
Арши Бхатнагар, Драгош Оприка, Рохан Кширсагар, Спенсер Папай, Цзы-чи Ю, Весам Манассра, Илэй Цянь
Модераторы
Хейзел Бирн, Дженнифер Ласкенбилл, Мариано Лопес
Консультанты по работе с данными человека
Лонг Оуян
Масштабирование
Руководители направления инференса
Брендан Куинн, Томер Кафтан
Инференс
Алисса Хуанг, Джейкоб Меник, Ник Статас, Руслан Василев, Стэнли Се
Прикладные разработки
Руководитель продукта ChatGPT
Джеки Шеннон
Руководители инженерной разработки ChatGPT
Мэнчао Чжун, Уэйн Чанг
Руководитель продуктового дизайна
Мэтт Чан
Наука о данных
Сяолинь Хао
ChatGPT
Эндрю Сима, Энни Чен, Бенджамин Го, Боян Ню, Дянь Ан Яп, Дук Чан, Эдеде Ойвох, Эрик Чанг, Итан Чанг, Джеффри Данэм, Джей Чен, Кан Ву, Карен Ли, Келли Стирман, Мэнюань Сюй, Мишель Цинь, Ола Окелола, Педро Агилар, Рокки Смит, Рохит Рамчандани, Сара Калвер, Шон Фицджеральд, Влад Фоменко, Ваннинг Цзян, Весам Манассра, Сяолинь Хао, Илэй Цянь
Sora
Руководители продукта Sora
Рохан Сахаи, Весам Манассра
Продукт и инженерная разработка Sora
Боян Ню, Давид Шнурр, Гилман Толле, Джо Тейлор, Джоуи Флинн, Майк Старр, Раджив Найяк, Рохан Сахаи, Весам Манассра
Безопасность
Руководитель направления безопасности
Сомай Джайн
Безопасность
Алекс Бойтель, Андреа Валлоне, Ботао Хао, Брендан Куинн, Кэмерон Рэймонд, Чон Чжан, Дэвид Робинсон, Эрик Уоллес, Филиппо Расо, Хуэйвэнь Чан, Иан Кивличан, Ирина Кофман, Керен Гу-Лемберг, Кристен Ин, Мадлен Бойд, Меган Шах, Майкл Лампе, Оуэн Кэмпбелл-Мур, Рохан Сахаи, Родриго Риаза Перес, Сэм Тойзер, Сандини Агаравал, Трой Питерсон
Стратегия
Адам Коэн, Адам Уэллс, Элли Беннетт, Эшли Пантулиано, Каролина Пас, Клаудия Фишер, Деклан Грабб, Габи Сакрамоне-Лутц, Лорен Джонас, Райан Байермейстер, Сиао Ли, Том Стаси, Тайце Уолтерс, Зиад Реслан, Зои Столл
Маркетинг и коммуникации
Руководители направления коммуникаций и маркетинга
Минния Фэн, Натали Саммерс, Тая Кристиансон
Коммуникации
Алекс Бейкер-Уиткомб, Эшли Тайра, Бейли Ричардсон, Габи Райла, Марселус Кайтон, Скотт Этерсмит, Суки Мансур
Дизайн и креатив
Руководители
Кендра Римбах, Вейт Меллер
Дизайн
Адам Брэндон, Адам Коппел, Анджела Бэк, Кэри Хадсон, Дана Палми, Фредди Сулит, Джеффри Сабин Мацумото, Леян Ло, Мэтт Николс, Томас Дегри, Ванесса Антония Шефке, Яра Кахбаз
Особая благодарность
Адитья Рамеш, Эйдан Кларк, Алекс Бойтель, Бен Ньюхаус, Бен Россен, Че Чанг, Грег Брокман, Ханна Вонг, Ишан Сингал, Джейсон Квон, Цзячэн Фэн, Цзяхуэй Ю, Джоанн Джан, Йоханнес Хайдеке, Кевин Вейл, Марк Чен, Миа Глайзе, Ник Терли, Раул Пури, Рэйитиро Накано, Руй Шу, Сэм Альтман, Шучао Би, Винни Монако
Полный текст статьи читайте на OpenAI
