Представляем генерацию изображений в 4o

Откройте для себя полезную и ценную генерацию изображений с помощью изначально мультимодальной модели, способной выдавать точные, аккуратные и фотореалистичные результаты.

Попробовать в ChatGPT

Эта публикация о запуске устарела.

Актуальную информацию о возможностях работы с изображениями см. здесь:

ChatGPT Images 2.0
Создавайте изображения в ChatGPT

В OpenAI мы всегда верили, что генерация изображений должна быть базовой функцией наших языковых моделей. Именно поэтому мы встроили наш самый передовой генератор изображений в GPT‑4o. Результат — генерация изображений, которые не просто красивы, но и полезны.

Полезная генерация изображений

От первых наскальных рисунков до современных инфографик — люди использовали визуальные образы для общения, убеждения и анализа, а не просто для украшения. Современные генеративные модели способны создавать сюрреалистичные, захватывающие дух сцены, однако им сложно даются прикладные изображения, которые люди используют для обмена информацией и ее создания. От логотипов до диаграмм — изображения могут передавать точный смысл, если они дополнены символами, отсылающими к общему языку и опыту.

Генерация изображений в GPT‑4o превосходно справляется с точным рендерингом текста, четким следованием промптам и использованием встроенной базы знаний 4o и контекста чата, включая преобразование загруженных изображений или использование их в качестве визуального вдохновения. Эти возможности упрощают создание именно тех изображений, которые вы себе представляете, помогая эффективнее общаться с помощью визуальных средств и превращая генерацию изображений в практичный инструмент, обладающий точностью и мощью.

Улучшенные возможности

Мы обучили наши модели на совместном распределении онлайн-изображений и текста, научив их не просто тому, как изображения соотносятся с языком, но и как они соотносятся друг с другом. В сочетании с интенсивным пост-обучением это позволило получить модель с поразительной визуальной беглостью, способную создавать полезные, согласованные и контекстно-зависимые изображения.

Рендеринг текста

Лучше один раз увидеть, чем сто раз услышать, но иногда добавление нескольких слов в нужном месте может усилить смысл изображения. Способность модели 4o сочетать точные символы с визуальными образами превращает генерацию изображений в инструмент визуальной коммуникации.

Многошаговая генерация

Поскольку генерация изображений теперь является встроенной функцией GPT‑4o, вы можете дорабатывать изображения в ходе естественного диалога. GPT‑4o может опираться на изображения и текст в контексте чата, обеспечивая последовательность на всех этапах. Например, если вы разрабатываете персонажа для видеоигры, его внешность останется согласованной в течение нескольких итераций по мере доработки и экспериментов.

Следование инструкциям

Генерация изображений в GPT‑4o точно следует подробным промптам с вниманием к деталям. В то время как другие системы с трудом справляются с ~5–8 объектами, GPT‑4o может работать с 10–20 различными объектами. Более тесная привязка объектов к их свойствам и взаимосвязям обеспечивает лучший контроль.

Контекстное обучение

GPT‑4o может анализировать загруженные пользователем изображения и учиться на них, органично интегрируя их детали в свой контекст для создания новых изображений.

Знания об окружающем мире

Встроенная генерация изображений позволяет 4o связывать свои знания в тексте и изображениях, в результате чего модель кажется более умной и эффективной.

Фотореализм и стиль

Обучение на изображениях, отражающих огромное разнообразие визуальных стилей, позволяет модели создавать или преобразовывать изображения с высокой степенью убедительности.

A candid paparazzi-style photo of Karl Marx hurriedly walking through the parking lot of the Mall of America, glancing over his shoulder with a startled expression as he tries to avoid being photographed. He’s clutching multiple glossy shopping bags filled with luxury goods. His coat flutters behind him in the wind, and one of the bags is swinging as if he’s mid-stride. Blurred background with cars and a glowing mall entrance to emphasize motion. Flash glare from the camera partially overexposes the image, giving it a chaotic, tabloid feel.
A cat looking into a puddle of water on a street, but its reflection is that of a tiger, and both reflections are realistically distorted by ripples in the water
Generate a candid, Polaroid-style photograph of four diverse friends in their early 20s at a gritty dive bar. The lighting features a very harsh, direct flash, creating sharp shadows and giving the photo a very overexposed, vintage instant-camera feel. Colors should be slightly muted, evoking nostalgic, early-2000s party vibes. The aesthetic is casually emo. No border or logos or signs. There's an interesting looking wall behind them with some light graffiti. Quality of the image should be very sharp and detailed (very little grain). The energy should be silly and chaotic. They're either playfully grimacing, smiling, or pretending to look tough. One of them should have their friend in a silly, playful headlock. Their mouths are closed.
Generate a photorealistic image of farmer's market in toronto on a saturday in summer 2006, it's a beautiful late june day, people are shopping and eating sandwiches. in focus should be a young asian girl wearing denim overalls and sipping on a strawberry banana smoothie - rest can be blurred. the photo should be reminiscent of that a digital camera from 2006 would take, with a timestamp like a printed photo would have. aspect ratio should be 3:2
blurry old analog film photograph, picture of parked car on side street, quiet night. credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
Create image super-realistic picture of these 4 creatures playing poker on a picnic blanket, zoomed out, in dolores park. photorealistic. The tabby long haired cat is holding a hand; right next to it are 2 tall vertical black chips (with stripes) as it has been raking in the dough.  Tabby's pupils are large and cute, and ii looking down and scrutinizing its cards, focused. Derpy black cat went all in. Two dogs are peering over cat's shoulder to see their cards. All cards are face down and of the same back color except for an exposed three of diamonds. small stack of poker chips are in front of each creature, but black cat went all in. the two dogs folded. All chips are from the same set and all cards have same color. photorealistic, shot on iphone, raw format.
Best of 1 | Generate an portrait ad on a solid pastel background.  In solid white san serif text,
A lone astronaut floats inside a vast space station, painting swirling galaxies onto a massive canvas that hangs weightlessly in the air. Their paintbrush leaves behind trails of cosmic dust, and their suit is stained with nebula-colored hues. Their helmet is off, revealing eyes filled with the reflection of distant planets. Outside the glass window, a black hole looms, twisting light into mesmerizing patterns.
Realistic photograph of a horse galloping from right to left across a vast, calm ocean surface, accurately depicting splashes, reflections, and subtle ripple patterns beneath their hooves. Exaggerate horse movements but everything else should be still, quiet to show contrast with the horse's strength. clean composition, cinematographic. A wide, panoramic composition showcasing a distant horizon. Atmospheric perspective creating depth. zoomed out so the horse appears minuscule compared to vast ocean.  horse is right at the horizon where ocean meets sky. use rule of thirds to position horse. size of horse is 1% size of entire image because camera is so far away from subject. camera view is super close to the ground/ocean like a worm's eye view. horse is galloping right where ocean meets the sky
A realistic underwater scene with dolphins swimming through the windows of an abandoned subway car, with bubbles and detailed water flow accurately simulated.
Photo of a fruit bowl consisting of real fruits mixed with miniature planets (Jupiter, Saturn, Mars, Earth), maintaining realistic reflections, lighting, and shadows consistent with original photo, clean composition, authentic textures, crisp detailed rendering

Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.

Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.

Фотография в стиле папарацци: Карл Маркс спешно идет по парковке торгового центра Mall of America, испуганно оглядываясь через плечо, пытаясь избежать фотосъемки. Он сжимает в руках несколько глянцевых пакетов с товарами класса люкс. Его пальто развевается на ветру позади него, а один из пакетов раскачивается, как будто он на ходу. Размытый фон с автомобилями и светящимся входом в торговый центр подчеркивают движение. Вспышка камеры частично засвечивает изображение, придавая ему хаотичный вид в стиле таблоидов.

Ограничения

Наша модель не идеальна. Нам известно о ряде ограничений, над устранением которых мы будем работать путем усовершенствования модели после ее первоначального запуска.

Безопасность

В соответствии с нашей спецификацией модели (Model Spec), мы стремимся максимизировать творческую свободу, поддерживая такие ценные варианты использования, как разработка игр, исторические исследования и образование, и при этом поддерживая строгие стандарты безопасности. В то же время по-прежнему крайне важно блокировать запросы, нарушающие эти стандарты. Ниже приведены результаты оценки дополнительных областей риска, в которых мы работаем над обеспечением безопасного контента высокой полезности и поддержкой более широкого творческого самовыражения пользователей.

Происхождение с помощью C2PA и внутренний обратимый поиск
Все сгенерированные изображения содержат метаданные C2PA⁠, которые идентифицируют изображение как созданное с помощью GPT‑4o, в целях обеспечения прозрачности. Мы также создали внутренний поисковый инструмент, который использует технические атрибуты созданных изображений, чтобы помочь проверить, создано ли содержимое нашей моделью.

Блокировка нежелательного контента
Мы продолжаем блокировать запросы на создание изображений, которые могут нарушать наши правила в отношении контента, такие как материалы с изображением сексуального насилия над детьми и сексуальные дипфейки. Когда в контексте фигурируют изображения реальных людей, у нас действуют более строгие ограничения в отношении того, какие изображения могут быть созданы, с особенно надежными средствами защиты от наготы и жестокого насилия. Как и при любом запуске, работа над безопасностью никогда не завершается, а представляет собой постоянную область инвестиций. По мере того как мы будем узнавать больше о реальном использовании этой модели, мы будем соответствующим образом корректировать нашу политику.

Подробнее о нашем подходе читайте в приложении к системной карте GPT‑4o.

Использование рассуждений для обеспечения безопасности
Аналогично нашей работе по сознательному выравниванию (deliberative alignment), мы обучили LLM с возможностью логического рассуждения работать непосредственно на основе написанных человеком и понятных спецификаций безопасности. Мы использовали эту рассуждающую LLM во время разработки, чтобы помочь нам выявлять и устранять двусмысленности в наших правилах. Наряду с нашими мультимодальными достижениями и существующими методами безопасности, разработанными для ChatGPT и Sora, это позволяет нам модерировать как входной текст, так и выходные изображения в соответствии с нашими правилами.

Доступ и доступность

Генерация изображений с помощью 4o становится доступна начиная с сегодняшнего дня для пользователей Plus, Pro, Team и Free в качестве генератора изображений по умолчанию в ChatGPT, а в ближайшее время доступ появится для Enterprise и Edu. Она также доступна для использования в Sora. Для тех, кто хранит в своем сердце особую любовь к DALL·E, к ней по-прежнему можно получить доступ через специальный DALL·E GPT.

Разработчики скоро смогут генерировать изображения с помощью GPT‑4o через API, при этом доступ будет открываться в течение ближайших нескольких недель.

Создание и настройка изображений так же просты, как общение с помощью GPT‑4o — просто опишите, что вам нужно, указав любые детали, такие как соотношение сторон, точные цвета с использованием шестнадцатеричных кодов (hex-кодов) или прозрачный фон. Поскольку эта модель создает более детализированные изображения, рендеринг картинок занимает больше времени, часто до одной минуты.

credit creator: [Alex Duffy](https://every.to/@AlxAi)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: [August Kamp](https://www.instagram.com/august.kamp/?igsh=MTRpeG9xd3F2MzEyeg#)
credit creator: Cassandra Ansara
credit creator: [Isa](https://www.instagram.com/isabelitavirtual/?igsh=ZHdoYjFwYzV6dzFi#)
credit creator: [Isa](https://www.instagram.com/isabelitavirtual/?igsh=ZHdoYjFwYzV6dzFi#)
credit creator: Les Morgan
credit creator: Les Morgan
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Derya Unatmaz](https://x.com/deryatr_)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Elene Chekurishvili](https://www.instagram.com/th_ene_ighbor/?igsh=eDh2Z2kyOGhnaXA0#)
credit creator: [Eugenio Marongiu](https://www.instagram.com/katsukokoiso.ai/?igsh=YTduZnNjZ2RhdTM3#)
credit creator: [Eugenio Marongiu](https://www.instagram.com/katsukokoiso.ai/?igsh=YTduZnNjZ2RhdTM3#)
credit creator: Jesse Kramme
credit creator: Jesse Kramme
credit creator: Matthew Dear
credit creator: [Minh Do](https://www.instagram.com/minhsmind/?igsh=MTFscDRqZ3JiZHVveA%3D%3D#)
credit creator: [Niceaunties](https://www.instagram.com/niceaunties/?igsh=Nm1jZmV4YTF6MTQ%3D#)
credit creator: Eskcanta
credit creator: Eskcanta
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: [Roope Rainisto](https://www.instagram.com/never_ever_never_land/?igsh=MXh3N3EyOWdoMmNubg%3D%3D#)
credit creator: Shane Copenhagen
credit creator: Will Maberry
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily
credit creator: Manuel Sainsily

автор работы: Алекс Даффи (Alex Duffy)

автор работы: Алекс Даффи (Alex Duffy)

автор работы: Алекс Даффи (Alex Duffy)

Повтор прямой трансляции

Автор

OpenAI

Руководство

Габриэль Го (Gabriel Goh): Генерация изображений

Джеки Шеннон (Jackie Shannon): Продукт ChatGPT

Мэнчао Чжун (Mengchao Zhong), Уэйн Чанг (Wayne Chang): Инженерная разработка ChatGPT

Рохан Сахаи (Rohan Sahai): Продукт и инженерная разработка Sora

Брендан Куинн (Brendan Quinn), Томер Кафтан (Tomer Kaftan): Инференс

Прафулла Дхаривал (Prafulla Dhariwal): Мультимодальная организация

Исследования

Фундаментальные исследования

Аллан Жабри, Давид Медина, Габриэль Го, Кэндзи Хата, Лу Лю, Прафулла Дхаривал

Основные исследования

Адитья Рамеш, Алекс Никол, Кейси Чу, Чэн Лу, Дянь Ан Яп, Хиву Джун, Джеймс Беткер, Цзяньфэн Ван, Лонг Оуян, Ли Цзин, Весам Манассра

Участники исследований

Эйден Лоу, Брэндон Маккинзи, Чарли Нэш, Хуэйвэнь Чан, Ишан Гулраджани, Джейми Кирос, Цзи Линь, Кшитидж Гупта, Ян Сон

Поведение модели

Лаврентия Романюк

Мультимодальная организация

Эндрю Гибянский, Ян Лу

Данные

Руководители направления данных

Жильда Шабо, Джеймс Парк Леннон

Данные

Арши Бхатнагар, Драгош Оприка, Рохан Кширсагар, Спенсер Папай, Цзы-чи Ю, Весам Манассра, Илэй Цянь

Модераторы

Хейзел Бирн, Дженнифер Ласкенбилл, Мариано Лопес

Консультанты по работе с данными человека

Лонг Оуян

Масштабирование

Руководители направления инференса

Брендан Куинн, Томер Кафтан

Инференс

Алисса Хуанг, Джейкоб Меник, Ник Статас, Руслан Василев, Стэнли Се

Прикладные разработки

Руководитель продукта ChatGPT

Джеки Шеннон

Руководители инженерной разработки ChatGPT

Мэнчао Чжун, Уэйн Чанг

Руководитель продуктового дизайна

Мэтт Чан

Наука о данных

Сяолинь Хао

ChatGPT

Эндрю Сима, Энни Чен, Бенджамин Го, Боян Ню, Дянь Ан Яп, Дук Чан, Эдеде Ойвох, Эрик Чанг, Итан Чанг, Джеффри Данэм, Джей Чен, Кан Ву, Карен Ли, Келли Стирман, Мэнюань Сюй, Мишель Цинь, Ола Окелола, Педро Агилар, Рокки Смит, Рохит Рамчандани, Сара Калвер, Шон Фицджеральд, Влад Фоменко, Ваннинг Цзян, Весам Манассра, Сяолинь Хао, Илэй Цянь

Sora

Руководители продукта Sora

Рохан Сахаи, Весам Манассра

Продукт и инженерная разработка Sora

Боян Ню, Давид Шнурр, Гилман Толле, Джо Тейлор, Джоуи Флинн, Майк Старр, Раджив Найяк, Рохан Сахаи, Весам Манассра

Безопасность

Руководитель направления безопасности

Сомай Джайн

Безопасность

Алекс Бойтель, Андреа Валлоне, Ботао Хао, Брендан Куинн, Кэмерон Рэймонд, Чон Чжан, Дэвид Робинсон, Эрик Уоллес, Филиппо Расо, Хуэйвэнь Чан, Иан Кивличан, Ирина Кофман, Керен Гу-Лемберг, Кристен Ин, Мадлен Бойд, Меган Шах, Майкл Лампе, Оуэн Кэмпбелл-Мур, Рохан Сахаи, Родриго Риаза Перес, Сэм Тойзер, Сандини Агаравал, Трой Питерсон

Стратегия

Адам Коэн, Адам Уэллс, Элли Беннетт, Эшли Пантулиано, Каролина Пас, Клаудия Фишер, Деклан Грабб, Габи Сакрамоне-Лутц, Лорен Джонас, Райан Байермейстер, Сиао Ли, Том Стаси, Тайце Уолтерс, Зиад Реслан, Зои Столл

Маркетинг и коммуникации

Руководители направления коммуникаций и маркетинга

Минния Фэн, Натали Саммерс, Тая Кристиансон

Коммуникации

Алекс Бейкер-Уиткомб, Эшли Тайра, Бейли Ричардсон, Габи Райла, Марселус Кайтон, Скотт Этерсмит, Суки Мансур

Дизайн и креатив

Руководители

Кендра Римбах, Вейт Меллер

Дизайн

Адам Брэндон, Адам Коппел, Анджела Бэк, Кэри Хадсон, Дана Палми, Фредди Сулит, Джеффри Сабин Мацумото, Леян Ло, Мэтт Николс, Томас Дегри, Ванесса Антония Шефке, Яра Кахбаз

Особая благодарность

Адитья Рамеш, Эйдан Кларк, Алекс Бойтель, Бен Ньюхаус, Бен Россен, Че Чанг, Грег Брокман, Ханна Вонг, Ишан Сингал, Джейсон Квон, Цзячэн Фэн, Цзяхуэй Ю, Джоанн Джан, Йоханнес Хайдеке, Кевин Вейл, Марк Чен, Миа Глайзе, Ник Терли, Раул Пури, Рэйитиро Накано, Руй Шу, Сэм Альтман, Шучао Би, Винни Монако

Полный текст статьи читайте на OpenAI