DALL·E: создание изображений на основе текста

Мы обучили нейросеть под названием DALL·E, которая создает изображения по текстовым описаниям для широкого спектра концептов, выразимых на естественном языке.

DALL·E

Иллюстрация: Джастин Джей Ван (Justin Jay Wang)

DALL·E — это версия GPT‑3 с 12 миллиардами параметров, обученная генерировать изображения по текстовым описаниям с использованием набора данных пар «текст — изображение». Мы выяснили, что она обладает разнообразными возможностями, включая создание антропоморфных версий животных и объектов, правдоподобное объединение несвязанных концепций, генерацию текста и применение трансформаций к существующим изображениям.

См. также: DALL·E 2, которая создает более реалистичные и точные изображения с в 4 раза большим разрешением.

GPT‑3 продемонстрировала, что язык можно использовать для того, чтобы давать инструкции большой нейронной сети для выполнения различных задач генерации текста. Image GPT показала, что нейронную сеть того же типа можно использовать и для генерации изображений с высокой точностью. Мы расширяем эти результаты, показывая, что манипулирование визуальными концепциями с помощью языка теперь стало реальностью.

Обзор

Как и GPT‑3, DALL·E — это языковая модель на базе трансформера. Она принимает и текст, и изображение в виде единого потока данных, содержащего до 1280 токенов, и обучается с использованием метода максимального правдоподобия для генерации всех токенов один за другим. A

Эта процедура обучения позволяет DALL·E не только генерировать изображение с нуля, но и воссоздавать любую прямоугольную область существующего изображения, которая простирается до нижнего правого угла, причем способом, согласованным с текстовым запросом.

Мы признаем, что работа с генеративными моделями потенциально имеет серьезные и масштабные последствия для общества. В будущем мы планируем проанализировать, как такие модели, как DALL·E, связаны с социальными проблемами, такими как экономическое воздействие на определенные рабочие процессы и профессии, потенциал предвзятости в результатах работы модели и долгосрочные этические проблемы, которые влечет за собой эта технология.

Возможности

Мы обнаружили, что DALL·E способна создавать правдоподобные изображения для самых разных предложений, исследующих композиционную структуру языка. Мы иллюстрируем это с помощью серии интерактивных визуальных материалов в следующем разделе. Примеры, показанные для каждого описания в визуализациях, получены путем выбора лучших 32 из 512 после повторного ранжирования с помощью CLIP, однако мы не используем никакого ручного отбора («вишни на торте»), за исключением миниатюр и автономных изображений, которые находятся снаружи.B

Управление атрибутами

Мы проверяем способность DALL·E изменять несколько атрибутов объекта, а также количество его появлений.

Отрисовка нескольких объектов

Одновременное управление несколькими объектами, их атрибутами и пространственными взаимосвязями представляет собой новую задачу. Например, рассмотрим фразу «еж в красной шляпе, желтых перчатках, синей рубашке и зеленых штанах». Чтобы правильно интерпретировать это предложение, DALL·E должна не только корректно скомбинировать каждый элемент одежды с животным, но и сформировать ассоциации (шляпа, красный), (перчатки, желтый), (рубашка, синий) и (штаны, зеленый), не перепутав их C

Мы тестируем способность DALL·E делать это для относительного позиционирования, наложения объектов друг на друга и управления несколькими атрибутами.

Хотя DALL·E действительно обеспечивает определенный уровень контроля над атрибутами и положениями небольшого числа объектов, процент успешных результатов может зависеть от формулировки описания. При добавлении новых объектов DALL·E склонна путать ассоциации между объектами и их цветами, и процент успешных попыток резко снижается. Мы также отмечаем, что DALL·E чувствительна к перефразированию описания в таких сценариях: альтернативные, семантически эквивалентные описания часто не дают правильных интерпретаций.

Визуализация перспективы и трехмерности

Мы обнаружили, что DALL·E также позволяет управлять точкой обзора сцены и трехмерным стилем, в котором рендерится сцена.

Чтобы пойти дальше, мы проверяем способность DALL·E многократно рисовать голову известного персонажа под каждым углом из последовательности равноудаленных углов и обнаруживаем, что мы можем получить плавную анимацию вращающейся головы.

DALL·E, судя по всему, способна применять к сценам некоторые виды оптических искажений, как мы видим на примере параметров «вид через объектив «рыбий глаз» и «сферическая панорама». Это побудило нас исследовать ее способность генерировать отражения.

Визуализация внутренней и внешней структуры

Примеры в стиле «экстремально крупный план» и «рентген» побудили нас глубже изучить способность DALL·E передавать внутреннюю структуру с помощью видов в разрезе и внешнюю структуру с помощью макрофотографий.

Вывод контекстуальных деталей

Задача перевода текста в изображения является недоопределенной: одному описанию обычно соответствует бесконечное множество правдоподобных изображений, поэтому изображение не определяется однозначно. Например, рассмотрим описание «картина с изображением капибары, сидящей на поле на рассвете». В зависимости от ориентации капибары может потребоваться нарисовать тень, хотя эта деталь никогда не упоминается явно. Мы исследуем способность DALL·E разрешать недоопределенность в трех случаях: изменение стиля, обстановки и времени; отрисовка одного и того же объекта в различных ситуациях; и генерация изображения объекта с определенным текстом на нем.

С разной степенью надежности DALL·E предоставляет доступ к подмножеству возможностей движка 3D-рендеринга с помощью естественного языка. Она может независимо управлять атрибутами небольшого числа объектов и, в ограниченной степени, их количеством и тем, как они расположены по отношению друг к другу. Она также может управлять расположением и углом обзора при рендеринге сцены и способна генерировать известные объекты в соответствии с точными спецификациями угла и условий освещения.

В отличие от движка 3D-рендеринга, входы которого должны быть заданы однозначно и в мельчайших деталях, DALL·E часто способна «заполнить пробелы», когда описание подразумевает, что изображение должно содержать определенную деталь, которая не указана явно.

Применение описанных возможностей

Далее мы исследуем использование рассмотренных возможностей для индустрии моды и дизайна интерьера.

Объединение несвязанных концепций

Композиционная природа языка позволяет нам объединять концепции для описания как реальных, так и воображаемых вещей. Мы обнаружили, что DALL·E также обладает способностью комбинировать разрозненные идеи для синтеза объектов, некоторые из которых вряд ли существуют в реальном мире. Мы исследуем эту способность в двух случаях: перенос качеств из различных концепций на животных и проектирование продуктов с использованием вдохновения от несвязанных концепций.

Иллюстрации с животными

В предыдущем разделе мы исследовали способность DALL·E объединять несвязанные концепции при генерации изображений реальных объектов. Здесь мы исследуем эту способность в контексте искусства для трех видов иллюстраций: антропоморфных версий животных и предметов, химер из животных и эмодзи.

Визуальные рассуждения в условиях нулевого обучения (zero-shot)

GPT‑3 может выполнять множество видов задач исключительно на основе описания и подсказки для генерации ответа, предоставленного в её промпте, без какого-либо дополнительного обучения. Например, при поступлении запроса «вот предложение «человек выгуливает собаку в парке», переведенное на французский язык:», GPT‑3 отвечает «un homme qui promène son chien dans le parc.» Эта способность называется рассуждениями в условиях нулевого обучения (zero-shot reasoning). Мы обнаружили, что DALL·E распространяет эту способность на визуальную доменную область и способна выполнять несколько видов задач перевода изображений в изображения при правильном составлении подсказки.

Мы не ожидали появления этой способности и не вносили никаких изменений в нейронную сеть или процедуру обучения для ее стимулирования. Вдохновленные этими результатами, мы измеряем склонность DALL·E к проблемам аналогических рассуждений, тестируя ее на прогрессивных матрицах Равена — визуальном тесте IQ, который широко использовался в XX веке.

Географические знания

Мы обнаружили, что DALL·E усвоил географические факты, достопримечательности и информацию о районах. Его знания об этих концепциях в некоторых аспектах поразительно точны, а в других — ошибочны.

Временные знания

Помимо изучения знаний DALL·E о концепциях, изменяющихся в пространстве, мы также исследуем его знания о концепциях, изменяющихся во времени.

Обзор подхода и предыдущих работ

DALL·E — это простой трансформер, состоящий только из декодера, который принимает как текст, так и изображение в виде единого потока из 1280 токенов (256 для текста и 1024 для изображения) и моделирует их все авторегрессионным способом. Маска внимания в каждом из его 64 слоев самовнимания позволяет каждому токену изображения обращаться ко всем текстовым токенам. DALL·E использует стандартную причинную маску для текстовых токенов и разреженное внимание для токенов изображения с шаблонным вниманием по строкам, столбцам или сверткам в зависимости от слоя. Более подробную информацию об архитектуре и процедуре обучения мы приводим в нашей статье.

Синтез текста в изображения является активной областью исследований со времен новаторской работы Рида и др. (Reed et. al), 1 в которой используется генеративно-состязательная сеть (GAN), обученная на условных текстовых эмбеддингах. Эмбеддинги создаются кодером, предварительно обученным с использованием контрастивной функции потерь, во многом похожим на CLIP. В StackGAN3 и StackGAN++4 многомасштабные GAN используются для увеличения разрешения изображений и повышения визуальной достоверности. AttnGAN5 включает механизм внимания между признаками текста и изображения, а также предлагает контрастивную потерю сопоставления признаков текста и изображения в качестве вспомогательной целевой функции. Это интересно сравнить с нашей переоценкой рангов (reranking) с помощью CLIP, которая выполняется в автономном режиме. Другие работы2, 6, 7 включают дополнительные источники контроля во время обучения для улучшения качества изображений. Наконец, работы Нгуена и др. (Nguyen et. al)8 и Чо и др. (Cho et. al)9 исследуют стратегии генерации изображений на основе выборки, в которых используются предварительно обученные мультимодальные дискриминативные модели.

Подобно выборочной отбраковке (rejection sampling), используемой в VQVAE-2, мы используем CLIP для повторного ранжирования лучших 32 из 512 образцов для каждого описания во всех интерактивных визуализациях. эту процедуру также можно рассматривать как разновидность управляемого языком поиска16, и она может оказать драматическое влияние на качество образцов.

Сноски

  1. A

    Токен — это любой символ из дискретного словаря; для людей каждая английская буква является токеном из 26-буквенного алфавита. Словарь DALL·E содержит токены как для текстовых, так и для визуальных концептов. В частности, каждое описание изображения представляется с использованием максимум 256 токенов, закодированных с помощью алгоритма BPE, при размере словаря 16384, а само изображение представляется с использованием 1024 токенов при размере словаря 8192.

Изображения предварительно обрабатываются до разрешения 256×256 во время обучения. Аналогично VQVAE, каждое изображение сжимается в сетку дискретных латентных кодов размером 32×32 с использованием дискретного VAE, который мы предварительно обучили с использованием непрерывной релаксации. Мы обнаружили, что обучение с использованием релаксации устраняет необходимость в явной книге кодов, EMA-потерях или таких уловках, как оживление мертвых кодов, и позволяет масштабировать размеры словаря до больших значений.

  1. B

    Более подробную информацию можно найти в следующем разделе.

  2. 17

    Эта задача называется связыванием переменных и подробно изучена в литературе.

Ссылки

  1. 1

    Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., Lee, H. (2016).»Generative adversarial text to image synthesis». In ICML 2016.

  2. 2

    Reed, S., Akata, Z., Mohan, S., Tenka, S., Schiele, B., Lee, H. (2016).»Learning what and where to draw». In NIPS 2016.

  3. 3

    Zhang, H., Xu, T., Li, H., Zhang, S., Wang, X., Huang X., Metaxas, D. (2016).»StackGAN: Text to photo-realistic image synthesis with stacked generative adversarial networks». In ICCY 2017.

  4. 4

    Zhang, H., Xu, T., Li, H., Zhang, S., Wang, X., Huang, X., Metaxas, D. (2017).»StackGAN++: realistic image synthesis with stacked generative adversarial networks». In IEEE TPAMI 2018.

  5. 5

    Xu, T., Zhang, P., Huang, Q., Zhang, H., Gan, Z., Huang, X., He, X. (2017).»AttnGAN: Fine-grained text to image generation with attentional generative adversarial networks.

  6. 6

    Li, W., Zhang, P., Zhang, L., Huang, Q., He, X., Lyu, S., Gao, J. (2019).»Object-driven text-to-image synthesis via adversarial training». In CVPR 2019.

  7. 7

    Koh, J. Y., Baldridge, J., Lee, H., Yang, Y. (2020).»Text-to-image generation grounded by fine-grained user attention». In WACV 2021.

  8. 8

    Nguyen, A., Clune, J., Bengio, Y., Dosovitskiy, A., Yosinski, J. (2016).»Plug & play generative networks: conditional iterative generation of images in latent space.

  9. 9

    Cho, J., Lu, J., Schwen, D., Hajishirzi, H., Kembhavi, A. (2020).»X-LXMERT: Paint, caption, and answer questions with multi-modal transformers». EMNLP 2020.

  10. 10

    Kingma, Diederik P., and Max Welling.»Auto-encoding variational bayes.» arXiv preprint (2013).

  11. 11

    Rezende, Danilo Jimenez, Shakir Mohamed, and Daan Wierstra.»Stochastic backpropagation and approximate inference in deep generative models.» arXiv preprint (2014).

  12. 12

    Jang, E., Gu, S., Poole, B. (2016).»Categorical reparametrization with Gumbel-softmax».

  13. 13

    Maddison, C., Mnih, A., Teh, Y. W. (2016).»The Concrete distribution: a continuous relaxation of discrete random variables».

  14. 14

    van den Oord, A., Vinyals, O., Kavukcuoglu, K. (2017).»Neural discrete representation learning».

  15. 15

    Razavi, A., van der Oord, A., Vinyals, O. (2019).»Generating diverse high-fidelity images with VQ-VAE-2».

  16. 16

    Andreas, J., Klein, D., Levine, S. (2017).»Learning with Latent Language».

  17. 17

    Smolensky, P. (1990).»Tensor product variable binding and the representation of symbolic structures in connectionist systems».

  18. 18

    Plate, T. (1995).»Holographic reduced representations: convolution algebra for compositional distributed representations».

  19. 19

    Gayler, R. (1998).»Multiplicative binding, representation operators & analogy».

  20. 20

    Kanerva, P. (1997).»Fully distributed representations».

Основные авторы

Адитья Рамеш (Aditya Ramesh), Михаил Павлов, Габриэль Го (Gabriel Goh), Скотт Грей (Scott Gray)

Соавторы

Марк Чен (Mark Chen), Ревон Чайлд (Rewon Child), Ведант Мисра (Vedant Misra), Памела Мишкин (Pamela Mishkin), Гретхен Крюгер (Gretchen Krueger), Сандини Агарвал (Sandhini Agarwal), Илья Суцкевер (Ilya Sutskever)

Полный текст статьи читайте на OpenAI