Иерархическая генерация изображений на основе текста с использованием латентных пространств CLIP

Читать статью
Hierarchical Text Conditional Image Generation With Clip Latents

Аннотация

Контрастивные модели, такие как CLIP, демонстрируют способность изучать устойчивые представления изображений, которые отражают как семантику, так и стиль. Чтобы задействовать эти представления для генерации изображений, мы предлагаем двухэтапную модель: априорную модель (prior), которая генерирует эмбеддинг изображения CLIP на основе текстового описания, и декодер, который генерирует изображение по заданному эмбеддингу. Мы показываем, что явная генерация представлений изображений повышает разнообразие картинок при минимальной потере фотореалистичности и соответствия тексту. Наши декодеры, работающие на основе представлений изображений, также способны создавать вариации изображения, сохраняющие его семантику и стиль, при этом изменяя второстепенные детали, отсутствующие в представлении изображения. Более того, совместное вложенное пространство CLIP позволяет осуществлять манипуляции с изображениями на основе языка в режиме zero-shot (без предварительного обучения на конкретных примерах). Мы используем диффузионные модели для декодера и экспериментируем как с авторегрессионными, так и с диффузионными моделями для априорного модуля, обнаруживая, что последние более эффективны с точки зрения вычислений и создают образцы более высокого качества.

Авторы

Адитья Рамеш (Aditya Ramesh), Прафулла Дхаривал (Prafulla Dhariwal), Алекс Никол (Alex Nichol), Кейси Чу (Casey Chu), Марк Чен (Mark Chen)

Полный текст статьи читайте на OpenAI