Иерархическая генерация изображений на основе текста с использованием латентных пространств CLIP

Аннотация
Контрастивные модели, такие как CLIP, демонстрируют способность изучать устойчивые представления изображений, которые отражают как семантику, так и стиль. Чтобы задействовать эти представления для генерации изображений, мы предлагаем двухэтапную модель: априорную модель (prior), которая генерирует эмбеддинг изображения CLIP на основе текстового описания, и декодер, который генерирует изображение по заданному эмбеддингу. Мы показываем, что явная генерация представлений изображений повышает разнообразие картинок при минимальной потере фотореалистичности и соответствия тексту. Наши декодеры, работающие на основе представлений изображений, также способны создавать вариации изображения, сохраняющие его семантику и стиль, при этом изменяя второстепенные детали, отсутствующие в представлении изображения. Более того, совместное вложенное пространство CLIP позволяет осуществлять манипуляции с изображениями на основе языка в режиме zero-shot (без предварительного обучения на конкретных примерах). Мы используем диффузионные модели для декодера и экспериментируем как с авторегрессионными, так и с диффузионными моделями для априорного модуля, обнаруживая, что последние более эффективны с точки зрения вычислений и создают образцы более высокого качества.
Авторы
Полный текст статьи читайте на OpenAI
