Модели согласованности

Диффузионные модели существенно продвинули области генерации изображений, аудио и видео, однако они зависят от итеративного процесса семплирования, что приводит к медленной генерации. Чтобы преодолеть это ограничение, мы предлагаем модели согласованности — новое семейство моделей, которые генерируют высококачественные семплы путем прямого маппинга шума в данные. По своей конструкции они поддерживают быструю генерацию за один шаг, одновременно позволяя выполнять многошаговое семплирование для обмена вычислительных ресурсов на качество семплов. Они также поддерживают редактирование данных в режиме zero-shot (без предварительного обучения на конкретных задачах), такое как дорисовывание изображений (inpainting), колоризация и увеличение разрешения (super-resolution), без необходимости явного обучения на этих задачах. Модели согласованности могут обучаться либо путем дистилляции предобученных диффузионных моделей, либо как самостоятельные генеративные модели. С помощью масштабных экспериментов мы демонстрируем, что они превосходят существующие методы дистилляции диффузионных моделей при одношаговом и малошаговом семплировании, достигая нового уровня показателей (state-of-the-art) FID, равного 3,55 на CIFAR-10 и 6,20 на ImageNet 64×64 для одношаговой генерации. При обучении в изолированном режиме модели согласованности становятся новым семейством генеративных моделей, способным превосходить существующие одношаговые не состязательные генеративные модели на стандартных бенчмарках, таких как CIFAR-10, ImageNet 64×64 и LSUN 256×256.
Авторы
Полный текст статьи читайте на OpenAI
