Point-E: Система для генерации 3D-облаков точек по сложным текстовым запросам

Аннотация
Хотя недавние исследования в области генерации 3D-объектов по текстовым описаниям демонстрируют многообещающие результаты, передовые методы обычно требуют нескольких часов работы графического процессора (GPU) для создания всего одного образца. Это резко контрастирует с современными генеративными моделями изображений, которые создают образцы за считанные секунды или минуты. В этой статье мы исследуем альтернативный метод генерации 3D-объектов, позволяющий получать 3D-модели всего за 1–2 минуты на одном GPU. Наш метод сначала генерирует один синтетический ракурс с помощью диффузионной модели «текст-изображение», а затем создает 3D-облако точек с помощью второй диффузионной модели, которая использует сгенерированное изображение в качестве условия. Хотя наш метод все еще уступает передовым разработкам по качеству получаемых образцов, он работает на один-два порядка быстрее, предлагая практичный компромисс для определенных сценариев использования. Мы публикуем наши предобученные диффузионные модели облаков точек, а также код для оценки и модели по адресу этой ссылке в источнике.
Авторы
Полный текст статьи читайте на OpenAI
