Методы неявной генерации и обобщения для энергетических моделей

Читать статью
Implicit Generation And Generalization Methods For Energy Based Models

Мы добились прогресса в направлении стабильного и масштабируемого обучения энергетических моделей (energy-based models, EBM), что позволило улучшить качество примеров и способность к обобщению по сравнению с существующими моделями. Генерация в EBM тратит больше вычислительных ресурсов на непрерывное уточнение ответов, благодаря чему при низких температурах удается создавать образцы, конкурентоспособные с GAN, сохраняя при этом гарантии охвата мод, свойственные вероятностным моделям. Мы надеемся, что эти результаты стимуруют дальнейшие исследования в области этого перспективного класса моделей.

Генеративное моделирование — это задача наблюдения за данными (такими как изображения или текст) и обучения моделированию лежащего в их основе распределения. Решение этой задачи позволяет моделям понимать высокоуровневые признаки в данных и синтезировать примеры, похожие на реальные данные. Генеративные модели находят множество применений в обработке естественного языка, робототехнике и компьютерном зрении.

Энергетические модели представляют распределения вероятностей данных, сопоставляя каждой входной точке данных ненормированный скаляр вероятности (или «энергию»). Это обеспечивает полезную гибкость моделирования: в качестве энергетической модели можно использовать любую произвольную модель, выдающую вещественное число на основе входных данных. Однако сложность заключается в выборке из этих моделей.

Для генерации выборок из EBM мы используем итеративный процесс уточнения на основе динамики Ланжевена. Неформально это означает выполнение зашумленного градиентного спуска по функции энергии для достижения конфигураций с низкой энергией (подробнее см. в статье). В отличие от GAN, VAE и потоковых моделей (Flow-based models), этот подход не требует явной нейронной сети для генерации образцов — выборки генерируются неявно. Сочетание EBM и итеративного уточнения дает следующие преимущества:

  • Адаптивное время вычислений. Мы можем запускать последовательное уточнение на долгое время для генерации чётких, разнообразных образцов или на короткое время для получения грубых, менее разнообразных образцов. В пределе бесконечного времени эта процедура генерирует истинные выборки из энергетической модели.
  • Отсутствие ограничений со стороны сети-генератора. Как в VAE, так и в потоковых моделях генератор должен изучить отображение из непрерывного пространства в потенциально несвязное пространство, содержащее различные моды данных, что требует большой емкости и может оказаться невозможным для обучения. В EBM, напротив, можно легко научиться назначать низкие энергии в непересекающихся областях.
  • Встроенная композиционность. Поскольку каждая модель представляет собой ненормированное распределение вероятностей, модели можно естественным образом объединять с помощью произведения экспертов или других иерархических моделей.

Генерация

Мы обнаружили, что энергетические модели способны генерировать качественные изображения как в качественном, так и в количественном отношении, особенно если запускать процесс уточнения на более длительное время во время тестирования. Выполняя итеративную оптимизацию для отдельных изображений, мы можем дорисовывать их и преобразовывать изображения одного класса (например, грузовика) в другой (например, лягушку).

Помимо генерации изображений, мы выяснили, что энергетические модели способны создавать стабильные траектории динамики роботов на большом числе временных шагов. EBM могут генерировать разнообразный набор возможных вариантов будущего, в то время как прямосвязные модели сводятся к усредненному прогнозу.

Обобщение

Мы протестировали энергетические модели на классификации нескольких различных наборов данных вне распределения (out-of-distribution) и обнаружили, что EBM превосходят другие вероятностные модели, такие как потоковые и авторегрессионные модели. Мы также протестировали классификацию с помощью условных энергетических моделей и выяснили, что полученная классификация демонстрирует хорошую устойчивость к состязательным (адверсариальным) возмущениям. Наша модель — несмотря на то, что ее никогда не обучали классификации — справилась с ней лучше, чем модели, специально обученные противостоять состязательным возмущениям.

Извлеченные уроки

Мы получили свидетельства в пользу следующих наблюдений, хотя ни в коем случае не утверждаем с абсолютной уверенностью, что они верны:

  • Нам было трудно применять стандартный метод гамильтонова Монте-Карло (HMC) к обучению EBM, поскольку оптимальные размеры шагов и количество шагов симуляции «лягушачьего прыжка» (leapfrog) сильно различаются в процессе обучения, хотя применение адаптивного HMC было бы интересным продолжением работы.
  • Мы выяснили, что обучение ансамблей энергетических функций (выборка и оценка на ансамблях) немного помогает, но не стоило добавленной сложности.
  • Мы не заметили большой пользы от добавления члена штрафа за градиент (gradient penalty), так как он, судя по всему, ухудшал емкость модели и выборку.

Больше советов, наблюдений и неудач из этого исследования можно найти в разделе А.8 статьи.

Следующие шаги

Мы получили предварительные указания на то, что мы можем комбинировать несколько энергетических моделей с помощью модели произведения экспертов. Мы обучили одну модель на фигурах разного размера в фиксированном положении, а другую модель — на фигурах одинакового размера в разных положениях. Объединив полученные энергетические модели, мы смогли генерировать фигуры разного размера в разных местах, несмотря на то, что никогда не видели примеров одновременного изменения того и другого.

Композиционность — одна из нерешенных проблем, стоящих перед современными системами ИИ, и мы воодушевлены тем, что энергетические модели могут здесь сделать. Если вы хотите работать над энергетическими моделями, пожалуйста, рассмотрите возможность подачи заявки в OpenAI!

Авторы

Йилун Ду (Yilun Du), Игорь Мордач (Igor Mordatch)

Благодарности

Спасибо Илье Суцкеверу (Ilya Sutskever), Грегу Брокману (Greg Brockman), Бобу МакГрю (Bob McGrew), Йоханнесу Оттербаху (Johannes Otterbach), Джейкобу Стайнхардту (Jacob Steinhardt), Харри Эдвардсу (Harri Edwards), Юре Бурде (Yura Burda), Джеку Кларку (Jack Clark) и Эшли Пилипишин (Ashley Pilipiszyn) за отзывы об этой записи в блоге и рукописи.

Полный текст статьи читайте на OpenAI