Изучение концептов с помощью функций энергии

Мы разработали энергетическую модель, которая способна быстро научиться распознавать и генерировать экземпляры различных концептов, таких как «рядом», «над», «между», «ближайший» и «самый дальний», выраженных в виде наборов двумерных точек. Наша модель усваивает эти концепты всего после пяти демонстраций. Мы также демонстрируем междоменный перенос: мы используем концепты, изученные в среде двумерных частиц, для решения задач на трехмерном физическом роботе.

Многие характерные особенности человеческого интеллекта, такие как обобщение на основе ограниченного опыта, абстрактное мышление и планирование, рассуждение по аналогии, творческое решение проблем и способность к языку, требуют умения объединять опыт в концепты, которые служат базовыми строительными блоками понимания и рассуждений. Наша методика позволяет агентам изучать и извлекать концепты из задач, а затем использовать их для решения других задач в различных доменах. Например, наша модель может применять концепты, освоенные в среде двумерных частиц, для выполнения аналогичной задачи в трехмерной физической робототехнической среде —без повторного обучения в новой среде.
В данной работе функции энергии используются для того, чтобы наши агенты научились классифицировать и генерировать простые концепты, которые они могут применять для решения таких задач, как навигация между двумя точками в непохожих средах. Примеры концептов включают визуальные («красный» или «квадрат»), пространственные («внутри», «наверху»), временные («медленный», «после»), социальные («агрессивный», «полезный») и многие другие. Эти концепты после их изучения выступают в качестве базовых строительных блоков понимания и рассуждений агента, как показано в других исследованиях компаний DeepMind и Vicarious.

Функции энергии позволяют создавать системы, которые способны генерировать (слева), а также распознавать (справа) базовые концепты, такие как понятие квадрата.
Функции энергии работают путем кодирования предпочтений в отношении состояний мира, что позволяет агенту с различными доступными действиями (изменение крутящего момента против прямого изменения положения) изучить политику, которая работает в разных контекстах — это грубо соответствует выработке концептуального понимания простых вещей.
Как это работает
Для создания функции энергии мы математически представляем концепты в виде энергетических моделей. Идея энергетических моделей уходит корнями в физику, опираясь на интуитивное представление о том, что наблюдаемые события и состояния представляют собой конфигурации с низким уровнем энергии.
Мы определяем функцию энергии E (x, a, w) для каждого концепта через следующие элементы:
- Состояние мира, наблюдаемое моделью (x)
- Маску внимания (a) над сущностями в этом состоянии.
- Вектор с непрерывными значениями (w), используемый в качестве условия и определяющий концепт, для которого вычисляется энергия.
Состояния мира состоят из наборов сущностей, а также их свойств и позиций (как точки ниже, обладающие как пространственными свойствами, так и свойствами цвета). Маски внимания, используемые для «идентификации», отражают фокус модели на определенном наборе сущностей. Энергетическая модель выдает единое положительное число, указывающее, удовлетворен ли концепт (когда энергия равна нулю) или нет (когда энергия высока). Концепт считается удовлетворенным, когда маска внимания сфокусирована на наборе сущностей, представляющих данный концепт. Для этого требуется как нахождение сущностей в правильных позициях (модификация x, или генерация), так и фокусировка на правильных сущностях (модификация a, или идентификация).
Мы конструируем функцию энергии в виде нейронной сети на основе архитектуры реляционных сетей, что позволяет ей принимать произвольное количество сущностей в качестве входных данных. Именно параметры этой функции энергии оптимизируются в ходе нашей процедуры обучения; остальные функции выводятся из энергетической функции неявно.
Этот подход позволяет нам использовать функции энергии для обучения единой сети, способной выполнять как генерацию, так и распознавание. Это дает возможность перекрестно применять концепты, изученные в ходе генерации, к идентификации и наоборот. (Примечание: этот эффект уже наблюдается у животных благодаря зеркальным нейронам.)
Обучение единой сети
Наши обучающие данные состоят из траекторий (маска внимания, состояние), которые мы заранее генерируем для конкретных концептов, которым наша модель должна обучиться. Мы обучаем модель, предоставляя ей набор демонстраций (обычно 5) для заданного набора концептов, а затем предлагаем новую среду (X0) и просим спрогнозировать следующее состояние (X1) и следующую маску внимания (a). Мы оптимизируем функцию энергии таким образом, чтобы следующее состояние и следующая маска внимания, обнаруженные в обучающих данных, получали низкие значения энергии. Подобно генеративным моделям вроде вариационных автоэнкодеров, модель стимулируется к изучению значений, которые полезно сжимают аспекты задачи. Мы обучили нашу модель, используя различные концепты, включающие визуальные, пространственные, проксимальные и временные отношения, а также количественные оценки в среде двумерных частиц.
Ключевые результаты
Мы оценили наш подход наборе задач, призванных проверить, насколько хорошо наша единая система способна научиться идентифицировать и генерировать объекты, объединенные одним концептом; наша система может научиться классифицировать и генерировать специфические наборы пространственных отношений, перемещать сущности по сцене определенным образом или вырабатывать хорошие оценки для таких концептов, как количество (один, два, три или более трех) или близость.
Модели показывают лучшие результаты, когда могут разделять опыт между задачами генерации концептов (путем перемещения сущностей внутри вектора состояния x) и их идентификации (путем изменения маски внимания над фиксированным вектором состояния): когда мы оценивали модели, обученные обеим этим операциям, они демонстрировали лучшие результаты в каждой отдельной операции по сравнению с моделями, обученными только какой-то одной из них. Мы также обнаружили признаки трансфертного обучения — функция энергии, обученная исключительно в контексте распознавания, успешно справляется с генерацией даже без предварительного целенаправленного обучения этому.
Дальнейшие шаги
В будущем мы с энтузиазмом планируем исследовать более широкий спектр концептов, изученных в более богатых трехмерных средах, интегрировать концепты с политикой принятия решений наших агентов (до сих пор мы рассматривали концепты лишь как нечто, усвоенное из пассивного опыта), а также изучить связи между концептами и пониманием языка. Если вам интересна эта область исследований, подумайте о том, чтобы начать работу в OpenAI!
Автор
Выражение признательности
Спасибо тем, кто внес свой вклад в эту статью и публикацию в блоге:
Публикация в блоге: Прафулла Дхаривал, Алекс Никол, Алек Рэдфорд, Юра Бурда, Джек Кларк, Грег Брокман, Илья Суцкевер, Эшли Пилипишин
Полный текст статьи читайте на OpenAI
