Интерпретируемое машинное обучение через обучение

Читать научную работу
Interpretable Machine Learning Through Teaching

Мы разработали метод, который побуждает ИИ обучать друг друга с помощью примеров, понятных и для людей. Наш подход автоматически выбирает наиболее информативные примеры для объяснения концепции — например, лучшие изображения для описания понятия собак — и эксперименты показали его эффективность в обучении ИИ.

Некоторые из наиболее преобразующих приложений мощного ИИ будут созданы в результате сотрудничества компьютеров и людей, но заставить их говорить на общем языке сложно. Подумайте о попытке угадать форму прямоугольника, когда вам показывают лишь набор случайных точек внутри него: гораздо быстрее выяснить правильные размеры прямоугольника, если точки даны по его углам. Наш подход к машинному обучению работает как кооперативная игра между двумя агентами, где один выступает в роли студента, а другой — преподавателя. Цель игры состоит в том, чтобы студент угадал определенную концепцию (например, «собака», «зебра») на основе примеров этой концепции (таких как изображения собак), а цель преподавателя — научиться выбирать наиболее наглядные примеры для студента.

Random Vs Teacher

Наша двухэтапная методика работает следующим образом: «нейросети-студенту» предоставляются случайно выбранные входные примеры концепций, и она обучается на этих примерах с использованием традиционных методов обучения с учителем для угадывания правильных меток концепций. На втором этапе мы позволяем «нейросети-преподавателю» (которая имеет заданную концепцию для обучения и доступ к меткам, связывающим концепции с примерами) тестировать различные примеры на студенте и смотреть, какие метки концепций тот им присваивает, в конечном итоге находя наименьший набор примеров, необходимый для того, чтобы студент мог угадать задуманную концепцию. Эти примеры в итоге выглядят интерпретируемыми, поскольку они по-прежнему привязаны к концепциям (через студента, обученного на первом этапе).

В отличие от этого, если мы обучаем студента и преподавателя совместно (как это делается во многих текущих коммуникативных играх, communication games), они могут вступать в сговор и общаться с помощью произвольных примеров, которые не имеют смысла для людей. Например, понятие «собаки» может в конечном итоге кодироваться с помощью некоторых произвольных векторов, которые могут показывать изображения лам и мотоциклов, или прямоугольник может состоять из двух точек, которые кажутся человеку случайными, но кодируют размеры конкретного прямоугольника.

Чтобы понять, почему наш метод работает, рассмотрим, что происходит, когда мы используем наш подход, чтобы научить студента распознавать концепции по изображениям-примерам, которые различаются по четырем свойствам: размер (маленький, средний, большой), цвет (красный, синий, зеленый), форма (квадрат или круг) и граница (сплошная или отсутствует).

Shape types with outline variations

В этом случае концепция представляет собой набор свойств, которые определяют подмножество примеров как принадлежащих к этой концепции; например, если концепция — красные круги, то красные круги любого размера или с любой границей подходят под эту концепцию. Наша сеть-преподаватель в конечном итоге учится выбирать примеры, единственными общими свойствами которых являются те, которые требуются для данной концепции, так что студент может исключить нерелевантные свойства. Например, чтобы передать концепцию «красного», наш преподаватель выбирает большой красный квадрат без границы, а затем маленький красный круг с границей. Единственное общее свойство этих двух фигур — красный цвет, поэтому концепция должна состоять только из красного цвета.

Shape Examples

Этот подход работает для булевых, иерархических, вероятностных и основанных на правилах концепций, причем методы обучения, изобретенные сетью-преподавателем, часто отражают оптимальные стратегии, разработанные людьми. Мы также оценили наш подход на людях, предоставив им примеры, созданные сетью-преподавателем. Мы обнаружили, что люди-испытуемые на Amazon Mechanical Turk, получавшие примеры от нашего машинного преподавателя, смогли угадать правильную концепцию чаще, чем если бы им просто предоставлялись случайные примеры.

Хотя в этой работе мы рассматривали обучение только на примерах, эти идеи могут применяться к созданию интерпретируемого общения между агентами или другим способам, с помощью которых мы хотели бы сделать взаимодействие между агентами более понятным для людей. Если вам интересно работать над такими задачами, подумайте о том, чтобы присоединиться к OpenAI!

Авторы

Смита Милли (Smitha Milli), Питер Аббил (Pieter Abbeel), Игорь Мордач (Igor Mordatch)

Полный текст статьи читайте на OpenAI