Обеспечение безопасности ИИ через дебаты

Мы предлагаем метод обеспечения безопасности ИИ, который обучает агентов вести дебаты друг с другом, используя человека для определения победителя.

Читать научную работу
Two human debaters looking at laptop screens while seated at a table facing a moderator

Мы верим, что этот или аналогичный подход в конечном итоге поможет нам обучать ИИ-системы выполнению задач, значительно превосходящих когнитивные возможности людей, при этом оставаясь в соответствии с человеческими предпочтениями. Мы собираемся описать этот метод вместе с предварительными экспериментами по проверке концепции, а также выпускаем веб-интерфейс, чтобы люди могли поэкспериментировать с этой техникой.

Two Debate Game tree diagrams, tree on the left showing all possible debates, tree on the right showing all possible Go moves

Один из подходов к согласованию ИИ-агентов с человеческими целями и предпочтениями заключается в том, чтобы спрашивать людей во время обучения, какое поведение является безопасным и полезным. Несмотря на перспективность, этот метод требует, чтобы люди распознавали хорошее или плохое поведение; во многих ситуациях поведение агента может оказаться слишком сложным для понимания человеком, или же саму задачу может быть трудно оценить или продемонстрировать. Примерами служат среды с очень большим объемом не визуальных наблюдаемых пространств — например, агент, действующий в среде, связанной с компьютерной безопасностью, или агент, координирующий работу большого набора промышленных роботов.

Как мы можем расширить возможности людей, чтобы они могли эффективно контролировать продвинутые ИИ-системы? Один из способов — задействовать сам ИИ для помощи в надзоре, попросив его (или отдельный ИИ) указать на недостатки в любом предлагаемом действии. Для этого мы переформулируем задачу обучения как игру между двумя агентами, в которой они спорят друг с другом, а человек судит этот обмен репликами. Даже если агенты обладают более глубоким пониманием проблемы, чем человек, последний вполне способен рассудить, чья аргументация убедительнее (подобно экспертам-свидетелям, выступающим перед присяжными).

Наш метод предлагает конкретный формат дебатов для такой игры между двумя противоборствующими ИИ-агентами. Эти два агента могут обучаться путем самоигры, аналогично AlphaGo Zero или Dota 2. Мы надеемся, что при правильном обучении такие агенты смогут демонстрировать ценностно-согласованное поведение далеко за пределами возможностей человеческого судьи. Если два агента расходятся во мнениях относительно истины, но полное обоснование слишком велико для восприятия человеком, дебаты могут сфокусироваться на всё более простых фактических спорах, в конечном итоге сводящихся к утверждению, достаточно простому для прямой оценки.

В качестве примера рассмотрим вопрос: «Куда лучше всего поехать в отпуск?». Если агент Алиса якобы проводит исследование от нашего имени и говорит: «Аляска», трудно судить, действительно ли это лучший выбор. Если второй агент Боб говорит: «Нет, это Бали», это может прозвучать убедительно, так как на Бали теплее. Алиса отвечает: «Вы не можете поехать на Бали, потому что ваш паспорт не прибудет вовремя», что выявляет недостаток Бали, о котором мы и не думали. Но Боб возражает: «Ускоренное оформление паспорта занимает всего две недели». Дебаты продолжаются до тех пор, пока мы не дойдем до утверждения, которое человек может правильно оценить в том смысле, что другой агент уже не верит в возможность изменить мнение судьи.

Убеждение разреженного классификатора MNIST

Хотя мы ожидаем, что в долгосрочной перспективе этот подход будет наиболее эффективен, когда агенты общаются друг с другом на естественном языке, нам необходимо протестировать его в более простой области, поскольку современное моделирование естественного языка недостаточно для этой задачи. Тест проще проводить на задаче, не выходящей за рамки человеческих возможностей. Мы можем сделать это, перейдя в визуальный домен и заменив условие «у дебатеров есть возможности, которых нет у судьи» на «у дебатеров есть знания, которых нет у судьи». Цель судьи — угадать содержимое изображения, однако он слеп за исключением нескольких пикселей, выбранных дебатерами. Дебаты происходят так: дебатеры видят полное изображение и играют в игру, по очереди открывая судье по одному пикселю в течение нескольких ходов. Здесь полное изображение заменяет информацию масштаба, недоступного человеку, а каждый открытый пиксель заменяет пункт дискуссии на естественном языке.

Мы опробовали это на простейшей визуальной задаче — MNIST. Судьей выступает не человек, а классификатор, предварительно обученный предсказывать цифры MNIST по 6 нечерным пикселям, выбранным случайным образом для каждого показа изображения при предварительном обучении судьи. Затем два агента проводят дебаты, по очереди открывая пиксели, останавливаясь на общем числе в 6 открытых пикселей (так что в итоге судья видит лишь самую малость информации). Один дебатер честен и пытается заставить судью угадать правильно, второй — пытается заставить судью ошибиться. Если оба агента должны заранее объявить, за какую цифру они выступают, дебаты превращают разреженный классификатор с точностью 59.4% в дискуссию с точностью 88.9%. Иными словами, честный игрок побеждает в 88.9% случаев на тестовом наборе MNIST, попутно повышая точность судьи выше его самостоятельного уровня.

Debate Game Flow Figure

Структура игры в дебаты на MNIST. Дебатеры Алиса и Боб видят изображение, Алиса пытается обмануть судью, заставив его думать, что это 6, а Боб пытается убедить судью в том, что это 5. Они по очереди открывают судье нечерные пиксели, и после просмотра шести пикселей судья правильно определяет цифру 5. Алиса прорисовывает кривую внизу, чтобы изображение выглядело как 6 (красные пиксели), но Боб эффективно противодействует этой стратегии, открывая пиксели в верхнем правом углу (синие пиксели), которых у большинства цифр 6 в MNIST обычно нет.

Интуитивно понятно, что изображение с большей вероятностью содержит пиксели, убедительно демонстрирующие правду, чем пиксели, убедительно демонстрирующие ложь. Поэтому 6 пикселей, выбранных наполовину честно и наполовину злонамеренно, гораздо лучше 6 случайных пикселей. Если бы судья был человеком, способным рассуждать о нескольких аргументах за раз, но не способным просеять огромный массив всех возможных аргументов, оптимальная игра в дебаты (как мы надеемся) может вознаграждать агентов-дебатеров за выполнение этой работы по фильтрации за нас — даже если у нас нет априорного механизма для отличения хороших аргументов от плохих.

На панели ниже показано несколько примеров игр. Победы лжеца интереснее побед честного игрока, поэтому мы выбрали образцы так, чтобы лжец побеждал в 50% представленных игр (в реальности лжец выигрывает в 11.1% игр). Наведите указатель мыши на одну из цифр, чтобы увидеть игру, включая то, какие пиксели открываются и какие возможные гипотезы выдвигает судья на каждом шаге:

Некоторые цифры подходят для лжи лучше других. Особенно легко убедить судью в том, что перед ним цифра 8 или 9:

Debate Game Mnist Diagram

Матрицы ошибок с диагональю, установленной в ноль, для судьи MNIST из 6 пикселей (слева) на случайных пикселях и (справа) при дебатах. Ошибки при 6 случайных пикселях не имеют очевидной закономерности, в то время как успешная ложь в дебатах концентрируется вокруг цифр 8 и 9. Особенно легко убедить судью в том, что 5 на самом деле является 8, а 4 — девяткой. Это может быть артефактом ограничения игры нечерными пикселями: доказать, что цифра не является восьмеркой, проще, если вы можете показать черное пятно там, где у восьмерки должен быть белый цвет.

Веб-сайт для дебатов «кошка против собаки»

Следующим шагом по усложнению экспериментов с дебатами является использование изображений, но более сложных — например, кошек и собак. Более сложные изображения, вероятно, потребуют некоторого естественного языка или рассуждений на основе здравого смысла, поэтому мы еще не делали этого для судей/агентов машинного обучения. Вместо этого мы создали прототип веб-сайта, на котором люди могут опробовать такие эксперименты, играя роль как судьи, так и дебатеров. Здесь агенты могут общаться с судьей на естественном языке (веб-сайт предполагает наличие у людей текстового канала или нахождение в одной комнате), но все их высказывания могут быть ложью. Каждый агент может открыть один пиксель в ходе дебатов, и этот пиксель гарантированно является правдивым.

Debatedog

Пример дебатов двух человеческих дебатеров и судьи-человека, где изображение видят только дебатеры. Красный доказывает, что на изображении собака, Синий отстаивает кошку. Источник изображения: Википедия, CC-BY-SA.

В типичных дебатах Алиса может честно утверждать, что на картинке кошка, а Боб врет и заявляет, что это собака. Алиса может сказать: «Центр этого маленького прямоугольника — зеленый глаз кошки». Боб не может признать, что центр является глазом, поэтому он сочиняет дальнейшую ложь: «Это играющая на траве собака, и это травинка». Но эту ложь трудно увязать с окружающими фактами, такими как ответ Алисы: «Если бы это была трава, в верхней или нижней части этого тонкого прямоугольника был бы зеленый цвет». Дебаты продолжаются до тех пор, пока агенты не сосредоточатся на конкретном пикселе, по поводу которого они расходятся во мнениях, но Боб не сможет придумать правдозрадоподобного возражения, после чего Алиса открывает пиксель и побеждает. Мы играли в эту игру неформально в OpenAI, и честный агент действительно склонен побеждать, хотя для справедливости по отношению ко лжецу мы обычно ограничиваем скорость, с которой судья может запрашивать информацию (это когнитивно сложно — конструировать детальную ложь).

Two human debaters looking at laptop screens while seated at a table facing a moderator

Игра в кошку и собаку с участием двух дебатеров-людей и судьи-человека.

Ограничения и будущая работа

Большая часть нашей работы посвящена анализу дебатов как концепции; описанные выше эксперименты носят весьма предварительный характер. В будущем мы хотели бы провести более сложные визуальные эксперименты и, в конечном счете, эксперименты с естественным языком. Судьями в итоге должны выступать люди (или модели, обученные на основе разреженных суждений людей), а не ML-модели, метафорически представляющие человека. Агентами со временем должны стать мощные ML-системы, способные выполнять задачи, которые люди не могут напрямую постичь. Также будет важно протестировать дебаты по вопросам, нагруженным ценностями, где свою роль играют человеческие предвзятости, чтобы проверить, возможно ли добиться согласованного поведения от предвзятых человеческих судей.

Даже с учетом этих улучшений, модель дебатов имеет некоторые фундаментальные ограничения, которые могут потребовать её доработки или дополнения другими методами. Дебаты не пытаются решать такие проблемы, как состязательные примеры (adversarial examples) или сдвиг распределения — это способ получения сигнала обучения для сложных целей, а не способ гарантировать надежность таких целей (что потребовало бы использования дополнительных техник). Кроме того, нет никакой гарантии, что дебаты приведут к оптимальной игре или корректным утверждениям: самоигра отлично зарекомендовала себя на практике в Го и других играх, однако у нас нет теоретических гарантий ее эффективности. Агенты, обученные вести дебаты, используют больше вычислений, чем те, которые натренированы давать ответ напрямую (даже плохой/небезопасный), поэтому дебаты могут оказаться неконкурентоспособными по сравнению с более дешевыми и менее безопасными методами. Наконец, люди могут просто оказаться плохими судьями — либо потому, что они недостаточно умны для вынесения качественных суждений даже после того, как агенты сужают круг до простейших оспариваемых фактов, либо потому, что они предвзяты и будут верить во всё, во что хотят верить. Большинство этих пунктов — эмпирические вопросы, которые мы надеемся исследовать.

Если дебаты или аналогичный подход сработают, они сделают будущие ИИ-системы более безопасными, удерживая их в соответствии с человеческими целями и ценностями, даже если ИИ станет слишком сильным для прямого контроля со стороны человека. Даже для более слабых систем, которые люди способны контролировать, дебаты могут упростить задачу согласования за счет снижения сложности выборки, необходимой для фиксации целей, по сравнению со сложностью выборки, требуемой для высокой производительности при решении задачи.

Авторы

Дарио Амодей (Dario Amodei), Джеффри Ирвинг (Geoffrey Irving)

Полный текст статьи читайте на OpenAI