Представляем атласы активации

Читать статьюПопробовать демо
Introducing Activation Atlases

Мы создали атласы активации (в сотрудничестве с исследователями из Google) — новый метод визуализации того, что представляют собой взаимодействия между нейронами. Поскольку системы ИИ внедряются в самых разных чувствительных сферах, лучшее понимание их внутренних процессов принятия решений позволит нам выявлять слабые места и исследовать сбои.

Современные нейронные сети частокритикуют как «черные ящики». Несмотря на их успех в решении самых разных задач, мы лишь в ограниченной степени понимаем, как они принимают решения изнутри. Атласы активации предоставляют новый способ увидеть то, что происходит внутри этого ящика.

Visualization of an image atlas

Атласы активации базируются на визуализации признаков — методе изучения того, что могут представлять собой скрытые слои нейронных сетей. Ранниеработы по визуализации признаков в основном были сфокусированы на отдельных нейронах. Собирая сотни тысяч примеров взаимодействия нейронов и визуализируя их, атласы активации переходят от отдельных нейронов к визуализации пространства, которое эти нейроны представляют совместно.

Visualization of an image mapping process

Понимание того, что происходит внутри нейронных сетей — это не просто вопрос научного любопытства: наш недостаток понимания ограничивает наши возможности по проверке (аудиту) нейросетей и, в контексте высоких ставок, обеспечению их безопасности. В обычных условиях при развертывании критически важного программного обеспечения можно было бы изучить все пути выполнения кода или даже провести формальную верификацию, но в случае с нейросетями наши возможности по проведению такого анализа до сих пор весьма ограничены. С помощью атласов активации люди могут обнаруживать непредвиденные проблемы в нейронных сетях — например, случаи, когда сеть опирается на ложные корреляции при классификации изображений или когда повторное использование признака между двумя классами приводит к странным багам. Люди могут даже использовать это понимание для того, чтобы »атаковать» модель, модифицируя изображения, чтобы обмануть ее.

Например, можно создать особый вид атласа активации, который показывает, как сеть различает сковороды и воки. Многие видимые нами особенности вполне ожидаемы. Сковороды более квадратные, в то время как воки более круглые и глубокие. Но также оказывается, что модель научилась различать сковороды и воки по окружающим их продуктам питания — в частности, вок ассоциируется с присутствием лапши. Добавление лапши в угол изображения обманывает модель в 45% случаев! Это похоже на такие разработки, как состязательные патчи, но основывается на человеческом понимании.

Wok Atlas

Другие разработанные людьми атаки, основанные на перегрузке сетью определенных детекторов признаков, часто оказываются еще более эффективными (некоторые срабатывают в 93% случаев). Но пример с лапшой представляет особый интерес, поскольку это случай, когда модель улавливает нечто скоррелированное, но не причинно связанное с правильным ответом. Структурно это похоже на те типы ошибок, которые вызывают у нас наибольшее беспокойство, например, проблемы честности и предвзятости.

Атласы активации сработали лучше, чем мы ожидали, и убедительно свидетельствуют о том, что активации нейронных сетей могут иметь понятный для человека смысл. Это дает нам большую уверенность в том, что в зрительных моделях можно достичь интерпретируемости в полном смысле.

Мы рады проделать эту работу в сотрудничестве с исследователями из Google. Мы верим, что совместная работа над исследованиями в области безопасности помогает нам всем обеспечить наилучшие результаты для общества по мере развития исследований в сфере ИИ.

Хотите сделать нейронные сети прозрачными? Подайте заявкуна работу в OpenAI.

Авторы

Крис Олах (Chris Olah), Людвиг Шуберт (Ludwig Schubert)

Благодарности

Спасибо нашим соавторам из Google: Шону Картеру (Shan Carter), Зан Армстронг (Zan Armstrong) и Иану Джонсону (Ian Johnson).

Спасибо Грегу Брокману (Greg Brockman), Дарио Амодеи (Dario Amodei), Джеку Кларку (Jack Clark) и Эшли Пилиписин (Ashley Pilipiszyn) за отзывы об этой публикации в блоге.

Мы также благодарим Кристиана Ховарда (Christian Howard) за помощь в координации со стороны Google, Филиппа Исолу (Phillip Isola) за исполнение обязанностей редактора Distill и Арвинда Сатyanараяна (Arvind Satyanarayan) за отзыв о нашей статье.

Полный текст статьи читайте на OpenAI