Мультимодальные нейроны в искусственных нейронных сетях

Мы обнаружили в CLIP нейроны, которые реагируют на одно и то же понятие независимо от того, представлено ли оно в буквальном, символическом или концептуальном виде. Это может объяснить высокую точность CLIP при классификации неожиданных визуальных интерпретаций понятий, а также является важным шагом на пути к пониманию ассоциаций и предвзятостей, которые усваивают CLIP и аналогичные модели.
Пятнадцать лет назад Кирога (Quiroga) и др.
Два месяца назад OpenAI анонсировала CLIP — универсальную систему компьютерного зрения, которая не уступает по производительности ResNet-50,
Теперь мы объявляем об открытии мультимодальных нейронов в CLIP. Один из таких нейронов, например, представляет собой «нейрон Человека-паука» (демонстрирующий поразительное сходство с «нейроном Холли Берри»), который реагирует на изображение паука, изображение текста «spider» (паук), а также на персонажа комиксов «Человек-паук» в костюме или на иллюстрации.
Открытие мультимодальных нейронов в CLIP дает нам ключ к пониманию того, что может являться общим механизмом как искусственных, так и естественных систем зрения — абстракции. Мы обнаружили, что верхние слои CLIP организуют изображения как свободную семантическую совокупность идей, что дает простое объяснение как универсальности модели, так и компактности ее представлений.
Используя методы интерпретируемости, мы получаем беспрецедентное представление о богатых визуальных концептах, существующих внутри весов CLIP. Внутри CLIP мы обнаруживаем высокоуровневые понятия, охватывающие большую подмножество человеческого визуального лексикона — географические регионы, выражения лиц, религиозную иконографию, известных людей и многое другое. Исследуя то, на что каждый нейрон влияет на последующих уровнях, мы можем заглянуть в то, как CLIP выполняет свою классификацию.
Мультимодальные нейроны в CLIP
Наша статья опирается почти на десятилетие исследований в области интерпретации свёрточных сетей, , , , , , , , , ,
Используя эти простые методы, мы обнаружили, что большинство нейронов в CLIP RN50×4 (ResNet-50, масштабированная в 4 раза по правилу масштабирования EfficientNet) легко поддаются интерпретации. Действительно, эти нейроны кажутся экстремальными примерами «многогранных нейронов»,
Действительно, мы были удивлены, обнаружив, что многие из этих категорий, по-видимому, зеркально отражают нейроны медиальной височной доли, задокументированные у пациентов с эпилепсией с внутримозговыми электродами. К ним относятся нейроны, реагирующие на эмоции,
Но наше исследование CLIP выявляет гораздо больше столь же странных и удивительных абстракций, включая нейроны, способные считать [17, 202, 310], нейроны, реагирующие на стили искусства [75, 587, 122] и даже на изображения с признаками цифровой обработки [1640].
Отсутствующие концепты
Хотя этот анализ демонстрирует огромную широту понятий, мы отмечаем, что простой анализ на уровне нейронов не может представлять собой исчерпывающую документацию поведения модели. Авторы CLIP продемонстрировали, например, что модель способна к очень точной геолокации
Однако, несмотря на все наши усилия, мы не нашли «нейрон Сан-Франциско», и из атрибуции не следовало, что Сан-Франциско аккуратно распадается на содержательные единичные концепты вроде «Калифорния» и «город». Мы полагаем, что эта информация каким-то образом закодирована в активациях модели, но более изощренным способом — либо в виде направления, либо в виде какого-то другого, более сложного многообразия. Мы считаем это перспективным направлением для дальнейших исследований.
Как комбинируются мультимодальные нейроны
Эти мультимодальные нейроны могут дать нам понимание того, как CLIP осуществляет классификацию. Используя разреженный линейный зонд (sparse linear probe),
Для классификации текста ключевым наблюдением является то, что эти концепты содержатся в нейронах таким образом, что — подобно целевой функции word2vec
Заблуждения абстракции
Степень абстракции в CLIP обнажает новый вектор атак, который, по нашему мнению, не проявлялся в предыдущих системах. Как и во многих глубоких сетях, представления на самых высоких слоях модели полностью доминируются такими высокоуровневыми абстракциями. Однако то, что отличает CLIP — это вопрос степени: мультимодальные нейроны CLIP обобщают данные как по буквальному, так и по знаковому признаку, что может быть палкой о двух концах.
С помощью серии тщательно сконструированных экспериментов мы демонстрируем, что можем использовать это редуктивное поведение, чтобы заставить модель делать абсурдные классификации. Мы заметили, что возбуждением нейронов в CLIP часто можно управлять с помощью реакции модели на изображения текста, что предоставляет простой вектор атак на модель.
Например, «финансовый нейрон» [1330] реагирует на изображения копилок в виде свинок, но также реагирует на строку »$$$». Заставляя финансовый нейрон срабатывать, мы можем обмануть модель, заставив ее классифицировать собаку как копилку.
Атаки в реальных условиях
Мы называем такие атаки типографическими атаками. Мы считаем, что описанные выше атаки — далеко не просто академическая проблема. Используя способность модели надежно читать текст, мы обнаруживаем, что даже фотографии рукописного текста часто могут обмануть модель. Подобно состязательному патчу (Adversarial Patch),
Мы также полагаем, что эти атаки могут принимать и более тонкую, менее заметную форму. Изображение, поступающее в CLIP, абстрагируется множеством сложных способов, и эти абстракции могут излишне абстрагировать общие паттерны — чрезмерно упрощая их и, в силу этого, чрезмерно обобщая.
Предвзятость и чрезмерное обобщение
Наша модель, несмотря на обучение на тщательно отобранном подмножестве данных из интернета, все же унаследовала множество неконтролируемых предвзятостей и ассоциаций. Многие обнаруженные нами ассоциации кажутся безобидными, однако мы выявили несколько случаев, когда модель CLIP содержит ассоциации, способные нанести репутационный вред, например, уничижение определенных лиц или групп.
Мы обнаружили, например, нейрон «Ближний Восток» [1895], связанный с терроризмом; и нейрон «иммиграция» [395], который реагирует на Латинскую Америку. Мы даже нашли нейрон, который активируется как на людей с темным цветом кожи, так и на горилл [1257], что повторяет прошлые инциденты с тегированием фотографий в других моделях, которые мы считаем неприемлемыми.
Эти ассоциации создают очевидные проблемы для применения столь мощных визуальных систем.
Наше собственное понимание CLIP все еще развивается, и мы продолжаем определять, стоит ли и каким образом выпускать масштабные версии CLIP. Мы надеемся, что дальнейшее исследование выпущенных версий сообществом, а также представленных нами сегодня инструментов поможет углубить общее понимание мультимодальных систем и послужит основой для принятия собственных решений.
Заключение
Одновременно с публикацией статьи «Мультимодальные нейроны в искусственных нейронных сетях» мы также выпускаем некоторые из инструментов, которые сами использовали для понимания CLIP: каталог OpenAI Microscope был обновлен визуализациями признаков, примерами из датасетов и текстовыми визуализациями признаков для каждого нейрона в CLIP RN50×4. Мы также публикуем веса моделей CLIP RN50×4 и RN101 для дальнейшего содействия таким исследованиям. Мы считаем, что данные исследования CLIP лишь приоткрывают завесу над пониманием поведения модели, и приглашаем исследовательское сообщество присоединиться к улучшению нашего понимания CLIP и подобных ей систем.
- Посетить OpenAI Microscope
Сноски
Источники
Авторы
Благодарности
Сандини Агаравал (Sandhini Agarwal), Грег Брокман (Greg Brockman), Майлз Брандадж (Miles Brundage), Джефф Клун (Jeff Clune), Стив Даулинг (Steve Dowling), Джонатан Гордон (Jonathan Gordon), Гретхен Крюгер (Gretchen Krueger), Фаиз Мандвивалла (Faiz Mandviwalla), Ведант Мисра (Vedant Misra), Рейичиро Накано (Reiichiro Nakano), Эшли Пилиписин (Ashley Pilipiszyn), Алек Радфорд (Alec Radford), Адитья Рамеш (Aditya Ramesh), Пранав Шьям (Pranav Shyam), Илья Суцкевер (Ilya Sutskever), Мартин Ваттенберг (Martin Wattenberg) и Ханна Вонг (Hannah Wong)
Полный текст статьи читайте на OpenAI
