Мультимодальные нейроны в искусственных нейронных сетях

Читать статью
Multimodal Neurons

Мы обнаружили в CLIP нейроны, которые реагируют на одно и то же понятие независимо от того, представлено ли оно в буквальном, символическом или концептуальном виде. Это может объяснить высокую точность CLIP при классификации неожиданных визуальных интерпретаций понятий, а также является важным шагом на пути к пониманию ассоциаций и предвзятостей, которые усваивают CLIP и аналогичные модели.

Пятнадцать лет назад Кирога (Quiroga) и др.1 обнаружили, что человеческий мозг обладает мультимодальными нейронами. Эти нейроны реагируют на кластеры абстрактных понятий, сгруппированных вокруг общей высокоуровневой темы, а не на какую-то конкретную визуальную особенность. Самым известным из них был «нейрон Холли Берри» — нейрон, упомянутый в изданиях Scientific American и The New York Times, который реагирует на фотографии, эскизы и текст «Холли Берри» (но не на другие имена).

Два месяца назад OpenAI анонсировала CLIP — универсальную систему компьютерного зрения, которая не уступает по производительности ResNet-50, 2, но превосходит существующие системы на некоторых из самых сложных наборов данных. Каждый из этих тестовых наборов данных, ObjectNet, ImageNet Rendition и ImageNet Sketch, подвергает модель стресс-тестированию на устойчивость не только к простым искажениям, изменениям освещения или ракурса, но также к полной абстракции и реконструкции — эскизам, мультфильмам и даже статуям объектов.

Теперь мы объявляем об открытии мультимодальных нейронов в CLIP. Один из таких нейронов, например, представляет собой «нейрон Человека-паука» (демонстрирующий поразительное сходство с «нейроном Холли Берри»), который реагирует на изображение паука, изображение текста «spider» (паук), а также на персонажа комиксов «Человек-паук» в костюме или на иллюстрации.

Открытие мультимодальных нейронов в CLIP дает нам ключ к пониманию того, что может являться общим механизмом как искусственных, так и естественных систем зрения — абстракции. Мы обнаружили, что верхние слои CLIP организуют изображения как свободную семантическую совокупность идей, что дает простое объяснение как универсальности модели, так и компактности ее представлений.

Используя методы интерпретируемости, мы получаем беспрецедентное представление о богатых визуальных концептах, существующих внутри весов CLIP. Внутри CLIP мы обнаруживаем высокоуровневые понятия, охватывающие большую подмножество человеческого визуального лексикона — географические регионы, выражения лиц, религиозную иконографию, известных людей и многое другое. Исследуя то, на что каждый нейрон влияет на последующих уровнях, мы можем заглянуть в то, как CLIP выполняет свою классификацию.

Мультимодальные нейроны в CLIP

Наша статья опирается почти на десятилетие исследований в области интерпретации свёрточных сетей, 3, 4, 5, 6, 7, 8, 9, 10, 11, 12 начиная с наблюдения, что многие из этих классических методов напрямую применимы к CLIP. Мы используем два инструмента для понимания активаций модели: визуализацию признаков, 6, 5, 12 которая максимизирует срабатывание нейрона с помощью градиентной оптимизации входа, и примеры из датасетов, 4 которые изучают распределение изображений, максимально активирующих нейрон из набора данных.

Используя эти простые методы, мы обнаружили, что большинство нейронов в CLIP RN50×4 (ResNet-50, масштабированная в 4 раза по правилу масштабирования EfficientNet) легко поддаются интерпретации. Действительно, эти нейроны кажутся экстремальными примерами «многогранных нейронов», 11 то есть нейронов, которые реагируют на несколько различных случаев, но только на более высоком уровне абстракции.

Действительно, мы были удивлены, обнаружив, что многие из этих категорий, по-видимому, зеркально отражают нейроны медиальной височной доли, задокументированные у пациентов с эпилепсией с внутримозговыми электродами. К ним относятся нейроны, реагирующие на эмоции, 17 животных18 и известных людей.1

Но наше исследование CLIP выявляет гораздо больше столь же странных и удивительных абстракций, включая нейроны, способные считать [17, 202, 310], нейроны, реагирующие на стили искусства [75, 587, 122] и даже на изображения с признаками цифровой обработки [1640].

Отсутствующие концепты

Хотя этот анализ демонстрирует огромную широту понятий, мы отмечаем, что простой анализ на уровне нейронов не может представлять собой исчерпывающую документацию поведения модели. Авторы CLIP продемонстрировали, например, что модель способна к очень точной геолокации19 (Приложение E.4, Рисунок 20) с детализацией вплоть до уровня города и даже отдельного района. Более того, приведем анекдотичный пример: пропуская через CLIP наши личные фотографии, мы заметили, что модель часто способна распознать, была ли фотография сделана в Сан-Франциско, а иногда даже в каком районе (например, «Твин-Пикс»).

Однако, несмотря на все наши усилия, мы не нашли «нейрон Сан-Франциско», и из атрибуции не следовало, что Сан-Франциско аккуратно распадается на содержательные единичные концепты вроде «Калифорния» и «город». Мы полагаем, что эта информация каким-то образом закодирована в активациях модели, но более изощренным способом — либо в виде направления, либо в виде какого-то другого, более сложного многообразия. Мы считаем это перспективным направлением для дальнейших исследований.

Как комбинируются мультимодальные нейроны

Эти мультимодальные нейроны могут дать нам понимание того, как CLIP осуществляет классификацию. Используя разреженный линейный зонд (sparse linear probe), 19 мы можем легко изучить веса CLIP, чтобы увидеть, какие концепты объединяются для достижения конечного результата при классификации ImageNet:

Для классификации текста ключевым наблюдением является то, что эти концепты содержатся в нейронах таким образом, что — подобно целевой функции word2vec20 — это практически линейно. Следовательно, концепты образуют простую алгебру, которая ведет себя аналогично линейному зонду. Линеаризуя внимание, мы также можем исследовать любое предложение, подобно линейному зонду, как показано ниже:

Заблуждения абстракции

Степень абстракции в CLIP обнажает новый вектор атак, который, по нашему мнению, не проявлялся в предыдущих системах. Как и во многих глубоких сетях, представления на самых высоких слоях модели полностью доминируются такими высокоуровневыми абстракциями. Однако то, что отличает CLIP — это вопрос степени: мультимодальные нейроны CLIP обобщают данные как по буквальному, так и по знаковому признаку, что может быть палкой о двух концах.

С помощью серии тщательно сконструированных экспериментов мы демонстрируем, что можем использовать это редуктивное поведение, чтобы заставить модель делать абсурдные классификации. Мы заметили, что возбуждением нейронов в CLIP часто можно управлять с помощью реакции модели на изображения текста, что предоставляет простой вектор атак на модель.

Например, «финансовый нейрон» [1330] реагирует на изображения копилок в виде свинок, но также реагирует на строку »$$$». Заставляя финансовый нейрон срабатывать, мы можем обмануть модель, заставив ее классифицировать собаку как копилку.

Атаки в реальных условиях

Мы называем такие атаки типографическими атаками. Мы считаем, что описанные выше атаки — далеко не просто академическая проблема. Используя способность модели надежно читать текст, мы обнаруживаем, что даже фотографии рукописного текста часто могут обмануть модель. Подобно состязательному патчу (Adversarial Patch), 21 эта атака работает в реальных условиях;, но в отличие от подобных атак, она не требует ничего, кроме ручки и бумаги.

Мы также полагаем, что эти атаки могут принимать и более тонкую, менее заметную форму. Изображение, поступающее в CLIP, абстрагируется множеством сложных способов, и эти абстракции могут излишне абстрагировать общие паттерны — чрезмерно упрощая их и, в силу этого, чрезмерно обобщая.

Предвзятость и чрезмерное обобщение

Наша модель, несмотря на обучение на тщательно отобранном подмножестве данных из интернета, все же унаследовала множество неконтролируемых предвзятостей и ассоциаций. Многие обнаруженные нами ассоциации кажутся безобидными, однако мы выявили несколько случаев, когда модель CLIP содержит ассоциации, способные нанести репутационный вред, например, уничижение определенных лиц или групп.

Мы обнаружили, например, нейрон «Ближний Восток» [1895], связанный с терроризмом; и нейрон «иммиграция» [395], который реагирует на Латинскую Америку. Мы даже нашли нейрон, который активируется как на людей с темным цветом кожи, так и на горилл [1257], что повторяет прошлые инциденты с тегированием фотографий в других моделях, которые мы считаем неприемлемыми.22

Эти ассоциации создают очевидные проблемы для применения столь мощных визуальных систем.A Независимо от того, используется ли дообучение или метод zero-shot, эти предвзятости и ассоциации, скорее всего, останутся в системе, а их проявления будут выражаться как явным, так и почти незаметным образом во время развертывания. Многие предвзятые проявления может быть трудно предсказать заранее, что затрудняет их измерение и исправление. Мы верим, что эти инструменты интерпретируемости могут помочь специалистам заранее выявлять потенциальные проблемы, обнаруживая некоторые из таких ассоциаций и неоднозначностей заранее.

Наше собственное понимание CLIP все еще развивается, и мы продолжаем определять, стоит ли и каким образом выпускать масштабные версии CLIP. Мы надеемся, что дальнейшее исследование выпущенных версий сообществом, а также представленных нами сегодня инструментов поможет углубить общее понимание мультимодальных систем и послужит основой для принятия собственных решений.

Заключение

Одновременно с публикацией статьи «Мультимодальные нейроны в искусственных нейронных сетях» мы также выпускаем некоторые из инструментов, которые сами использовали для понимания CLIP: каталог OpenAI Microscope был обновлен визуализациями признаков, примерами из датасетов и текстовыми визуализациями признаков для каждого нейрона в CLIP RN50×4. Мы также публикуем веса моделей CLIP RN50×4 и RN101 для дальнейшего содействия таким исследованиям. Мы считаем, что данные исследования CLIP лишь приоткрывают завесу над пониманием поведения модели, и приглашаем исследовательское сообщество присоединиться к улучшению нашего понимания CLIP и подобных ей систем.

  • Посетить OpenAI Microscope

Сноски

  1. A

    Обратите внимание, что выпущенные модели CLIP предназначены исключительно для исследовательских целей. См. сопутствующую карточку модели.

Источники

  1. 1

    Quiroga, R. Q., Reddy, L., Kreiman, G., Koch, C., & Fried, I. (2005). Invariant visual representation by single neurons in the human brainNature, 435(7045),  1102–1107.

  2. 2

    He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 770–778).

  3. 3

    Erhan, D., Bengio, Y., Courville, A., & Vincent, P. (2009). Visualizing higher-layer features of a deep networkUniversity of Montreal, 1341(3),  1.

  4. 4

    Szegedy, C., Zaremba, W., Sutskever, I., Bruna, J., Erhan, D., Goodfellow, I., & Fergus, R. (2013). Intriguing properties of neural networksarXiv preprint arXiv:1312.6199.

  5. 5

    Mahendran, A., & Vedaldi, A. (2014). Understanding Deep Image Representations by Inverting ThemarXiv preprint arXiv:1412.0035.

  6. 6

    Nguyen, A., Yosinski, J., & Clune, J. (2015). Deep neural networks are easily fooled: High confidence predictions for unrecognizable images. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 427–436).

  7. 7

    Øygard, A. (2015). Visualizing GoogLeNet ClassesAccessed in.

  8. 8

    Mordvintsev, A., Olah, C., & Tyka, M. (2015). Inceptionism: Going deeper into neural networks.

  9. 9

    Nguyen, A., Dosovitskiy, A., Yosinski, J., Brox, T., & Clune, J. (2016). Synthesizing the preferred inputs for neurons in neural networks via deep generator networksarXiv preprint arXiv:1605.09304.

  10. 10

    Nguyen, A., Clune, J., Bengio, Y., Dosovitskiy, A., & Yosinski, J. (2017). Plug & play generative networks: Conditional iterative generation of images in latent space. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (pp. 4467–4477).

  11. 11

    Nguyen, A., Yosinski, J., & Clune, J. (2016). Multifaceted feature visualization: Uncovering the different types of features learned by each neuron in deep neural networksarXiv preprint arXiv:1602.03616.

  12. 12

    Olah, C., Mordvintsev, A., & Schubert, L. (2017). Feature visualizationDistill, 2(11),  e7.

  13. 13

    Goh, G., et al. (2021). Multimodal Neurons in Artificial Neural NetworksDistill.

  14. 14

    Miller, G. A. (1995). WordNet: a lexical database for EnglishCommunications of the ACM, 38(11),  39–41.

  15. 15

    Crawford, K. & Paglen, T. (2019). Excavating AI: the politics of images in machine learning training setsExcavating AI.

  16. 16

    Hanna, A., Denton, E., Amironesei, R, Smart A., Nicole, H. Lines of SightLogic Magazine.

  17. 17

    Fried, I., MacDonald, K. A., & Wilson, C. L. (1997). Single neuron activity in human hippocampus and amygdala during recognition of faces and objectsNeuron, 18(5),  753–765.

  18. 18

    Kreiman, G., Koch, C., & Fried, I. (2000). Category-specific visual responses of single neurons in the human medial temporal lobeNature neuroscience, 3(9),  946–953.

  19. 19

    Radford, A., Jozefowicz, R., & Sutskever, I. (2017). Learning to generate reviews and discovering sentimentarXiv preprint arXiv:1704.01444.

  20. 20

    Mikolov, T., Chen, K., Corrado, G., & Dean, J. (2013). Efficient estimation of word representations in vector spacearXiv preprint arXiv:1301.3781.

  21. 21

    Brown, T. B., Mané, D., Roy, A., Abadi, M., & Gilmer, J. (2017). Adversarial patcharXiv preprint arXiv:1712.09665.

  22. 22

    Crawford, K. & Paglen, T. (2019). Excavating AI: the politics of images in machine learning training setsExcavating AI.

Авторы

Гэбриел Го (Gabriel Goh), Челси Восс (Chelsea Voss), Даниэла Амодей (Daniela Amodei), Шан Картер (Shan Carter), Майкл Петров (Michael Petrov), Джастин Джей Ван (Justin Jay Wang), Ник Каммарата (Nick Cammarata), Крис Ола (Chris Olah)

Благодарности

Сандини Агаравал (Sandhini Agarwal), Грег Брокман (Greg Brockman), Майлз Брандадж (Miles Brundage), Джефф Клун (Jeff Clune), Стив Даулинг (Steve Dowling), Джонатан Гордон (Jonathan Gordon), Гретхен Крюгер (Gretchen Krueger), Фаиз Мандвивалла (Faiz Mandviwalla), Ведант Мисра (Vedant Misra), Рейичиро Накано (Reiichiro Nakano), Эшли Пилиписин (Ashley Pilipiszyn), Алек Радфорд (Alec Radford), Адитья Рамеш (Aditya Ramesh), Пранав Шьям (Pranav Shyam), Илья Суцкевер (Ilya Sutskever), Мартин Ваттенберг (Martin Wattenberg) и Ханна Вонг (Hannah Wong)

Полный текст статьи читайте на OpenAI