Извлечение концептов из GPT‑4

Мы применили новые масштабируемые методы для декомпозиции внутренних представлений GPT‑4 на 16 миллионов понятных человеку паттернов.

Читать научную статьюПосмотреть кодОбзор признаков

В настоящее время мы не до конца понимаем, как интерпретировать нейронную активность внутри языковых моделей. Сегодня мы делимся усовершенствованными методами поиска большого количества «признаков» — паттернов активности, которые, как мы надеемся, поддаются осмыслению человеком. Наши методы масштабируются лучше существующих аналогов, и мы используем их для обнаружения 16 миллионов признаков в GPT‑4. Мы передаем исследовасульскому сообществу научную статью, код и визуализации признаков для содействия дальнейшим исследованиям.

Проблема интерпретации нейронных сетей

В отличие от большинства созданных человеком вещей, мы не до конца понимаем внутреннее устройство нейронных сетей. Например, инженеры могут напрямую проектировать, оценивать и ремонтировать автомобили на основе спецификаций их компонентов, обеспечивая безопасность и производительность. Однако нейронные сети не проектируются напрямую; вместо этого мы создаем алгоритмы, которые их обучают. Полученные сети изучены недостаточно хорошо и не поддаются простой декомпозиции на идентифицируемые части. Это означает, что мы не можем рассуждать о безопасности ИИ так же, как мы рассуждаем, например, о безопасности автомобилей.

Чтобы понять и интерпретировать нейронные сети, нам сначала нужно найти полезные строительные блоки для нейронных вычислений. К сожалению, нейронные активации внутри языковой модели срабатывают по непредсказуемым паттернам, по-видимому, одновременно представляя множество концептов. Кроме того, они активируются плотно, что означает, что каждая активация постоянно срабатывает на каждом входе. Но концепты реального мира обладают высокой разреженностью — в любом конкретном контексте релевантна лишь небольшая доля всех концептов. Это побуждает использовать разреженные автоэнкодеры (sparse autoencoders) — метод выявления небольшого набора «признаков» в нейронной сети, которые важны для получения любого конкретного вывода, подобно тому небольшому набору концептов, который человек может держать в уме при рассуждении о какой-либо ситуации. Их признаки демонстрируют разреженные паттерны активации, которые естественным образом согласуются с концептами, легко понимаемыми людьми, даже без прямых стимулов к интерпретируемости.

A diagram demonstrating the Sparse autoencoder encoding and decoding dense neural activations sparse features.

Тем не менее, на пути обучения разреженных автоэнкодеров остаются серьезные проблемы. Большие языковые модели представляют огромное количество концептов, и наши автоэнкодеры должны быть соответствующим образом огромными, чтобы приблизиться к полному охвату концептов в передовой модели. Изучение большого количества разреженных признаков представляет собой сложную задачу, и предыдущие работы не демонстрировали хорошей масштабируемости.

Наш прогресс в исследованиях: масштабное обучение автоэнкодеров

Мы разработали новые передовые методологии, которые позволяют масштабировать наши разреженные автоэнкодеры до десятков миллионов признаков на передовых моделях ИИ. Мы обнаружили, что наша методология демонстрирует плавное и предсказуемое масштабирование с лучшей отдачей от масштаба по сравнению с предыдущими методами. Мы также представляем несколько новых метрик для оценки качества признаков.

Мы использовали наш подход для обучения различных автоэнкодеров на активациях GPT‑2 small и GPT‑4, включая автоэнкодер с 16 миллионами признаков для GPT‑4. Чтобы проверить интерпретируемость признаков, мы визуализируем конкретный признак, показывая документы, в которых он активируется. Вот некоторые из обнаруженных нами интерпретируемых признаков:

Мы обнаружили множество других интересных признаков, с которыми вы можете ознакомиться здесь.

Ограничения

Мы рады тому, что в будущем интерпретируемость повысит надежность моделей и управляемость ими. Тем не менее, это пока еще ранняя работа со множеством ограничений:

  • Как и в предыдущих работах, многие из обнаруженных признаков по-прежнему сложны для интерпретации: многие из них активируются без четкого паттерна или демонстрируют ложные активации, не связанные с концептом, который они, судя по всему, обычно кодируют. Кроме того, у нас нет хороших способов проверки достоверности интерпретаций.
  • Разреженный автоэнкодер фиксирует не все поведение исходной модели. В настоящее время прогон активаций GPT‑4 через разреженный автоэнкодер приводит к производительности, эквивалентной модели, обученной примерно с в 10 раз меньшими вычислительными затратами. Чтобы полностью составить карту концептов в передовых языковых моделях, нам, возможно, потребуется масштабировать их до миллиардов или триллионов признаков, что было бы сложной задачей даже с нашими усовершенствованными методами масштабирования.
  • Разреженные автоэнкодеры могут находить признаки в одной точке модели, но это лишь один шаг к интерпретации модели. Требуется гораздо больше работы, чтобы понять, как модель вычисляет эти признаки и как они используются в дальнейшем в остальной части модели.

Взгляд в будущее и открытие исходного кода наших исследований

Хотя исследования разреженных автоэнкодеров вызывают воодушевление, впереди долгий путь с множеством нерешенных задач. В краткосрочной перспективе мы надеемся, что найденные нами признаки окажутся практически полезными для мониторинга и управления поведением языковых моделей, и планируем протестировать это на наших передовых моделях. В конечном счете мы надеемся, что однажды интерпретируемость предоставит нам новые способы рассуждения о безопасности и надежности моделей, а также значительно повысит наше доверие к мощным моделям ИИ за счет предоставления твердых гарантий их поведения.

Сегодня мы делимся научной статьей, подробно описывающей наши эксперименты и методы, что, как мы надеемся, облегчит исследователям обучение автоэнкодеров в больших масштабах. Мы выпускаем полный набор автоэнкодеров для GPT‑2 small, а также код для их использования и визуализатор признаков, чтобы дать представление о том, чему могут соответствовать признаки GPT‑2 и GPT‑4.

Авторы

Джеффри Ву (Jeffrey Wu), Лео Гао (Leo Gao), Том Дюпре ла Тур (Tom Dupré la Tour), Хенк Тиллман (Henk Tillman)

Благодарности

Тая Кристиансон (Taya Christianson), Элизабет Проль (Elizabeth Proehl), Йо Шавит (Yo Shavit), Нико Феликс (Niko Felix), Кэти Йе (Cathy Yeh), Габриэль Го (Gabriel Goh), Раджан Тролл (Rajan Troll), Алек Радфорд (Alec Radford), Ян Лейке (Jan Leike), Илья Суцкевер (Ilya Sutskever), Дэвид Робинсон (David Robinson), Грег Брокман (Greg Brockman)

Полный текст статьи читайте на OpenAI