Языковые модели могут объяснять нейроны в языковых моделях

Мы используем GPT‑4 для автоматического написания объяснений поведения нейронов в больших языковых моделях и для оценки этих объяснений. Мы выпускаем датасет таких (несовершенных) объяснений и оценок для каждого нейрона в GPT‑2.
Языковые модели стали более способными и получили широкое распространение, однако наше понимание того, как они устроены изнутри, по-прежнему весьма ограничено. Например, по их выводу бывает трудно определить, используют ли они предвзятые эвристики или прибегают к дезинформации. Исследования в области интерпретируемости призваны раскрыть дополнительную информацию путем изучения модели изнутри.
Один из простых подходов к исследованиям интерпретируемости заключается в том, чтобы сначала понять, что делают отдельные компоненты (нейроны и головы внимания). Традиционно для этого людям приходилось вручнуюосматриватьнейроны, чтобы выяснить, какие именно признаки данных они представляют. Этот процесс плохо масштабируется: его трудно применять к нейронным сетям с десятками или сотнями миллиардов параметров. Мы предлагаем автоматизированный процесс, который использует GPT‑4 для создания и оценки объяснений поведения нейронов на естественном языке, и применяем его к нейронам в другой языковой модели.
Эта работа является частью третьего столпа нашего подхода к исследованиям согласования (alignment): мы хотим автоматизировать саму работу по исследованиям согласования. Перспективным аспектом такого подхода является то, что он масштабируется по мере развития ИИ. По мере того как будущие модели будут становиться все более умными и полезными в качестве ассистентов, мы будем находить все более качественные объяснения.
Как это работает
Наша методология состоит из выполнения 3 шагов для каждого нейрона.
Что мы обнаружили
Используя нашу методологию оценки, мы можем начать измерять эффективность наших методов для различных частей сети и пытаться улучшить их для тех частей, которые на данный момент объясняются хуже всего. Например, наш метод хуже работает для более крупных моделей, возможно потому, что более глубокие слои труднее поддаются объяснению.
Хотя подавляющее большинство наших объяснений получают низкие оценки, мы считаем, что теперь можем использовать методы машинного обучения для дальнейшего повышения нашей способности создавать объяснения. Например, мы обнаружили, что смогли улучшить оценки с помощью следующих действий:
- Итеративная доработка объяснений. Мы можем повысить оценки, попросив GPT‑4 придумать возможные контрпримеры, а затем пересмотрев объяснения с учетом их активаций.
- Использование более крупных моделей для генерации объяснений. Средняя оценка растет по мере увеличения возможностей объясняющей модели. Тем не менее, даже GPT‑4 дает худшие объяснения, чем люди, что указывает на потенциал для улучшений.
- Изменение архитектуры объясняемой модели. Обучение моделей с различными функциями активации улучшило оценки объяснений.
Мы открываем исходный код наших датасетов и инструментов визуализации для созданных с помощью GPT‑4 объяснений всех 307 200 нейронов в GPT‑2, а также код для объяснения и оценки с использованием общедоступных моделей в API OpenAI. Мы надеемся, что исследовательское сообщество разработает новые методы для генерации более точных объяснений и лучшие инструменты для исследования GPT‑2 с помощью таких объяснений.
Мы обнаружили более 1000 нейронов с объяснениями, получившими оценку не менее 0,8, что означает, что, согласно GPT‑4, они описывают большую часть поведения нейрона при максимальной активации. Большинство этих хорошо объясненных нейронов не представляют особого интереса. Тем не менее, мы также нашли множество интересных нейронов, которые GPT‑4 не смогла понять. Мы надеемся, что по мере улучшения объяснений мы сможем быстро получить глубокое качественное понимание вычислений модели.
Перспективы
Наш метод в настоящее время имеет множество ограничений, которые, как мы надеемся, будут преодолены в будущих исследованиях.
- Мы сосредоточились на коротких объяснениях на естественном языке, однако нейроны могут обладать очень сложным поведением, которое невозможно описать лаконично. Например, нейроны могут быть крайне полисемантичными (представлять множество различных концептов) или представлять отдельные концепты, которые люди не понимают или для которых у них нет названий.
- В конечном итоге мы хотим автоматически находить и объяснять целые нейронные схемы, реализующие сложное поведение, в которых нейроны и головы внимания работают совместно. Наш текущий метод объясняет поведение нейронов лишь как функцию исходного текстового ввода, не сообщая ничего о его последующих эффектах. Например, нейрон, активирующийся на знаки препинания (точки), может указывать на то, что следующее слово должно начинаться с заглавной буквы, или инкрементировать счетчик предложений.
- Мы объяснили поведение нейронов, не пытаясь объяснить механизмы, которые это поведение порождают. Это означает, что даже высоко оцененные объяснения могут давать очень плохие результаты на текстах вне распределения, поскольку они просто описывают корреляцию.
- Наша общая процедура требует значительных вычислительных ресурсов.
Мы воодушевлены перспективами расширения и обобщения нашего подхода. В конечном счете мы хотели бы использовать модели для формирования, тестирования и итеративной доработки полностью универсальных гипотез — точно так же, как это делает исследователь-интерпретатолог.
Со временем мы хотим интерпретировать наши крупнейшие модели как способ выявления проблем согласования и безопасности как до, так и после развертывания. Тем не менее, нам предстоит пройти длинный путь, прежде чем эти методы смогут обнаруживать такое поведение, как нечестность.
Авторы
Иллюстрации
Thomas Degry, Nick Cammarata
Благодарности
Hannah Wong, Greg Brockman, Ilya Sutskever, Kendra Rimbach
Полный текст статьи читайте на OpenAI
