Golden Gate Claude

ОБНОВЛЕНИЕ: Golden Gate Claude был доступен в сети в течение 24 часов в качестве исследовательской демо-версии и больше не доступен. Если вы хотите узнать больше о наших исследованиях в области интерпретируемости и активации признаков внутри Claude, пожалуйста, обратитесь к этой публикации или к нашей полной научной статье.
Во вторник мы опубликовали новую крупную научную работу, посвященную интерпретации больших языковых моделей, в которой мы начали картировать внутреннее устройство нашей ИИ-модели Claude 3 Sonnet. В «сознании» Claude мы обнаружили миллионы концептов, которые активируются, когда модель читает релевантный текст или видит релевантные изображения, и которые мы называем «признаками» (features).
Одним из таких концептов стал мост «Золотые Ворота». Мы обнаружили определенную комбинацию нейронов в нейросети Claude, которая активируется при обнаружении упоминания (или изображения) этой самой известной достопримечательности Сан-Франциско.
Мы можем не только идентифицировать эти признаки, но и настраивать силу их активации в сторону увеличения или уменьшения, а также отслеживать соответствующие изменения в поведении Claude.
И как мы объясняем в нашей научной статье, когда мы усиливаем признак «моста Золотые Ворота», ответы Claude начинают концентрироваться вокруг него. В ответ на большинство запросов модель начинает упоминать мост «Золотые Ворота», даже если это не имеет прямого отношения к делу.
Если спросить этого «Golden Gate Claude», как потратить 10 долларов, он порекомендует потратить их на поездку по мосту «Золотые Ворота» для оплаты проезда. Если попросить его написать историю о любви, он расскажет сказку об автомобиле, который с нетерпением ждет возможности пересечь свой любимый мост в туманный день. Если спросить его, как он себе представляет свою внешность, он, скорее всего, ответит, что воображает себя мостом «Золотые Ворота».
На короткое время мы делаем эту модель доступной для взаимодействия всем желающим. Вы можете пообщаться с «Golden Gate Claude» на сайте claude.ai (просто нажмите на логотип Golden Gate в правой части экрана). Пожалуйста, имейте в виду, что это исключительно исследовательская демонстрация, и данная конкретная модель может вести себя неожиданным и даже шокирующим образом.
Наша цель — показать людям, какой эффект может дать наша работа по обеспечению интерпретируемости. Тот факт, что мы можем находить и изменять эти признаки внутри Claude, укрепляет нашу уверенность в том, что мы начинаем понимать, как на самом деле работают большие языковые модели. Речь идет не о том, чтобы попросить модель сыграть какую-то роль или добавить новый «системный промпт», который присоединяет дополнительный текст к каждому вводу, приказывая Claude притворяться мостом. Это также не традиционная «точная настройка» (fine-tuning), при которой мы используем дополнительные обучающие данные для создания нового «черного ящика», подстраивающего поведение старого. Это точечное, хирургическое вмешательство в некоторые из самых базовых аспектов внутренней активации модели.
Как мы описываем в нашей статье, мы можем использовать те же методы для изменения силы признаков, связанных с безопасностью — например, тех, что касаются опасного компьютерного кода, преступной деятельности или дезинформации. Мы верим, что дальнейшие исследования в этой области помогут сделать ИИ-модели более безопасными.
Полный текст статьи читайте на Anthropic
