Совершенствование защитных механизмов Fable 5 в области биологии

Improving Fable 5's biology safeguards

Мы обновляем механизмы защиты биологических данных в Claude Fable 5, что позволяет существенно сократить количество ложноположительных срабатываний. Теперь пользователи Fable 5 будут гораздо реже сталкиваться с «переключениями» (fallbacks), когда система после биологического запроса переключается на менее мощную модель. По результатам нашего тестирования, это обновление сократило количество переключений, связанных с биологией, примерно на 85% на всех наших платформах.1

Таким образом, Fable 5 сможет оказывать помощь в решении более широкого круга биологических задач.

На практике пользователи будут видеть гораздо меньше переключений при повседневных вопросах о здоровье и образовании — например, при интерпретации результатов анализов, понимании симптомов и изучении биологии в учебных целях. Медицинские работники смогут получать от Fable 5 более качественную поддержку в клинических задачах.

Мы верим, что главная возможность искусственного интеллекта оказать положительное влияние на мир лежит в сфере биологии и медицины, и мы вкладываем значительные средства в создание безопасного способа предоставить биологам передовой доступ. На сегодняшний день Fable по-прежнему переключается на Opus 5 для запросов, которые мы считаем запросами двойного назначения — включая вирусологию, токсикологию и молекулярный дизайн, — поэтому модель пока непригодна для профессиональных биологических исследований и разработки лекарств. Мы стремимся преодолеть этот разрыв за счет создания доверенных путей доступа к передовым возможностям в области биологии.

Зачем мы создали надежные биологические защитные механизмы

Наша цель — предоставить передовые возможности Fable 5 в руки как можно большего числа пользователей и как можно быстрее. Однако для этого нам необходимо управлять нарастающими рисками, которые сопутствуют моделям с такими возможностями. Один из таких рисков лежит в области биологии: Fable 5 теперь превосходит экспертов в некоторых крайне сложных биологических задачах и может оказывать оперативную поддержку в других. Это означает, что модель способна реально помочь исследователю, разрабатывающему новое медицинское лечение (именно поэтому мы так стремимся расширить доступ к модели как за счет улучшений классификатора, так и через программы доверенного доступа). Но в чужих руках те же самые возможности могут быть использованы злоумышленниками, например, для создания биологического оружия. Наши оценки возможностей показывают, что Fable 5 может предоставить значительный прирост возможностей (uplift) для такого субъекта — то есть обеспечить его такими возможностями, которых он не смог бы найти больше нигде.

Часто бывает сложно отличить полезное использование ИИ в биологии от вредоносного. Например, в некоторых случаях исследование методов лечения болезни требует от ученых создания опасных соединений, которые эту болезнь и вызывают. Наиболее очевидно это для живых вакцин, для создания которых ученые должны вырастить тот самый патоген, против которого направлена вакцина. Это справедливо и для некоторых лекарств. Чтобы разработать препарат каптоприл, применяемый при гипертонии, ученые выделили токсичные компоненты змеиного яда, которые резко снижают артериальное давление у человека. По мере развития новых биологических возможностей на переднем краю ИИ мы должны соблюдать осторожность, чтобы новые риски не опередили потенциальные научные выгоды.

Искушенные злоумышленники, желающие использовать наши модели во вред, умело пользуются этой неоднозначностью, чтобы скрыть свои намерения и выдать опасные задачи за обычные исследовательские изыскания. Ежегодный отчет об угрозах за 2026 год, подготовленный разведывательным сообществом США, четко дает понять, что такие субъекты существуют, а достижения в области биотехнологий, включая синтетическую биологию и редактирование генома, «могут привести к возникновению новых биологических угроз». В нем отмечается, что ряд государственных акторов, вероятнее всего, поддерживают активные наступательные программы разработки биологического и химического оружия — программы, которые могут получить ускорение благодаря доступу к базовым возможностям передовых моделей ИИ.

Из-за наших опасений по поводу этих возможностей «двойного назначения» (тех, которые могут применяться как во благо, так и во вред, и грань между которыми не всегда легко провести), мы намеренно выпустили Fable 5 с заблокированными практическими всеми биологическими запросами. Это позволило нам сделать модель доступной для пользователей в других областях. Мы понимали, что это вызовет разочарование у добросовестных исследователей-биологов: в краткосрочной перспективе это приведет к большому количеству ложноположительных срабатываний, когда запросы пользователей, задающих вопросы на биологические темы, будут блокироваться и перенаправляться на менее способную модель. Тем не менее, мы пошли на этот компромисс, поскольку цена нецелевого использования Fable в такой сфере двойного назначения, как биология, потенциально может быть катастрофической.

Как работают наши биологические защитные механизмы

Одним из основных способов защиты от злоупотреблений в биологии являются защитные классификаторы — небольшие автоматизированные системы на базе ИИ, которые обнаруживают моменты, когда Fable 5 просят выполнить защищенную биологическую задачу или выдать вредоносный результат (ранее мы уже писали о подобных классификаторах в сфере кибербезопасности).

В случае с Fable 5, при срабатывании классификатора модель перенаправляет запрос пользователя на Opus 5 — способную модель, которая не обладает тем же уровнем биологической квалификации, что и Fable 5, и не может оказать столь же существенную помощь злоумышленнику. Именно это переключение видят пользователи при блокировке их запросов.

Разработка точных и надежных классификаторов — задача не из простых. Чтобы классификатор работал быстро и стабильно, он должен научиться различать то, что мы считаем «уместным» (in scope) и «неуместным» (out of scope) для тем и запросов, которые мы считаем потенциально опасными. На точную настройку классификаторов уходит время и требуется множество итераций, чтобы избежать как ложноположительных срабатываний (когда классификатор реагирует на контент вне зоны охвата), так и ложноотрицательных (когда релевантный контент пропускается). Мы также требуем, чтобы наши классификаторы были устойчивы к попыткам их обхода (так называемым джейлбрейкам), что требует проведения дополнительных исследований и тестирований.

Начало работы с очень широким биологическим классификатором позволило нам предоставить пользователям доступ к Fable 5, пока мы продолжали исследования, направленные на его доработку. Альтернативный вариант — сдерживание модели до тех пор, пока не будет достигнут гораздо больший прогресс в области защитных мер — отложил бы общий доступ к модели и ее потенциальную пользу для пользователей на недели или месяцы.

В течение последних нескольких недель мы тщательно переписали конституцию классификатора (которая состоит из свода правил, помогающих модели отличать защищенный контент от разрешенного), уделив особое внимание детальному описанию безопасных сценариев использования. Мы запросили отзывы об этих изменениях у широкого круга экспертов (как внутри Anthropic, так и внешних). Затем мы разработали обновленные обучающие данные для классификатора на основе этой конституции, переобучили его и убедились, что новый классификатор по-прежнему в целом срабатывает на опасный и потенциально опасный биологический контент двойного назначения, но теперь открывает доступ к более широкому спектру доброкачественных и полезных сценариев использования.

Как показано на диаграмме ниже, благодаря этим обновлениям — по сравнению с моментом запуска Fable 5 — классификатор будет срабатывать на гораздо меньшее число доброкачественных запросов, связанных с биологией.

Иллюстрация работы наших биологических классификаторов. Контент, попадающий на левую сторону границы классификатора, разрешен; контент на правой стороне защищен (и, следовательно, заблокирован и перенаправлен на менее способную модель). Очевидно вредоносный контент (красный) и контент двойного назначения (оранжевый) активируют классификатор и блокируются. Мы включаем запас прочности безопасности, куда входит контент, который с высокой долей вероятности безопасен, но все же блокируется из соображений повышенной осторожности (светло-зеленый). Очевидно безопасный контент отмечен более темным зеленым цветом.На момент запуска у Fable 5 были очень широкие классификаторы (А), которые срабатывали на самые разные запросы — даже те, которые почти наверняка были безопасными (попадающие в запас прочности безопасности). Таким образом, граница классификатора находилась очень далеко в левой части диаграммы. Обновление, о котором мы объявляем сегодня (Б), означает, что классификатор теперь пропускает гораздо больше безопасных запросов, научившись лучше распознавать тонкие различия между безопасными запросами и запросами двойного назначения. Граница классификатора на диаграмме сместилась правее.

Выводы

Нам предстоит сделать еще очень многое для совершенствования наших защитных механизмов. Ложноположительные срабатывания неизбежно останутся — это запросы, попадающие в запас прочности безопасности классификатора, где риск минимален, но классификатор все равно срабатывает. Как отмечалось выше, Fable продолжит блокировать профессиональные биологические запросы двойного назначения и запросы на разработку лекарств из-за потенциальных рисков двойного назначения. Мы полностью привержены созданию безопасного и масштабируемого пути для исследователей, позволяющего использовать наши самые мощные модели через доверенные каналы доступа.

Мы надеемся, что вы продолжите делиться с нами своими отзывами, чтобы мы могли сделать наши защитные механизмы еще лучше.

Сноски

1 В результате мы ожидаем, что общее количество переключений — будь то по биологическим или любым другим причинам — также сократится: примерно на 67% на Claude.ai, на 55% в Cowork, на 17% в Claude Code и на 7% на платформе Claude.

Полный текст статьи читайте на Anthropic