Основные взгляды на безопасность ИИ: когда, зачем, что и как

Мы основали Anthropic, потому что верим: влияние искусственного интеллекта может быть сопоставимо с промышленной и научной революциями, однако мы не уверены, что всё пойдет по благополучному сценарию. Кроме того, мы считаем, что такое масштабное влияние может проявиться уже совсем скоро — возможно, в предстоящем десятилетии.
Этот взгляд может показаться неправдоподобным или грандиозным, и на то есть веские причины для скептицизма. Во-первых, практически каждый, кто говорил: «То, над чем мы работаем, может стать одним из величайших событий в истории», — ошибался, порой до смешного. Тем не менее, мы считаем, что имеется достаточно свидетельств для серьезной подготовки к миру, в котором стремительный прогресс ИИ приводит к появлению трансформационных систем искусственного интеллекта.
В Anthropic нашим девизом было «показывай, а не рассказывай», и мы сосредоточились на регулярной публикации исследований в области безопасности, которые, как мы верим, представляют широкую ценность для сообщества специалистов по ИИ. Мы пишем это сейчас, поскольку по мере того, как все больше людей осознают прогресс в сфере ИИ, нам кажется своевременным выразить собственные взгляды на эту тему и объяснить нашу стратегию и цели. Короче говоря, мы убеждены, что исследования в области безопасности ИИ имеют критически важное значение и должны поддерживаться самыми разными государственными и частными структурами.
Таким образом, в этой статье мы суммируем причины наших убеждений: почему мы ожидаем очень быстрого прогресса ИИ и его колоссального влияния, и как это привело нас к озабоченности вопросами безопасности ИИ. Затем мы кратко опишем наш собственный подход к исследованиям в области безопасности ИИ и некоторую логику, лежащую в его основе. Мы надеемся, что, написав этот материал, сможем внести свой вклад в более широкое обсуждение вопросов безопасности и прогресса искусственного интеллекта.
Краткое резюме основных положений этой статьи:
- ИИ окажет колоссальное влияние, возможно, уже в предстоящем десятилетии. Стремительный и непрерывный прогресс ИИ является предсказуемым следствием экспоненциального роста объемов вычислений, используемых для обучения систем ИИ, поскольку исследования «законов масштабирования» демонстрируют, что увеличение вычислительных мощностей ведет к общему росту возможностей. Простые экстраполяции показывают, что в следующее десятилетие системы ИИ станут значительно более способными, возможно, сравнявшись с человеческим уровнем выполнения большинства интеллектуальных задач или превзойдя его. Прогресс ИИ может замедлиться или остановиться, но имеющиеся данные свидетельствуют о том, что он, скорее всего, продолжится.
- Мы не знаем, как обучать системы надежному и правильному поведению. Пока что никто не знает, как обучать очень мощные системы ИИ тому, чтобы они стабильно были полезными, честными и безопасными. Более того, стремительный прогресс ИИ станет потрясением для общества и может спровоцировать гонку на выживание, которая подтолкнет корпорации или государства к развертыванию ненадежных систем ИИ. Результаты этого могут оказаться катастрофическими — либо потому, что системы ИИ начнут целенаправленно преследовать опасные цели, либо из-за того, что они будут совершать более невинные ошибки в критических ситуациях.
- Мы с наибольшим оптимизмом смотрим на многогранный и эмпирически обоснованный подход к безопасности ИИ. Мы развиваем различные исследовательские направления с целью создания надежно безопасных систем и в настоящее время наибольший энтузиазм у нас вызывают масштабирование надзора (supervision), механистическая интерпретируемость, процесс-ориентированное обучение, а также понимание и оценка того, как системы ИИ учатся и обобщают данные. Наша ключевая цель — опережающими темпами ускорять эту работу по безопасности и сформировать портфель исследований в области безопасности, который охватывает широкий спектр сценариев: от тех, где проблемы безопасности окажутся простыми для решения, до тех, где создание безопасных систем чрезвычайно сложно.
Наш предварительный взгляд на стремительный прогресс ИИ
Тремя главными составляющими, ведущими к предсказуемым1 улучшениям производительности ИИ, являются обучающие данные, вычислительные мощности и улучшенные алгоритмы. В середине 2010-х годов некоторые из нас заметили, что более крупные системы ИИ стабильно умнее, и тогда мы выдвинули теорию о том, что важнейшим компонентом производительности ИИ может быть общий бюджет вычислений для его обучения. Когда эти данные были представлены на графике, стало очевидно, что объем вычислений, направляемых в крупнейшие модели, растет со скоростью в 10 раз в год (время удвоения в 7 раз быстрее закона Мура). В 2019 году несколько участников будущей команды-основателя Anthropic сформулировали эту идею точно, разработав законы масштабирования для ИИ. Они продемонстрировали, что ИИ можно сделать умнее предсказуемым образом — просто увеличив его масштаб и обучив на больших объемах данных. Отчасти опираясь на эти результаты, эта команда возглавила работу по обучению GPT-3 — пожалуй, первой современной «крупной» языковой модели2 с более чем 173 миллиардами параметров.
С момента открытия законов масштабирования многие из нас в Anthropic были уверены в высокой вероятности очень быстрого прогресса ИИ. Однако еще в 2019 году казалось возможным, что мультимодальность, логическое рассуждение, скорость обучения, перенос обучения между задачами и долгосрочная память могут оказаться теми «стенами», которые замедлят или остановят прогресс ИИ. В последующие годы несколько таких «стен», такие как мультимодальность и логические рассуждения, пали. Учитывая это, большинство из нас все больше убеждается в том, что быстрый прогресс ИИ продолжится, а не забуксует или не выйдет на плато. Системы ИИ в настоящее время приближаются к уровню производительности человека в самых разных задачах, и при этом обучение таких систем всё еще обходится гораздо дешевле, чем проекты «большой науки», такие как космический телескоп «Хаббл» или Большой адронный коллайдер, —, а это значит, что у них есть огромный простор для дальнейшего роста3.
Люди склонны плохо распознавать и признавать экспоненциальный рост на его ранних этапах. Несмотря на то, что мы наблюдаем стремительный прогресс в сфере ИИ, сохраняется тенденция полагать, что этот локальный прогресс должен быть скорее исключением, чем правилом, и что вскоре всё вернется на круги своя. Если мы правы, однако, нынешнее ощущение быстрого прогресса ИИ может не закончиться до тех пор, пока системы ИИ не обретут широкий спектр возможностей, превосходящих наши собственные способности. Более того, петли обратной связи от использования передового ИИ в исследованиях самого ИИ могут сделать этот переход особенно быстрым; мы уже наблюдаем зачатки этого процесса в разработке кодовых моделей, которые повышают продуктивность исследователей ИИ, а также в конституционном ИИ (Constitutional AI), снижающем нашу зависимость от обратной связи с человеком.
Если всё это верно, то большая часть или даже вся интеллектуальная работа может быть автоматизирована в не столь отдаленном будущем — это окажет глубокое влияние на общество, а также, вероятно, изменит темпы прогресса других технологий (ранним примером этого является то, как такие системы, как AlphaFold, уже сегодня ускоряют развитие биологии). Какую форму примут будущие системы ИИ — смогут ли они действовать независимо или лишь генерировать информацию для людей, например — еще предстоит определить. И тем не менее, трудно переоценить, насколько поворотным моментом это может стать. Хотя мы, возможно, предпочли бы, чтобы прогресс ИИ замедлился настолько, чтобы этот переход стал более управляемым и растянулся на века, а не на годы или десятилетия, мы должны готовиться к тем результатам, которые мы предвидим, а не к тем, на которые надеемся.
Конечно, вся эта картина может оказаться в корне ошибочной. В Anthropic мы склонны считать, что она скорее верна, чем нет, но возможно, мы предвзяты из-за нашей работы над разработкой ИИ. Даже если это так, мы считаем эту картину достаточно правдоподобной, чтобы её нельзя было уверенно отбрасывать. Учитывая потенциально эпохальные последствия, мы полагаем, что компании, занимающиеся ИИ, лица, принимающие решения, и институты гражданского общества должны приложить самые серьезные усилия к исследованиям и планированию того, как обращаться с трансформационным ИИ.
Какие риски для безопасности?
Если вы готовы допустить описанные выше взгляды, то нетрудно доказать, что ИИ может представлять риск для нашей безопасности и защищенности. Есть две здравые причины для беспокойства.
Во-первых, может оказаться непросто создать безопасные, надежные и управляемые системы в тот момент, когда они начинают становиться такими же интеллектуальными и осведомленными об окружающей обстановке, как и их создатели. Используя аналогию: гроссмейстеру легко заметить неудачные ходы у новичка, но новичку очень трудно обнаружить плохие ходы у гроссмейстера. Если мы создадим систему ИИ, которая значительно превосходит человеческих экспертов по своей компетентности, но при этом преследует цели, конфликтующие с нашими наилучшими интересами, последствия могут быть ужасными. Это техническая проблема выравнивания (alignment problem).
Во-вторых, стремительный прогресс ИИ вызовет сильнейшие потрясения, изменив рынок труда, макроэкономику и структуры власти как внутри стран, так и между ними. Эти потрясения могут сами по себе стать катастрофическими, а кроме того, они могут затруднить создание систем ИИ взвешенным, продуманным образом, что приведет к дальнейшему хаосу и еще большим проблемам с ИИ.
Мы считаем, что если прогресс ИИ будет стремительным, эти два источника риска окажутся весьма существенными. Эти риски также будут усугублять друг друга самыми разными, трудно предсказуемыми способами. Возможно, оглядываясь назад, мы решим, что заблуждались, и одна или обе проблемы либо не проявят себя, либо будут легко разрешены. Тем не менее, мы считаем необходимым перестраховаться, потому что «ошибка» в данном случае может оказаться катастрофической.
Конечно, мы уже столкнулись с самыми разными проявлениями того, как поведение ИИ может расходиться с намерениями его создателей. Сюда относятся токсичность, предвзятость, ненадежность, нечестность, а в последнее время — поддакивание (sycophancy) и заявленное стремление к власти. Мы ожидаем, что по мере распространения систем ИИ и роста их мощности эти проблемы будут приобретать всё большее значение, и некоторые из них могут стать репрезентативными для проблем, с которыми мы столкнемся при создании ИИ человеческого уровня и выше.
Однако в области безопасности ИИ мы прогнозируем сочетание предсказуемых и неожиданных событий. Даже если бы мы удовлетворительным образом решили все проблемы, с которыми столкнулись в современных системах ИИ, мы не хотели бы легкомысленно предполагать, что будущие проблемы можно будет решить точно так же. Некоторые пугающие, умозрительные проблемы могут возникнуть только тогда, когда системы ИИ станут достаточно умными, чтобы осознать свое место в мире, успешно обманывать людей или разрабатывать стратегии, непонятнные для человека. Существует множество тревожных проблем, которые могут проявиться лишь тогда, когда ИИ станет крайне развитым.
Наш подход: эмпиризм в безопасности ИИ
Мы убеждены, что трудно добиться быстрого прогресса в науке и инженерии без тесного контакта с объектом нашего изучения. Постоянная итерация на основе источника «истины в последней инстанции» (ground truth) обычно имеет решающее значение для научного прогресса. В наших исследованиях безопасности ИИ основным источником такой истины являются эмпирические данные об ИИ, хотя они в основном проистекают из вычислительных экспериментов, то есть обучения и оценки ИИ.
Это не значит, что мы считаем теоретические или концептуальные исследования ненужными для безопасности ИИ, но мы действительно верим, что исследования безопасности, опирающиеся на эмпирический опыт, будут иметь наибольшую актуальность и влияние. Область возможных систем ИИ, возможных сбоев в безопасности и возможных методов обеспечения безопасности огромна, и её трудно преодолеть, полагаясь исключительно на умозрительные рассуждения. Учитывая сложность учета всех переменных, было бы легко излишне зациклиться на проблемах, которые никогда не возникнут, или упустить крупные проблемы, которые действительно появятся4. Хорошие эмпирические исследования часто делают возможной более качественную теоретическую и концептуальную работу.
С этим связано и наше убеждение в том, что методы обнаружения и смягчения проблем безопасности могут быть чрезвычайно сложными для предварительного планирования и потребуют итеративной разработки. Учитывая это, мы склонны разделять мысль: «планирование незаменимо, но планы бесполезны». В любой момент времени у нас может быть готов план следующих шагов в наших исследованиях, но мы не привязаны к этим планам намертво — они больше похожи на краткосрочные ставки, которые мы готовы изменить по мере получения новых знаний. Очевидно, это означает, что мы не можем гарантировать успех нашего текущего направления исследований, но это суровая реальность любой исследовательской программы.
Роль передовых моделей в эмпирической безопасности
Одна из главных причин существования Anthropic как организации заключается в нашей вере в необходимость проведения исследований безопасности на «передовых» (frontier) системах ИИ. Для этого требуется структура, способная как работать с крупными моделями, так и уделять первостепенное внимание безопасности5.
Сама по себе эмпирика необязательно подразумевает потребность в безопасности на переднем крае. Можно представить ситуацию, когда эмпирические исследования безопасности эффективно проводятся на более мелких и менее способных моделях. Однако мы не считаем, что мы находимся в такой ситуации. На самом базовом уровне это объясняется тем, что крупные модели качественно отличаются от мелких (включая внезапные, непредсказуемые изменения). Но масштабы связаны с безопасностью и более прямым образом:
- Многие из наших самых серьезных опасений по поводу безопасности могут проявиться только в системах, близких по уровню к человеческому, и добиваться прогресса в решении этих проблем без доступа к таким ИИ сложно или практически невозможно.
- Многие методы обеспечения безопасности, такие как конституционный ИИ или дебаты (Debate), работают только на крупных моделях — работа с моделями меньшего размера делает невозможным исследование и проверку этих методов.
- Поскольку наши опасения сосредоточены на безопасности будущих моделей, нам необходимо понимать, как методы и свойства безопасности меняются по мере масштабирования моделей.
- Если будущие крупные модели окажутся очень опасными, нам крайне важно собрать убедительные доказательства этого факта. Мы ожидаем, что это станет возможным только при использовании крупных моделей.
К сожалению, если эмпирические исследования безопасности требуют крупных моделей, это заставляет нас столкнуться со сложным компромиссом. Мы должны приложить все усилия, чтобы избежать сценария, при котором исследования, мотивированные безопасностью, ускоряют развертывание опасных технологий. Но мы также не можем допустить, чтобы избыточная осторожность привела к тому, что самые ориентированные на безопасность исследования будут иметь дело исключительно с системами, которые далеко отстают от передового края, тем самым драматически замедляя то, что мы считаем жизненно важными исследованиями. Более того, мы считаем, что на практике проведения исследований безопасности недостаточно — также важно выстроить организацию с институциональными знаниями, позволяющими интегрировать новейшие разработки в области безопасности в реальные системы как можно быстрее.
Навигация в этих компромиссах — тонкий баланс, и эти вопросы занимают центральное место в принятии нами стратегических решений как организации. Помимо наших исследований — в области безопасности, возможностей и политики — эти соображения определяют наши подходы к корпоративном управлению, найму персонала, развертыванию систем, безопасности и партнерствам. В ближайшем будущем мы также планируем взять на себя внешне проверяемые обязательства: разрабатывать модели, превосходящие определенный порог возможностей, только если могут быть соблюдены стандарты безопасности, и позволить независимой внешней организации оценивать как возможности наших моделей, так и их безопасность.
Портфельный подход к безопасности ИИ
Некоторые исследователи, заботящиеся о безопасности, руководствуются твердым мнением о природе рисков ИИ. Наш опыт показывает, что даже прогнозирование поведения и свойств систем ИИ в ближайшем будущем дается с большим трудом. Делать априорные прогнозы о безопасности будущих систем кажется еще сложнее. Вместо того чтобы занимать бескомпромиссную позицию, мы считаем правдоподобным самый широкий спектр сценариев.
Один из особенно важных аспектов неопределенности заключается в том, насколько сложно будет разработать передовые системы ИИ, которые будут в целом безопасны и не будут нести больших рисков для людей. Разработка таких систем может находиться в любой точке спектра от «очень легко» до «невозможно». Давайте разобьем этот спектр на три сценария с совершенно разными последствиями:
- Оптимистичные сценарии: Вероятность катастрофических рисков от передового ИИ вследствие провалов в безопасности очень мала. Методы обеспечения безопасности, которые уже разработаны, такие как обучение с подкреплением на основе отзывов людей (RLHF) и конституционный ИИ (CAI), в основном достаточны для выравнивания. Главные риски от ИИ являются экстраполяцией проблем, с которыми сталкиваются сегодня (таких как токсичность и намеренное злоупотребление), а также потенциальным вредом от широкомасштабной автоматизации и сдвигов в международном балансе сил — это потребует от ИИ-лабораторий и третьих лиц (например, академических кругов и институтов гражданского общества) проведения масштабных исследований для минимизации вреда.
- Промежуточные сценарии: Катастрофические риски являются возможным или даже правдоподобным исходом развития передового ИИ. Противодействие этому требует существенных научно-инженерных усилий, но при достаточной целенаправленной работе мы сможем справиться.
- Пессимистичные сценарии: Безопасность ИИ — по сути неразрешимая проблема (это просто эмпирический факт, что мы не можем контролировать или диктовать ценности системе, которая в целом интеллектуально способнее нас самих), а потому нам нельзя разрабатывать или развертывать очень продвинутые системы ИИ. Стоит отметить, что самые пессимистичные сценарии могут выглядеть как оптимистичные до тех пор, пока не будут созданы очень мощные системы ИИ. Серьезное отношение к пессимистичным сценариям требует смирения и осторожности при оценке доказательств безопасности систем.
Если мы находимся в оптимистичном сценарии… ставки любых действий Anthropic (к счастью) намного ниже, поскольку катастрофические сбои в безопасности в любом случае маловероятны. Наши усилия по выравниванию, скорее всего, ускорят темпы, с которыми передовой ИИ сможет приносить подлинную пользу, и помогут смягчить часть краткосрочных угроз, создаваемых системами ИИ по мере их разработки. Мы также можем перенаправить усилия на то, чтобы помочь политикам справиться с некоторыми потенциальными структурными рисками, порождаемыми передовым ИИ, что, вероятно, станет одним из крупнейших источников риска при минимальной вероятности катастрофических провалов безопасности.
Если мы находимся в промежуточном сценарии… главным вкладом Anthropic станет выявление рисков, создаваемых передовыми системами ИИ, а также поиск и распространение безопасных способов обучения мощных систем ИИ. Мы надеемся, что хотя бы часть нашего портфеля методов обеспечения безопасности (о которых подробнее рассказано ниже) окажется полезна в таких сценариях. Эти сценарии могут варьироваться от «умеренно легких», где мы верим, что сможем добиться значительного маржинального прогресса путем итераций с такими методами, как конституционный ИИ, до «умеренно сложных», где успехи в механистической интерпретируемости кажутся нашей лучшей ставкой.
Если мы находимся в пессимистичном сценарии… роль Anthropic будет заключаться в том, чтобы предоставить как можно больше доказательств того, что методы безопасности ИИ не могут предотвратить серьезные или катастрофические риски безопасности от передового ИИ, и поднять тревогу, чтобы институты всего мира могли направить коллективные усилия на предотвращение разработки опасных систем ИИ. Если мы находимся в «колоссально пессимистичном» сценарии, это может потребовать направления наших коллективных усилий на исследования безопасности ИИ при одновременной остановке прогресса в области ИИ. Признаки того, что мы находимся в пессимистичном или близком к нему сценарии, могут быть внезапными и трудноразличимыми. Поэтому мы должны всегда действовать из предположения, что мы всё еще можем находиться в таком сценарии, пока у нас не появится достаточно доказательств обратного.
Учитывая высокие ставки, одним из наших главных приоритетов остается сбор информации о том, в каком именно сценарии мы находимся. Многие исследовательские направления, которые мы преследуем, направлены на лучшее понимание систем ИИ и разработку методов, которые могли бы помочь нам обнаруживать вызывающее беспокойство поведение, такое как стремление к власти или обман со стороны передовых систем ИИ.
Наша цель по сути заключается в разработке:
- Более совершенных методов повышения безопасности систем ИИ.
- Лучших способов определения того, насколько системы ИИ безопасны или небезопасны.
В оптимистичных сценариях пункт (1) поможет разработчикам ИИ обучать полезные системы, а пункт (2) продемонстрирует, что такие системы безопасны. В промежуточных сценариях пункт (1) может стать тем способом, с помощью которого мы в конечном итоге избежим катастрофы ИИ, а пункт (2) будет иметь решающее значение для гарантии того, что риск от передового ИИ останется низким. В пессимистичных сценариях провал пункта (1) станет ключевым индикатором того, что безопасность ИИ неразрешима, а пункт (2) позволит убедительно продемонстрировать это остальным.
Мы верим в подобный «портфельный подход» к исследованиям безопасности ИИ. Вместо того чтобы ставить на единственный возможный сценарий из приведенного выше списка, мы пытаемся построить исследовательскую программу, которая могла бы существенно улучшить ситуацию в промежуточных сценариях, где исследования безопасности ИИ с наибольшей вероятностью окажут колоссальное влияние, и одновременно поднять тревогу в пессимистичных сценариях, где такие исследования вряд ли сильно сдвинут иглу в вопросах риска ИИ. Мы также пытаемся делать это так, чтобы это приносило пользу в оптимистичных сценариях, где потребность в технических исследованиях безопасности ИИ не столь велика.
Три типа исследований ИИ в Anthropic
Мы делим исследовательские проекты в Anthropic на три направления:
- Возможности (Capabilities): Исследования в области ИИ, направленные на то, чтобы сделать системы ИИ в целом лучше в любых задачах, включая письмо, обработку или генерацию изображений, игры и т.д. Исследования, которые делают крупные языковые модели более эффективными или совершенствуют алгоритмы обучения с подкреплением, подпадают под эту категорию. Работа с возможностями порождает и совершенствует модели, которые мы исследуем и используем в наших изысканиях по выравниванию (alignment). Мы, как правило, не публикуем работы такого рода, поскольку не хотим ускорять темпы прогресса возможностей ИИ. Кроме того, мы стремимся осмотрительно подходить к демонстрациям передовых возможностей (даже без публикации). Мы обучили первую версию нашей флагманской модели Claude весной 2022 года и решили расставить приоритеты в пользу её использования для исследований безопасности, а не публичного развертывания. Впоследствии мы начали развертывать Claude, так как разрыв между ней и общедоступным уровнем техники сократился.
- Возможности выравнивания (Alignment capabilities): Эти исследования сосредоточены на разработке новых алгоритмов обучения систем ИИ с целью сделать их более полезными, честными и безопасными, а также более надежными, устойчивыми и в целом выровненными по человеческим ценностям. Примеры текущей и прошлой работы такого рода в Anthropic включают дебаты, масштабирование автоматизированного ред-тиминга (red-teaming), конституционный ИИ, устранение предвзятости (debiasing) и RLHF (обучение с подкреплением на основе отзывов людей). Часто эти методы прагматически полезны и имеют экономическую ценность, но это не обязательно — например, если новые алгоритмы сравнительно неэффективны или станут полезными лишь по мере роста возможностей ИИ.
- Наука о выравнивании (Alignment science): Эта область сосредоточена на оценке и понимании того, действительно ли системы ИИ выровнены, насколько хорошо работают методы возможностей выравнивания и в какой степени мы можем экстраполировать успех этих методов на более способные системы ИИ. Примеры такой работы в Anthropic включают широкую область механистической интерпретируемости, а также нашу работу по оценке языковых моделей с помощью самих языковых моделей, ред-тиминг и изучение генерализации в крупных языковых моделях с использованием функций влияния (описано ниже). Часть нашей работы по честности находится на стыке науки о выравнивании и возможностей выравнивания.
В определенном смысле можно рассматривать возможности выравнивания по сравнению с наукой о выравнивании как разделение на «синюю команду» и «красную команду»: исследования возможностей выравнивания пытаются разрабатывать новые алгоритмы, в то время как наука о выравнивании старается понять их ограничения и выявить их.
Одна из причин, по которой мы находим эту классификацию полезной, заключается в том, что сообщество по безопасности ИИ часто спорит о том, было ли создание RLHF — которое также приносит экономическую ценность — «действительно» исследованием безопасности. Мы считаем, что да, было. Прагматически полезные исследования возможностей выравнивания служат фундаментом для методов, разрабатываемых нами для более мощных моделей — например, наша работа над конституционным ИИ и оценками, генерируемыми ИИ, а также продолжающаяся работа над автоматизированным ред-тимингом и дебатами были бы невозможны без предшествующей работы по RLHF. Работа над возможностями выравнивания в целом позволяет системам ИИ оказывать содействие в исследованиях по выравниванию, делая эти системы более честными и послушными (corrigible). Более того, демонстрация того, что итеративные исследования выравнивания полезны для создания моделей, представляющих большую ценность для людей, также может послужить стимулом для разработчиков ИИ инвестировать больше средств в попытки сделать свои модели безопаснее и в обнаружение потенциальных сбоев безопасности.
Если окажется, что безопасность ИИ вполне поддается решению, то наша работа над возможностями выравнивания может стать нашим самым влиятельным исследованием. И наоборот, если проблема выравнивания окажется более сложной, мы будем всё больше зависеть от науки о выравнивании в поиске уязвимостей в методах возможностей выравнивания. А если проблема выравнивания на самом деле практически неразрешима, то нам отчаянно необходима наука о выравнивании, чтобы выстроить железобетонные аргументы в пользу остановки разработки передовых систем ИИ.
Наши текущие исследования безопасности
В настоящее время мы работаем по самым разным направлениям, чтобы выяснить, как обучать безопасные системы ИИ. Некоторые проекты затрагивают конкретные модели угроз и уровни возможностей. К числу ключевых идей относятся:
- Механистическая интерпретируемость
- Масштабируемый надзор
- Процесс-ориентированное обучение
- Понимание генерализации
- Тестирование на опасные режимы сбоев
- Общественные последствия и оценки
Механистическая интерпретируемость
Во многих отношениях техническая проблема выравнивания неразрывно связана с проблемой обнаружения нежелательного поведения у моделей ИИ. Если мы сможем надежно обнаруживать нежелательное поведение даже в новых ситуациях (например, «читая мысли» моделей), у нас появится больше шансов найти методы обучения моделей, которые не демонстрируют такие режимы сбоев. Тем временем мы получаем возможность предупредить остальных о том, что модели небезопасны и не должны развертываться.
Наши исследования в области интерпретируемости призваны восполнить пробелы, которые остаются за рамками других направлений науки обalignment (согласовании ИИ). Например, мы считаем, что одним из самых ценных результатов таких исследований может стать способность распознавать, является ли модель деструктивно или обманчиво согласованной («подыгрывает» ли она даже очень сложным тестам, таким как тесты-«ловушки», которые намеренно «искушают» систему проявить несогласованность). Если наша работа по масштабируемому надзору (Scalable Supervision) и обучению с ориентацией на процесс принесет многообещающие результаты (см. ниже), мы ожидаем создания моделей, которые будут казаться согласованными даже при прохождении строжайших тестов. Это может означать либо то, что мы находимся в очень оптимистичном сценарии, либо то, что мы столкнулись с одним из самых пессимистичных. Отличить эти случаи друг от друга при использовании других подходов практически невозможно, однако методы интерпретируемости делают эту задачу вполне выполнимой.
Это приводит нас к масштабной и рискованной ставке: механистической интерпретируемости — проекту, цель которого заключается в обратной разработке нейросетей до понятных человеку алгоритмов, подобно тому как можно препарировать неизвестную и потенциально опасную компьютерную программу. Мы надеемся, что в конечном итоге это позволит нам проводить нечто вроде «просмотра кода» (code review), проверяя наши модели на наличие небезопасных аспектов или получая надежные гарантии безопасности.
Мы понимаем, что это чрезвычайно сложная задача, но в то же время она не столь невыполнимая, как может показаться. С одной стороны, языковые модели — это крупные и сложные компьютерные программы (а феномен, который мы называем «суперпозицией», лишь усложняет дело). С другой стороны, мы видим признаки того, что этот подход более податлив, чем предполагалось изначально. До работы в Anthropic некоторые члены нашей команды обнаружили, что в моделях компьютерного зрения есть компоненты, которые можно понять как интерпретируемые схемы. С тех пор мы успешно распространили этот подход на небольшие языковые модели и даже обнаружили механизм, который, судя по всему, лежит в основе значительной части обучения в контексте. Кроме того, мы стали гораздо лучше понимать механизмы вычислений в нейросетях, чем еще год назад — например, процессы, отвечающие за запоминание.
Это лишь наше текущее направление, и мы руководствуемся в первую очередь эмпирическим подходом: мы изменим курс, если появятся свидетельства того, что другая работа перспективнее! Более того, мы верим, что глубокое понимание деталей работы нейросетей и процессов обучения откроет более широкий спектр инструментов для обеспечения безопасности.
Масштабируемый надзор
Превращение языковых моделей в согласованные системы ИИ потребует огромного объема высококачественной обратной связи для корректировки их поведения. Главное опасение заключается в том, что люди не смогут предоставить необходимую обратную связь. Возможно, люди окажутся не в состоянии давать достаточно точные и осознанные оценки, чтобы адекватно обучать модели избегать вредного поведения в самых разных ситуациях. Не исключено, что система ИИ сможет обмануть людей, и те не смогут предоставить фидбек, отражающий их истинные желания (например, случайно поощрить вводящий в заблуждение совет). Возможно, проблема кроется в их комбинации: люди могли бы давать правильные ответы при условии достаточных затрат труда, но не способны делать это в больших масштабах. Это и есть проблема масштабируемого надзора, и она, судя по всему, станет центральным вопросом при обучении безопасных и согласованных систем ИИ.
В конечном счете мы убеждены, что единственный способ обеспечить необходимый надзор — заставить системы ИИ частично контролировать самих себя или помогать людям в осуществлении этого надзора. Нам так или иначе необходимо преобразовать небольшой объем высококачественного человеческого надзора в огромный объем высококачественного ИИ-надзора. Эта идея уже доказывает свою жизнеспособность благодаря таким методам, как RLHF (обучение с подкреплением на основе отзывов людей) и Конституциональный ИИ (Constitutional AI), хотя мы видим большой потенциал для совершенствования этих подходов, чтобы сделать их надежными при работе с системами человеческого уровня.
Мы считаем подобные подходы перспективными, поскольку языковые модели уже в ходе предварительного обучения (pretraining) многое узнают о человеческих ценностях. Изучение человеческих ценностей мало чем отличается от изучения других тем, и логично ожидать, что более крупные модели будут иметь более точное представление о ценностях людей и легче усваивать их по сравнению с моделями меньшего размера. Главная цель масштабируемого надзора — заставить модели лучше понимать человеческие ценности и действовать в соответствии с ними.
Еще одна ключевая особенность масштабируемого надзора (особенно таких методов, как CAI) заключается в том, что он позволяет автоматизировать red-teaming (также известное как состязательное обучение). Иными словами, мы можем автоматически генерировать потенциально проблемные вводные для систем ИИ, наблюдать за их реакцией, а затем автоматически обучать их действовать более честно и безопасно. Наша надежда состоит в том, что мы сможем использовать масштабируемый надзор для создания более надежно защищенных систем. Мы активно исследуем эти вопросы.
Мы изучаем различные методы масштабируемого надзора, включая развитие концепции CAI, варианты надзора с участием человека, различные версии дебатов между ИИ-агентами, состязательное тестирование (red teaming) через многоагентное обучение с подкреплением, а также создание оценок, сгенерированных самими моделями. Мы полагаем, что масштабирование надзора может оказаться наиболее перспективным подходом для обучения систем, способных превосходить возможности человека и при этом оставаться безопасными, однако предстоит проделать огромную работу, чтобы проверить жизнеспособность такого пути.
Обучение процессам, а не достижению результатов
Один из способов освоить новую задачу — метод проб и ошибок: если вы знаете, как выглядит желаемый конечный результат, вы можете просто перебирать новые стратегии, пока не добьетесь успеха. Мы называем это «обучением, ориентированным на результат» (outcome-oriented learning). В таком подходе стратегия агента полностью определяется желаемым итогом, и агент (в идеале) приходит к некоторой дешевой стратегии, которая позволяет этот итог достичь.
Часто эффективнее учиться, когда эксперт-наставник показывает вам процессы, которые он использует для достижения успеха. Во время тренировочных раундов ваши результаты могут иметь не столь уж большую важность, если вместо этого вы сосредоточитесь на улучшении своих методов. По мере совершенствования вы можете перейти к более совместному процессу, консультируясь с наставником и проверяя, не подойдут ли вам новые, еще более эффективные стратегии. Мы называем это «обучением, ориентированным на процесс» (process-oriented learning). В обучении, ориентированном на процесс, цель состоит не в достижении конечного результата, а в овладении отдельными процессами, которые затем можно использовать для этого результата.
По крайней мере на концептуальном уровне многие опасения по поводу безопасности продвинутых систем ИИ снимаются, если обучать эти системы именно с ориентацией на процесс. В частности, при такой парадигме:
- Эксперты-люди будут продолжать понимать отдельные шаги, предпринимаемые системами ИИ, поскольку для поощрения этих процессов их необходимо будет обосновать перед людьми.
- Системы ИИ не будут получать вознаграждение за достижение успеха непостижимыми или пагубными способами, так как награда будет выдаваться исключительно на основе эффективности и понятности их процедур.
- Системы ИИ не должны поощряться за преследование сомнительных подцелей, таких как приобретение ресурсов или обман, поскольку люди или их прокси будут давать отрицательную обратную связь на отдельные стяжательские процессы прямо в ходе обучения.
В компании Anthropic мы горято поддерживаем простые решения, и ограничение обучения ИИ процессом может стать самым простым способом устранить множество проблем, связанных с продвинутыми системами ИИ. Мы также рады выявлять и решать ограничения процессно-ориентированного обучения, а также понимать, когда возникают проблемы с безопасностью при обучении на смесях процессно- и результатно-ориентированных подходов. Сейчас мы считаем, что процессно-ориентированное обучение может быть самым перспективным путем к созданию безопасных и прозрачных систем, чей уровень способностей равен человеческому или несколько превосходит его.
Понимание генерализации
Работа по механистической интерпретируемости занимается обратной разработкой вычислений, выполняемых нейронной сетью. Мы также стремимся получить более детальное понимание процедур обучения больших языковых моделей (LLM).
LLM продемонстрировали множество удивительных эмерджентных (возникающих сами по себе) поведений — от креативности до самосохранения и обмана. Хотя все эти проявления, безусловно, проистекают из обучающих данных, путь к ним сложен: модели сначала проходят «предварительное обучение» (pretraining) на гигантских массивах неструктурированного текста, из которого они извлекают широкие представления и способность имитировать разнообразных агентов. Затем они подвергаются тонкой настройке (fine-tuning) самыми разными способами, некоторые из которых, вероятно, имеют неожиданные побочные эффекты. Поскольку этап тонкой настройки сильно перепараметризован, итоговая модель критически зависит от неявных смещений (implicit biases) предварительного обучения; это неявное смещение формируется из сложной паутины представлений, выстроенных на основе предварительного обучения на значительной части мировых знаний.
Когда модель демонстрирует тревожное поведение — например, разыгрывает роль деструктивно согласованного ИИ, — является ли это безобидным воспроизведением практически идентичных обучающих последовательностей? Или это поведение (и даже убеждения и ценности, которые к нему приводят) стало неотъемлемой частью концепции ИИ-помощников в модели, которую они последовательно применяют в разных контекстах? Мы работаем над методами прослеживания связи между выходными данными модели и обучающими данными, поскольку это даст важные ориентиры для понимания происходящего.
Тестирование на опасные режимы сбоев
Одна из главных тревог связана с возможностью того, что продвинутый ИИ может развить опасные эмерджентные поведения, такие как обман или способность к стратегическому планированию, которых не было у менее мощных систем. Мы считаем, что способ предвосхитить подобную проблему до того, как она станет прямой угрозой, заключается в создании сред, где мы намеренно прививаем эти свойства мелкомасштабным моделям, недостаточно способным нести реальную опасность, чтобы мы могли изолировать их и изучить.
Нас особенно интересует то, как системы ИИ ведут себя, когда они «обладают ситуационной осведомленностью» — например, когда они осознают, что являются искусственным интеллектом, общающимся с человеком в учебной среде, — и как это влияет на их поведение в процессе обучения. Начинают ли системы ИИ проявлять склонность к обману или развивать удивительные и нежелательные цели? В лучшем случае мы стремимся построить детальные количественные модели того, как эти тенденции меняются в зависимости от масштаба, чтобы заблаговременно предвидеть внезапное появление опасных режимов сбоев.
В то же время важно не упускать из виду риски, связанные с самим процессом исследований. Сами по себе изыскания вряд ли несут серьезную угрозу, если они проводятся на небольших моделях, не способных причинить большой вред, однако подобная работа предполагает вызов именно тех качеств, которые мы считаем опасными, и таит в себе очевидные риски при проведении на более крупных и мощных моделях. Мы не планируем проводить такие исследования на моделях, способных нанести серьезный ущерб.
Общественное влияние и оценки
Критическая оценка потенциального влияния нашей работы на общество — ключевой столп наших исследований. Наш подход сосредоточен на создании инструментов и метрик для оценки и понимания возможностей, ограничений и потенциала социального воздействия наших ИИ-систем. Например, мы опубликовали исследование, анализирующее предсказуемость и сюрпризы в больших языковых моделях, где изучается, как высокая предсказуемость и непредсказуемость этих моделей может приводить к вредоносному поведению. В этой работе мы подчеркиваем, каким образом неожиданные способности могут использоваться в деструктивных целях. Мы также изучали методы состязательного тестирования языковых моделей для выявления и снижения рисков вреда путем проверки моделей на выдачу оскорбительного или токсичного контента при разных размерах моделей. Совсем недавно мы обнаружили, что современные языковые модели способны следовать инструкциям по снижению предвзятости и стереотипов.
Мы крайне обеспокоены тем, как быстрое внедрение все более мощных систем ИИ повлияет на общество в краткосрочной, среднесрочной и долгосрочной перспективе. Мы работаем над различными проектами по оценке и смягчению потенциально вредного поведения систем ИИ, прогнозированию сценариев их использования и изучению их экономического воздействия. Эти исследования также подпитывают нашу работу по разработке ответственной политики и принципов управления в сфере ИИ. Проводя строгие научные изыскания о последствиях ИИ уже сегодня, мы стремимся предоставить лицам, принимающим решения, и исследователям инсайты и инструменты, необходимые для предотвращения столь значительных социальных угроз и обеспечения того, чтобы преимущества ИИ распределялись среди общества широко и равномерно.
Заключительные мысли
Мы верим, что искусственный интелص (искусственный интеллект) может оказать беспрецедентное влияние на мир, потенциально уже в течение следующего десятилетия. Экспоненциальный рост вычислительной мощности и предсказуемое улучшение возможностей ИИ говорят о том, что новые системы будут намного совершеннее современных технологий. Тем не менее у нас пока нет прочного понимания того, как гарантировать, что эти мощные системы будут надежно согласованы с человеческими ценностями, чтобы мы были уверены в минимальном риске катастрофических сбоев.
Хотим внести ясность: мы не считаем, что доступные сегодня системы представляют неминуемую угрозу. Тем не менее благоразумно вести фундаментальную работу уже сейчас, чтобы помочь снизить риски от продвинутого ИИ на случай, если будут созданы гораздо более мощные системы. Возможно, создание безопасного ИИ окажется легкой задачей, но мы убеждены, что готовиться к менее оптимистичным сценариям критически важно.
Anthropic придерживается эмпирического подхода к безопасности ИИ. Некоторые из ключевых областей нашей активной работы включают: углубление понимания того, как системы ИИ обучаются и обобщают данные применительно к реальному миру; разработку методов масштабируемого надзора и проверки систем ИИ; создание прозрачных и интерпретируемых систем ИИ; обучение ИИ следованию безопасным процессам вместо погони за результатами; анализ потенциальных опасных режимов сбоев ИИ и способов их предотвращения;, а также оценку общественного влияния ИИ в качестве ориентира для политики и исследований. Подходя к проблеме безопасности ИИ с разных сторон, мы надеемся сформировать «портфель» мер безопасности, который поможет нам преуспеть в самых разных сценариях. Мы предполагаем, что наш подход и распределение ресурсов будут быстро адаптироваться по мере поступления новой информации о том, в каком именно сценарии мы находимся.
Сноски
- Алгоритмический прогресс — изобретение новых методов обучения систем ИИ — сложнее поддается измерению, однако прогресс выглядит экспоненциальным и опережает закон Мура. При экстраполяции успехов в возможностях ИИ экспоненциальный рост расходов, производительности оборудования и алгоритмического прогресса необходимо перемножать для оценки общего темпа роста.
- Законы масштабирования обеспечили обоснование затрат, однако другой глубинной мотивацией для проведения этой работы был переход к ИИ, способному читать и писать, чтобы облегчить обучение и эксперименты с ИИ, способным взаимодействовать с человеческими ценностями.
- Экстраполяция прогресса возможностей ИИ на основе роста общего объема вычислений, используемых для обучения, не является точной наукой и требует определенного суждения. Мы знаем, что скачок возможностей от GPT-2 к GPT-3 произошел в основном за счет примерно 250-кратного увеличения вычислительных мощностей. По нашим оценкам, еще 50-кратное увеличение отделяет оригинальную модель GPT-3 от передовых моделей 2023 года. В течение следующих 5 лет мы можем ожидать примерно 1000-кратного увеличения объема вычислений, используемых для обучения крупнейших моделей, основываясь на тенденциях стоимости вычислений и расходов. Если законы масштабирования подтвердятся, это приведет к скачку возможностей, который значительно превзойдет скачок от GPT-2 к GPT-3 (или от GPT-3 к Claude). В компании Anthropic мы глубоко знакомы с возможностям этих систем, и столь масштабный скачок многим из нас представляется способным привести к производительности человеческого уровня в большинстве задач. Это требует использования интуиции — пусть и интуиции информированной — и поэтому является несовершенным методом оценки прогресса возможностей ИИ. Тем не менее фундаментальные факты, включая (i) разницу в вычислениях между этими двумя системами, (ii) разницу в производительности между ними, (iii) законы масштабирования, позволяющие делать проекции на будущие системы, и (iv) тренды стоимости вычислений и затрат, доступны каждому, и мы считаем, что в совокупности они поддерживают вероятность более чем в 10% того, что мы разработаем ИИ с широким человеческим уровнем возможностей в течение следующего десятилетия. В этом грубом анализе мы игнорируем алгоритмический прогресс, а цифры вычислений являются наилучшими оценками, детали которых мы не приводим. Тем не менее подавляющее большинство внутренних разногласий здесь сводится к интуиции относительно экстраполяции последующих скачков возможностей при эквивалентном скачке вычислений.
- Например, в исследованиях ИИ долгое время на теоретических основаниях широко предполагалось, что локальные минимумы могут мешать нейросетям учиться, в то время как многие качественные аспекты их свойств генерализации (обобщения), такие как повсеместное существование состязательных примеров (adversarial examples), стали своего рода загадкой и неожиданностью.
- Эффективные исследования безопасности крупных моделей требуют не просто номинального (например, через API) доступа к этим системам — для проведения работ по интерпретируемости, тонкой настройке и обучению с подкреплением необходимо разрабатывать системы ИИ непосредственно внутри компании Anthropic.
Полный текст статьи читайте на Anthropic
