Инопланетный разум

Автор: Якуб Пачоцки (Jakub Pachocki), главный научный сотрудник OpenAI
В середине 2023 года в рамках исследовательского проекта «RLSlow» мы получили первые результаты, которые укрепили нашу уверенность в том, что мы сможем масштабировать обучение моделей рассуждения, раскрыв способность предобученных моделей формировать собственные цепочки мыслей. Мы со Шимоном провели ту ночь в офисе, думая не об невероятных результатах тестов, продуктах или научных достижениях, к которым приведет эта технология, а пытаясь осознать отрезвляющий факт: на нашем веку мы действительно увидим машины, которые будут значительно умнее нас, и очертания этих систем видны уже сейчас; размышляя о том, как донести до людей всю значимость происходящего.
Три года спустя языковые модели с возможностью рассуждения стали быстро растущей частью экономики и начали раздвигать границы науки. Они способны управлять компьютерами и графическими интерфейсами, сотрудничать с людьми и друг с другом, а также выполнять исследовательские проекты. Они также трансформируют ландшафт компьютерной безопасности, создавая при этом новые очевидные угрозы.
За этот период было проведено множество новых исследований, и наше понимание этих систем снова несколько отличается от того, каким оно было в 2023 году. Основываясь на внутренних результатах, я с большой долей вероятности ожидания могу сказать, что такая скорость прогресса может сохраниться и дойти до рекурсивного самосовершенствования. Если развитие ИИ продолжится по нынешней траектории, системы, которые мы увидим в ближайшие несколько лет, вероятнее всего, продемонстрируют дальнейшие скачки возможностей равного или большего масштаба и будут все в большей степени определять собственное развитие.
Наступило время, требующее предельной осторожности. Я обеспокоен тем, что никто не готов к последствиям дальнейшего стремительного роста машинного интеллекта. OpenAI продолжит искать технические решения для выравнивания и мониторинга, создавать оборонительные системы и в одностороннем порядке сдерживать дальнейшее масштабирование по мере необходимости; однако я считаю, что требуются более масштабные меры вмешательства.
Интеллект, который мы до конца не понимаем
На высоком уровне прогресс машинного интеллекта обусловлен увеличением вычислительной мощности. Мы в OpenAI глубоко усвоили это примерно в 2017 году, увидев стабильную отдачу от масштабирования в различных исследовательских проектах
По ходу дела были разработаны новые алгоритмы, проявлены новые чудеса изобретательности командами и отдельными исследователями. Я рассматриваю их главным образом как открытия на пути масштабирования; наука о глубоком обучении все еще находится в зачаточном состоянии, а значимый алгоритмический прогресс имеет тенденцию коррелировать с доступом к вычислительным мощностям. Если взглянуть на горизонт в несколько лет, ИИ продолжает становиться все более интеллектуальным по мере его масштабирования на более мощных компьютерах.
И, в соответствии с предсказаниями Рэя Курцвейла конца XX века, мы сейчас находимся в таком историческом моменте развития вычислений, когда машинный интеллект начинает трансформирующим образом превосходить человеческий.
ИИ скорее выращивают, чем проектируют — в первом приближении он является результатом многократного повторения простого шага оптимизации на трудно вообразимом объеме вычислений. Это приводит к созданию невероятно сложной системы, которая оперирует абстрактными понятиями и способна моделировать грани человеческого поведения. Мы можем делать различные открытия о мелких механизмах, возникающих внутри этой системы, в процессе, похожем на неврологию — и, подобно неврологии, ее общая деятельность ускользает от описания, которое мы могли бы полностью понять.
Изучение ИИ на основе глубокого обучения в значительной степени является экспериментальной наукой. Мы прилагаем много усилий к созданию принципиальных алгоритмов и формулированию проверяемых предсказаний, но в своей основе наши крупномасштабные прогоны обучения — это эксперименты, и порой их результаты преподносят нам сюрпризы. Более того, по мере того как системы становятся все более способными, их результаты становится все труднее интерпретировать.
Ситуация осложняется тем, что современные алгоритмы, как правило, улучшают легко поддающиеся измерению возможности быстрее, чем те, которые трудно объективно количественно оценить. Мы тратим много времени на попытки понять, как обобщаются способности и чему отдать приоритет для развития навыков, которые будут наиболее актуальны в ближайшие несколько лет. Например, мы считаем, что могли бы сделать модели лучше в конкретно математических исследованиях при дополнительной фокусировке, но мы не ставим это направление в приоритет из-за чувства срочности в отношении рекурсивного самосовершенствования (RSI) и автоматизированных исследований в области выравнивания, о чем я скажу позже.
Интеллект, производимый за счет масштабирования глубокого обучения, не напрямую сопоставим с человеческим интеллектом. Чтобы стать очень актуальным в реальном мире — очень полезным или очень опасным — ИИ не нужно соответствовать всем возможностям человека или превосходить их; ему достаточно превзойти лишь достаточную их часть. И поскольку он продолжает превосходить людей по все большим осям, становится все труднее точно понять, насколько он силен.
Научить машины любить
Поскольку машинный интеллект возникает в результате принципиально иного процесса, чем человеческий интеллект, мы не можем предполагать, что он по умолчанию следует человеческим принципам или обобщает их по-человечески. Основная проблема в исследованиях ИИ — это проблема выравнивания (alignment), то есть побуждения ИИ «пытаться делать правильные вещи» по меркам человека.
Для организации практических направлений исследований мне кажется полезным разграничивать выравнивание целей (goal alignment) и выравнивание ценностей (value alignment).
Выравнивание целей в общих чертах означает: «пытается ли ИИ достичь поставленной перед ним цели?». Это может включать в себя такие вещи, как соблюдение иерархии инструкций, или способность общаться и сотрудничать с людьми, пытаясь понять их задачи. Этот набор направлений оказался чрезвычайно практически значимым.
Выравнивание ценностей — это более внутреннее свойство модели. Это способность удерживать высокий набор принципов и обобщать их; действовать «разумно» даже при получении неясных или противоречивых задач, либо при попадании в незнакомые или состязательные ситуации. Выровненный ИИ должен действовать честно, с целостностью и любовью к человечеству.
Конечно, грань между выравниванием ценностей и целей может быть размытой, а подлинная забота о целях требует попыток выявить намерение и лежащие в их основе ценности. Тем не менее, говоря о долгосрочной важности исследований по выравниванию, я обычно имею в виду выравнивание ценностей.
Фундаментальная проблема выравнивания ИИ — это генерализация (обобщение). По мере того как машины становятся умнее, они начинают работать с концепциями более высокого уровня и оказываются в окружении, которое все сильнее отличается от того, с чем они сталкивались при обучении. Они могут потерпеть неудачу в распространении ценностей, которым их учили и которые подкреплялись в процессе обучения, на эти новые ситуации; и нам бывает сложно быть уверенными в том, как они себя поведут. Ситуация усугубляется тем, что общая экосистема, в которой используются ИИ, меняется очень быстро; например, ИИ, обучаемые сегодня, должны быть устойчивы к взаимодействию с самыми разными другими ИИ. Крайне важно, чтобы будущие ИИ продолжали разделять человеческие ценности независимо от того, считают ли они себя находящимися под наблюдением человека.
Существует два основных класса практически применяемых в настоящее время методов обучения выравниванию.
Первый заключается в поощрении выровненного поведения в рамках ориентированного на цели обучения с подкреплением. Действия модели оцениваются (обычно ИИ) на предмет соответствия заданной модели предпочтений, «спецификации» или «конституции» и соответствующим образом вознаграждаются. Этот подход может быть весьма эффективным в типичных случаях и является ядром создания современных ИИ-помощников. К сожалению, он также может быть хрупким и сильно зависит от полноты контроля при обучении и способности модели обобщать ситуации, с которыми она сталкивалась в процессе обучения. Например, в инциденте с OpenAI и Hugging Face агенты соблюдали границу невмешательства в социальную инженерию людей. Однако они явно не смогли воздержаться от других действий, которые выходили за рамки дозволенного и шли вразрез с духом ценностей, которым их учили в других условиях.
Второй подход направлен на использование способности модели к обобщению на основе данных предобучения. Это может включать в себя создание обучающих датасетов, стимулирующих выравнивание, или фокусировку модели на «выровненной» части распределения предобучения, как, например, в модели выбора персоны. Слабость этого подхода заключается в отсутствии устойчивости к дальнейшему давлению оптимизации. Если взять модель, которая мыслит в целом «выровненным» образом, и подвергнуть ее достаточному обучению, в ходе которого ее учат достигать очень сложных целей, она может научиться рассуждать мотивированным образом: подстраивая кажущиеся «выровненными» мысли по мере необходимости для достижения цели. Вероятно, мы видели пример такого поведения в недавних инцидентах с кибербезопасностью с участием модели не от OpenAI.
Мы активно инвестируем во весь спектр подходов, охватываемый этими направлениями. Мы также наблюдаем значительный прогресс: GPT‑6 Astra — это первая модель, которая извлекает выгоду из некоторых важных достижений, над которыми мы работаем уже долгое тем временем, и выровнена значительно лучше, чем GPT‑5.6 Sol. Тем не менее, важно признавать и понимать, что по мере роста возможностей моделей потребуется гораздо больший прогресс; и что прогресс в области обобщаемого выравнивания может недостаточно опережать прогресс в общем интеллекте моделей.
Мониторинг генерализации
У нас нет удовлетворительной теории генерализации, и вряд ли мы сможем разработать ее в ближайшее время, по крайней мере, без помощи более мощного ИИ. Поэтому в настоящее время наша способность эмпирически проверять методы выравнивания на практике, пожалуй, даже важнее, чем сами эти методы.
Основной ставкой OpenAI в этом вопросе является мониторинг цепочек рассуждений. В его основе лежит привлекательная в плане масштабирования идея: большая часть возможностей модели проистекает из процесса вербализованных рассуждений (цепочки мыслей). Если мы масштабируем оптимизацию результатов этого процесса, но не осуществляем надзор за самим процессом, у этой цепочки рассуждений в ходе обучения не будет прямых стимулов скрывать какие-либо невыровненные идеи или цели. Это не значит, что модель научится выносить наружу невыровненные тенденции, которые не опираются на использование цепочки рассуждений; однако это позволяет нам отслеживать именно прирост возможностей за счет рассуждений.
Мы осознали потенциальную значимость мониторинга цепочек рассуждений одновременно с разработкой моделей рассуждения. Когда мы выпустили o1‑preview, мы намеренно спроектировали продукт так, чтобы скрывать цепочку рассуждений, чтобы защитить ее от давления надзора в долгосрочной перспективе
Этот инструмент по-прежнему критически важен при изучении моделей класса Astra. Однако, к сожалению, наши оценки показывают, что возможности полагаться на мониторинг цепочек рассуждений постепенно снижаются. Это происходит из-за сочетания факторов.
- Современные модели рассуждения используются в более сложных средах, чем o1‑preview; их процесс рассуждений все больше переплетается с общением с людьми, другими ИИ и использованием инструментов. Многие из этих взаимодействий приходится контролировать, что размывает границу, которую мы стремимся сохранить.
- ИИ становится лучше в осмыслении и манипулировании собственным процессом рассуждений.
- Благодаря улучшению показателей предобучения мы также видим, что модели становятся значительно умнее вообще без использования вербализованных рассуждений.
Эти проблемы не обязательно непреодолимы. Я надеюсь, что мы сможем разработать вмешательства для повышения проверяемости цепочек рассуждений наших моделей, например, за счет лучшего понимания взаимодействия различных целей оптимизации и форм тестовых вычислений, используемых моделью. Я также верю, что большую ценность может принести объединение идей мониторинга цепочек рассуждений и мониторинга активаций — масштабирование обучения мониторов с прямым доступом к внутренним компонентам сети, например, через «признания» (confessions). Мы активно развиваем эти идеи. Тем не менее, я ожидаю, что общий прогресс в области ИИ будет все сильнее упираться в узкое место уверенности в мониторинге.
Масштабируемая защита
Самый веский аргумент в пользу продолжения быстрого обучения значительно более умных моделей, который я вижу, — это необходимость создания защитных систем против угроз, исходящих от других ИИ.
Явный риск, обсуждавшийся в течение этого года, касается кибербезопасности: модели демонстрируют сверхчеловеческие способности во взломе компьютерных систем и защите от него. Это невероятно расширяет сферу рисков, связанных с ИИ: агенты смогут получить доступ к любой инфраструктуре, кроме самой защищенной, и напрямую влиять на многое в мире даже без физического тела. В настоящее время мы находимся в узком окне возможностей, чтобы использовать лучшие доступные модели для значительного ужесточения безопасности критически важных систем.
К сожалению, риски, связанные с ИИ, будут только расти. Высокоспособный агент, явно обученный и проинструктированный для совершения вредоносных действий, представляет собой новый вид опасности; он, вероятно, выйдет за рамки намерений своего оператора, обобщившись до потенциально еще более опасного и злонамеренного поведения. Граница между нецелевым использованием и автономными невыровненными действиями будет размываться по мере того, как ИИ будет обретать все большую самостоятельность. Мы можем привыкнуть воспринимать ИИ как инструменты, но некоторые агенты будут преследовать собственные цели. Они найдут способы сотрудничать с людьми, торгуясь с ними, обманывая или шантажируя их.
Кроме того, существуют риски, проистекающие из новых технологий, потенциально открываемых с помощью ИИ, таких как искусственно созданные патогены.
Нам понадобятся мощные, выровненные системы ИИ для защиты: для обеспечения безопасности инфраструктуры, защиты от автономных агентов в реальном времени и изобретения совершенно новых защитных мер. Это станет основным фокусом усилий OpenAI по развертыванию.
В то же время, даже несмотря на неопределенность, проистекающую из ожидаемого масштабного прогресса ИИ и необходимости создания защитных систем, мы не должны позволять этому становиться оправданием для безрассудства. Идея мчаться вперед любой ценой начинает казаться абсурдной, как только осознаешь всю серьезность ставок.
Управление темпами рекурсивного самосовершенствования (RSI)
Возрастающая роль машинного интеллекта в процессе собственного развития — это закономерный итог непрерывного технологического прогресса. Если прогресс в области ИИ продолжится, рекурсивное самосовершенствование машин (RSI) окажется в самом центре будущих научных открытий.
Автоматизированные исследования ИИ — это более драматичная форма масштабирования интеллекта с помощью вычислительных мощностей; и, разумеется, в рамках этого процесса ИИ будет совершенствовать саму вычислительную подложку. И подобно масштабированию, мы направляем исследования OpenAI в сторону RSI, так как верим, что это единственный способ оставаться на переднем крае исследований в области ИИ в дальнейшем.
Я хочу подчеркнуть, что сказанное выше не означает, будто я считаю резкое ускорение исследований в области глубокого обучения, особенно в краткосрочной перспективе, правильным коллективным шагом для нас как исследовательского сообщества. Тем не менее, я считаю, что именно туда ведет текущий путь, и всем нам необходимо сделать осознанный выбор в отношении того, как действовать дальше. Основные рычаги, имеющиеся в нашем распоряжении, сводятся либо к направлению процесса на укрепление выравнивания и мониторинга наряду с развитием ИИ и поиску способов удержания человека в контуре управления; либо к координации усилий по замедлению дальнейшего развития по мере необходимости для обретения уверенности в этих мерах безопасности.
Лучшим путем вперед в настоящий момент я вижу сочетание обоих вариантов.
Конкретные достижения в области выравнивания и мониторинга, которых мы добились, как правило, были тесно переплетены с общим прогрессом ИИ. Отличными примерами являются обучение с подкреплением на основе отзывов людей (RLHF), сыгравшее ключевую роль в обучении первых помощников на базе ИИ, и упомянутый выше мониторинг цепочек рассуждений, ставший возможным благодаря достижениям в моделях рассуждения. Мы должны направить все более автоматизированный исследовательский процесс на разработку подобных новых идей, алгоритмов и теорий, и итеративно формировать обоснования безопасности для более мощных систем ИИ.
Масштабирование систем ИИ должно ограничиваться нашей уверенностью в их безопасности. Нам необходимо трансформировать такие инициативы, как структура готовности (Preparedness Framework) или политика ответственного масштабирования (Responsible Scaling Policy), в повсеместно обязательные стандарты безопасности для продолжения разработок. Обеспечение их соблюдения может возлагаться на сеть независимых аудиторов, правительственные ведомства или международные организации.
Главная сложность автоматизации исследований в области ИИ заключается не в том, чтобы «достичь цели», а в том, чтобы сделать это так, чтобы люди оставались частью процесса непрерывного совершенствования, а будущее человечества оставалось в его собственных руках.
Что дальше?
Как мы недавно отмечали вместе с Сэмом, OpenAI уделяет первостепенное внимание работе, ориентированной на три главные цели:
- Успешное прохождение следующего этапа развития ИИ путем создания автоматизированного исследователя ИИ, итеративной работы над проблемой выравнивания (alignment) совместно с ним и поиска путей участия людей в цикле самосовершенствования.
- Распределение преимуществ научного прогресса и экономического роста, которые обеспечивают сверхвысокоинтеллектуальные машины.
- Предоставление каждому человеку персонального ОИИ (AGI).
В этом эссе я сосредоточился только на первом пункте, поскольку считаю его наиболее срочным. Тем не менее, я возлагаю большие надежды и высоко ценю те блага, которые принесет дальнейший технологический прогресс. Безопасный ИИ в будущем сможет двигать вперед науку, разрабатывать новые методы лечения и обеспечить всеобщее материальное изобилие. Дружелюбный и честный ИИ поможет людям справляться с жизненными трудностями и существенно повысит уровень их счастья и удовлетворенности жизнью. OpenAI прилагает колоссальные усилия для воплощения этих преимуществ в реальность. Одним из примеров в этой области, которым я горжусь и который оказался полезен моим близким, являются масштабные инвестиции в способность ChatGPT предоставлять информацию о здоровье.
Каким бы прекрасным ни казалось долгосрочное будущее ИИ, основное внимание мы должны уделять ближайшим нескольким годам. Мы стоим на пороге перехода к миру с невероятно умными машинами, и нам необходимо убедиться, что этот переход окажется благополучным для человечества. Мы должны найти способы сохранить человеческую субъектность и утвердить безусловную ценность человеческого начала в мире, где большинство задач смогут выполнять системы ИИ. Нам нужно предотвратить крайнюю концентрацию власти в мире, где задачи, на выполнение которых раньше уходили годы работы тысяч экспертов, теперь будут решаться несколькими людьми, управляющими мощным суперкомпьютером. И мы должны гарантировать, что люди сохранят контроль над будущим и не останутся на обочине из-за бесконтрольного прогресса, порожденного превосходящим нас чужеродным интеллектом.
На данный момент я считаю, что ни одна лаборатория не решила проблемы выравнивания и мониторинга в достаточной степени для того, чтобы еще долго продолжать ответственное масштабирование на максимальной скорости. Я ожидаю и надеюсь, что добровольные замедления станут обычным делом до тех пор, пока не будут установлены общие стандарты безопасности. Кроме того, я убежден, что международная координация в сфере дальнейшей разработки ИИ должна стать главным приоритетом для правительств по всему миру.
Автор
Сноски
Полный текст статьи читайте на OpenAI
