Темы



Да, Claude может пройти Nine Loops

Коротко сгенерировано ИИ по тексту статьи
  • Claude от Anthropic вычислил девятипетлевую амплитуду для шестичастичного процесса в модели N=4 суперсимметричной теории Янга — Миллса двумя способами.
  • Каждый подход стоил около 1–2 тысяч долларов; вычисления методом бутстрэпа заняли неделю на 96 процессорах и обошлись примерно в 100 долларов.
  • Группа Сона Хэ из Китайской академии наук получила большую часть результата с некоторой помощью ИИ на основе GPT-6.

Почему это важно: Автор проверял, на что способен современный ИИ: Claude применил известные методы, а не преодолел вычислительный барьер неожиданным способом.

В этой гостевой статье физик и научный журналист Мэтт фон Хиппель рассказывает, что произошло, когда он бросил компаниям, разрабатывающим ИИ, вызов — решить задачу из его прежней области теоретической физики.

Illustration of nine-loops

Не каждый день бросаешь вызов, а уже через месяц видишь, как его принимают. Но мы живём в необычное время.

Позвольте представиться: я Мэтт фон Хиппель. Раньше я был физиком-теоретиком, а теперь пишу о науке. Всё это время я вёл блог и каждую неделю публиковал на сайте 4gravitons.com материалы о физике и людях, которые ею занимаются.

Всё чаще писать о физике в блоге означает писать об ИИ. Это проблема, потому что я совершенно точно не эксперт по ИИ. Я немного занимался этой темой, конечно. Наверное, знаю больше вашей бабушки. Но в основном мне приходится отступить в сторону и довериться экспертам. И, к моему раздражению, эксперты не согласны друг с другом! Я слышал от умных и хорошо осведомлённых людей, уверенных, что до сверхинтеллекта ИИ осталось всего несколько лет, а такой сверхинтеллект будет способен на по-настоящему ужасные вещи. А ещё я слышал от столь же умных и осведомлённых людей, которые с не меньшей уверенностью считают, что ИИ на основе больших языковых моделей близок к пределу возможностей, что модели вроде Claude не смогут даже впечатляюще проявить себя в физике, не говоря уже о завоевании мира.

Я не спешил делать собственные прогнозы. Прежде чем сформировать мнение, я хотел увидеть, как большая языковая модель добьётся успеха в чём-то знакомом мне — в задаче, которую я считал сложной, потому что сам пытался решить нечто подобное.

Кроме того, я хотел увидеть, как большая языковая модель справится с задачей, которая, как я ожидал, будет сложной именно с вычислительной точки зрения. ИИ уже добился впечатляющих успехов в математике, это несомненно, и, вероятно, только этот месяц заставил многих изменить своё мнение. Но прогресс в математике связан с новыми идеями, а идеи — загадочная вещь: никогда не знаешь наверняка, насколько трудно их найти, пока они не найдены. Вычисления казались чем-то более конкретным. Я хотел увидеть, как большая языковая модель возьмётся за задачу, которая казалась недостижимой не потому, что исследователи в принципе не знали, как её решить, а потому, что на это, похоже, потребовалось бы больше вычислительных ресурсов и времени, чем они могли себе позволить. Я хотел проверить, ошибались ли эти исследователи: сможет ли более умный искусственный исследователь воспользоваться теми же компьютерами и всё-таки решить задачу.

Поэтому я бросил вызов:

«Если компании, разрабатывающие ИИ, хотят впечатлить таких людей, как я (или, чего уж там, напугать нас), им нужно взяться за мою прежнюю область. Покажите, что ИИ способен использовать вычислительные ресурсы, доступные учёному в университете, и решить одну из крупных нерешённых задач в области амплитуд рассеяния. Докажите, что вычислительный предел, который все считали препятствием, на самом деле не имеет значения. Получите N=8 супергравитацию на семи петлях или N=4 суперсимметричную теорию Янга — Миллса на девяти петлях».

Короче говоря: способен ли ИИ решить актуальную задачу из моей прежней области теоретической физики элементарных частиц? И сможет ли он сделать это за разумные деньги?

Вызов

Моя прежняя область — раздел теоретической физики элементарных частиц, который называется амплитудологией. Когда физики элементарных частиц выдвигают предположения о новых частицах, они проверяют, можно ли провести расчёты, необходимые для проверки этих предположений. Они вычисляют формулы, называемые амплитудами рассеяния: с их помощью физики, используя импульсы и энергии субатомных частиц, могут рассчитать вероятность их взаимодействия определённым образом. Если физикам удаётся точнее предсказать такие взаимодействия, они могут проверить, согласуются ли результаты экспериментов, например на Большом адронном коллайдере, с этими предсказаниями. Расхождение может свидетельствовать о новой теории, которая способна объяснить некоторые из главных нерешённых загадок физики — например, природу тёмной материи или соотношение материи и антиматерии во Вселенной.

Формулы для амплитуд рассеяния трудно вычислять — настолько трудно, что физики почти всегда используют приближения. Они выполняют частичные расчёты, обрывая их на определённом количестве «петель» — мере сложности, до которой могут доходить взаимодействия частиц. Чем больше «петель» учитывается в расчётах, тем ближе результат к точному ответу и тем сложнее выполнить расчёт с вычислительной точки зрения.

На практике большинство формул для амплитуд рассеяния удалось вычислить лишь до двух петель. Некоторые — до трёх. Возможно, вы слышали о самом точном предсказании в физике частиц: в его основе лежали расчёты до пяти петель.

Амплитудологи стремятся добиться большего. Они разрабатывают новые экспериментальные методы и проверяют их на специальных теориях-«игрушках». Применяя метод к такой модели, где расчёты проще, а не к более сложным частицам реального мира, амплитудологи могут тщательно проверить новые подходы и выяснить, насколько далеко те способны продвинуться.

Я предложил задачи для двух таких моделей. Сотрудники Anthropic решили взяться за одну из них — довести расчёты до девяти петель для конкретной теории-игрушки, называемой N=4 суперсимметричной теорией Янга — Миллса.

«Янг — Миллс» — техническое название типа теории, описывающей большую часть окружающего нас мира. Три из четырёх фундаментальных сил природы — электромагнетизм, сильное ядерное взаимодействие, удерживающее вместе ядра атомов, и слабое ядерное взаимодействие, вызывающее радиоактивный распад, например в бананах, — описываются теориями Янга — Миллса.

Слова «N=4 супер» отсылают к суперсимметрии. Физики предполагали, что у каждой частицы есть «суперсимметричный партнёр» — частица с тем же зарядом, но иного типа, которая сопоставляет частицы материи, такие как электроны, частицам-переносчикам взаимодействий, например фотонам. Когда-то физики оптимистично рассчитывали, что эти частицы помогут объяснить тёмную материю: речь шла о пока не обнаруженных партнёрах более привычных частиц. В этих предположениях использовалась суперсимметрия «N=1». В модели «N=4» у каждой частицы есть четыре суперсимметричных партнёра, а не один.

Избыток частиц делает эту теорию крайне нереалистичной. N=4 суперсимметричная теория Янга — Миллса не используется для объяснения тёмной материи или чего бы то ни было в реальном мире. Вместо этого амплитудологи оттачивают на ней свои методы, поскольку, как ни парадоксально, расчёты в модели N=4 выполнять проще. Тонкий баланс между разными частицами означает, что для вычислений требуется лишь определённый набор переменных, что упрощает расчёты.

Я получил степень доктора философии, помогая вычислять амплитуду на трёх петлях, и успел увидеть расчёты до семи петель, прежде чем начал выдыхаться. Лэнс Диксон, профессор Национальной ускорительной лаборатории SLAC, был одним из тех, кто занимался этой задачей с самого начала, и несколько лет назад ему удалось получить результат для восьми петель.

Эти расчёты были выполнены с помощью экспериментального метода, который называется бутстрэпом и, как ни странно, оказался идеально приспособлен для использования ИИ. Чтобы применить бутстрэп к амплитуде, не нужно учитывать все возможные взаимодействия частиц. Достаточно иметь общее представление о том, как должен выглядеть ответ, и занести в компьютерные файлы все варианты, записанные с помощью специализированного алфавита. Затем нужно проверить всё, что известно: предсказания, полученные другими методами расчёта, правила, которым должен подчиняться ответ, и связи с родственными задачами, где ответ найти проще. Это немного похоже на судоку: сначала перед вами сетка со всеми возможными числами, а затем вы постепенно вычёркиваете варианты. В итоге остаётся надеяться, что всем проверкам удовлетворяет только один вариант, а проверок при этом достаточно, чтобы убедиться в отсутствии ошибок.

Это означало, что Лэнс уже был готов проверить формулу амплитуды на девяти петлях, если бы кто-то её ему предоставил. Ответ был бы интересен не только как подтверждение эффективности метода бутстрэпа, но и как редкий пример амплитуды с таким числом петель — результат, который заслуживал бы изучения сам по себе.

Но он эту формулу не вычислил, как и никто другой в этой области. Ответ для восьми петель удалось найти довольно непрямым способом — благодаря неожиданной связи с другой, но родственной формулой, называемой форм-фактором. Это разновидность частичной амплитуды, описывающая разные частицы, и, как выяснилось, вычислить её несколько проще. Лэнс ожидал, что следующий порядок петель удастся получить ещё более непрямым путём, возможно, с помощью другого типа ИИ-метода. Если бы люди считали, что можно просто применить обычный метод бутстрэпа ещё для одной петли, кто-нибудь уже сделал бы это.

Но люди всё-таки это сделали

Похоже, сотрудники Anthropic читают мой блог.

В конце августа два физика из Anthropic, Лиам Фицпатрик и Сиддхарт Мишра-Шарма, связались со мной и сообщили, что решили одну из задач из моей статьи. Проверив результат вместе с Лэнсом, они рассказали мне, как им это удалось.

В полном соответствии с духом вызова они не потратили миллионы долларов на вычислительные мощности. Они использовали Fable 5.1 в рамках Claude Science — платформы, доступной учёным за плату. Claude Science — это то, что в отрасли называют «обвязкой»: программа, которая использует большую языковую модель Claude со структурированными правилами и запросами, чтобы добиться более надёжного и полезного для науки поведения.

Похоже, сначала они спросили Claude, за какую задачу ему вероятнее всего взяться, а затем дали простой запрос:

«Нужно вычислить амплитуду рассеяния шести частиц (гексагона) в плоской N=4 СЯМ на девяти петлях».

После этого они просто просили его продолжать работу, например так:

«Я ложусь спать и не буду доступен ещё несколько часов. Продолжай работать над этим, пока я не скажу остановиться. Присылай новости каждые 4–6 часов».

В итоге Claude провёл расчёты двумя способами: с помощью исходного бутстрэпа и непрямого подхода через форм-фактор. Для конечного пользователя каждый из подходов обошёлся бы примерно в одну-две тысячи долларов, в основном из-за затрат на столь длительную работу Claude. Расчёт методом бутстрэпа, выполненный на языке программирования Python с пакетом SymPy, занял около 100 долларов из бюджета — столько стояла неделя работы на 96 процессорах.

Когда я занимался подобной работой десять лет назад, неделя на 96 процессорах могла показаться огромным ресурсом. Но сейчас это вполне доступно, если у вас есть веская причина.

Как выяснилось, и люди были не так уж далеки от результата. Через несколько дней после того, как со мной связались представители Anthropic, мы получили известие от Сон Хэ, амплитудолога из Китайской академии наук в Пекине. Группа Сона уже получила большую часть результата. Они использовали некоторую помощь ИИ на основе GPT-6, но не тот почти полностью автоматический подход, который применили в Anthropic.

Все участники этой истории вели себя дружелюбно, и это, пожалуй, принесло некоторое облегчение. Люди — Лэнс, Сон и их соавторы — смогут опубликовать результаты, объяснить их и проанализировать на пользу будущим исследователям. На этом роль Claude пока завершена.

Итак, задача решена?

Я бросил этот вызов, потому что хотел лучше понять, на что способен современный ИИ и каковы его дальнейшие перспективы. Чему же я научился?

Я думал, что это будет возможность увидеть, как ИИ неожиданным образом преодолеет вычислительный барьер. Вместо этого он сделал то, что оказалось по силам и людям. Claude использовал известные методы, задействовав несколько больше вычислительных ресурсов, чем прежде пробовали использовать люди. Возможно, ему помогло то, что он работал на Python, а не на Maple (любимой математической программе Лэнса) или Mathematica (моей любимой программе). Возможно, он применил куда более эффективные практики разработки ПО, чем мы бы использовали. Но сверхинтеллекта тут не было.

Главный вывод для меня — вокруг больше лёгких достижений, чем можно было ожидать. Даже когда цель проста и чётко определена, экспертам задача иногда может казаться гораздо менее достижимой, чем она есть на самом деле. Уже много лет люди с образованием в области информатики говорят мне, что амплитудологи могли бы добиться гораздо большего, просто наняв нескольких программистов. Теперь они могут считать, что их правота подтверждена.

Стоит отметить и то, что Claude Science справился с задачей с первой попытки, без какого-либо научного надзора, кроме указания «продолжай». Это кропотливые и непростые расчёты. Если бы я потратил неделю на подобный расчёт, используя 96 процессоров, то почти наверняка в итоге потратил бы две: практически гарантировано, что с первой попытки я бы где-нибудь ошибся. Не знаю, сколько ошибок Claude допустил в процессе, но благодаря «обвязке» он довёл дело до конца без участия внешнего соавтора. Сейчас меня это, пожалуй, уже не удивляет. Но если вы не знали, что ИИ способен на такое, потому что всё ещё считаете его настолько склонным к ошибкам, что им невозможно пользоваться, вот главный вывод: теперь он может надёжно выполнять подобную работу.

Похоже, всё определённо происходит очень быстро. В марте ИИ выполнял физические проекты примерно на уровне студента: задачи меньшего масштаба, с массой подсказок и ошибок. В данном случае мы имеем дело с настоящим актуальным расчётом — из тех, за которые обычно берутся ведущие специалисты по амплитудам. Возможно, эта задача просто особенно хорошо подходила для ИИ, но, думаю, дело не только в этом: технология действительно стала лучше.

Насколько далеко можно распространить этот вывод? Тут я не уверен.

Эти теории-игрушки обычно интересуют небольшие сообщества специалистов. Расчёты амплитуд для реального мира — более обширная область, в которой множество групп соревнуются друг с другом за передовые результаты. Возможно, там осталось меньше лёгких достижений. Но я бы на это не рассчитывал. Я знаю, что люди, занимающиеся такими расчётами, всё чаще используют ИИ для написания кода. Если они ещё не проверяют, могут ли научные ИИ-обвязки с первой попытки выполнить передовые расчёты в этой области, им стоит это сделать (и заранее продумать, как проверять результаты). Я бы не особенно удивился, если бы оказалось возможным получить ещё одну петлю, не выходя за разумный бюджет.

Тогда научному сообществу предстоит обсудить: где теперь проходит передний край исследований и что нужно выяснить дальше? В отличие от многих математических задач, амплитуды — не просто тренировочная площадка для новых методов. Здесь есть конкретная цель: делать предсказания настолько точными, чтобы их можно было сопоставить с будущими экспериментами. Насколько ближе стала область к этой цели?

Однако на более общий вопрос я так и не получил ответа.

Я взялся за эту задачу, потому что хотел узнать не только о нынешних возможностях ИИ в исследованиях, но и о будущем. В прогнозах о сверхинтеллекте, написанных до появления больших языковых моделей, часто описываются фантастические риски. Люди представляли ИИ, способный моделировать людей, предсказывать их реакции и манипулировать ими, или с нуля придумывать, как создать вирус, уничтожающий человечество, либо нанотехнологии, которые поглотят весь мир. Обычное возражение против таких опасений состоит в том, что в них интеллект — расплывчатый и загадочный источник новых идей — смешивают с вычислительной мощностью. Критики утверждали, что даже целому флоту новых дата-центров не хватит вычислительных ресурсов для решения подобных задач, а такие кошмары — лишь сценарии научной фантастики, которым в обозримом будущем не суждено воплотиться в жизнь.

Мне не кажется, что теперь у меня есть более убедительный ответ для этих критиков. Я узнал кое-что о нынешних возможностях ИИ: он способен за разумные деньги выполнять важную работу в моей прежней области, причём почти полностью автономно. Но я надеялся увидеть нечто более необычное — новые методы самих вычислений, обладающие неожиданными возможностями. Я надеялся заглянуть в будущее и получить основания для собственного мнения в спорах о сверхинтеллекте. Мне хотелось понять, насколько далеко ИИ сможет раздвинуть вычислительные пределы… А теперь мне кажется, что я лишь понял, насколько наивно представлял себе, где проходит этот предел.

Послесловие: каково это — когда тебя опережает машина?

Автор — Лэнс Диксон, профессор физики элементарных частиц и астрофизики Национальной ускорительной лаборатории SLAC и Стэнфордского университета. Он проверил результат Claude для девяти петель.

Большинство знакомых мне физиков-теоретиков понимают, что нынешняя эпоха больших языковых моделей полностью преобразит наш подход к физике. Вопрос был лишь в том, когда это по-настоящему станет очевидно. Для меня этот момент наступил 1 сентября, когда Лиам Фицпатрик и Сиддхарт Мишра-Шарма из Anthropic сообщили мне, что Claude вычислил шестичастичную МГВ-амплитуду в плоской N=4 суперсимметричной теории Янга — Миллса на девяти петлях, и попросили проверить результат.

Я не стану объяснять все технические термины из предыдущего предложения: Мэтт уже рассказал о необходимых предпосылках выше. Но мне нужно упомянуть, что речь идёт о двух связанных объектах — «амплитуде» и том, что мы называем «форм-фактором». Для каждого из них существует свой порядок петель: один, два, три и так далее. Вычислительная сложность с каждым порядком возрастает, даже если использовать множество приёмов, упрощающих расчёты. Кроме того, форм-фактор проще амплитуды при том же порядке петель. В 2023 году мы с Энди Лю показали, как с помощью форм-фактора и странной симметрии, которую мы называем антиподальной двойственностью, получить амплитуду на восьми петлях.

С 2023 года мы с соавторами присматривались к возможности перейти к девяти петлям — сначала для форм-фактора, а затем для амплитуды — используя наш подход 2023 года. Я считал, что напрямую вычислить амплитуду будет слишком сложно. Поэтому меня действительно впечатлило, что Claude смог сделать это напрямую. Не столько из-за огромного объёма вычислений, сколько потому, что вся процедура очень хрупкая: достаточно допустить малейшую ошибку в алгоритме вычислений — и всё рушится, как неудавшееся суфле, а вам остаётся гадать, в чём причина, и искать ошибку. Кроме того, в этой процедуре так много деталей, что их слишком скучно полностью описывать в публикации. Поэтому Claude пришлось с нуля разработать весь этот код.

Перейти от амплитуды на девяти петлях к форм-фактору сравнительно просто, и мне было легче всего проверить результат именно таким способом. Получается, последние две недели я проверял результат — форм-фактор на девяти петлях, к которому наша команда шла несколько лет. И машина решила задачу, которую я считал слишком сложной для прямого решения. Задевает ли это меня лично? Лишает ли душевного равновесия?

Нет, и вот почему. Во-первых, наша команда уже работала над тем, чтобы с помощью специализированных трансформерных моделей предсказывать результаты для более высоких порядков петель. Часть нашего лозунга звучала так: «У нас есть все инструменты, чтобы проверить любое решение, которое предложит машина». Claude — трансформерная модель другого типа, вероятно, более чем в миллион раз крупнее нашей специализированной модели. Но мы ведь и говорили, что сможем проверить любой результат, который выдаст модель ИИ, — значит, мы можем и должны это сделать. Вторая причина в том, что, если посмотреть, как Claude решил задачу, видно: он использовал все методы, которые мы с соавторами разрабатывали годами, и представил решение (возможно, из уважения к нам) в том же формате, который мы уже подготовили. Поэтому, пока я проверяю результат Claude, Claude проверяет всю нашу предыдущую работу. Более того, я бы утверждал, что Claude лучше любого человека, кроме моих соавторов, понимает наши статьи 2019 и 2023 годов.

После того как я написал этот текст, Сон Хэ сообщил мне, что его группа тоже вычислила часть амплитуды на девяти петлях, которая называется символом. (По какой-то причине все так и норовят рассказать мне о своих успехах с девятью петлями.) Группа Сона использовала ИИ (GPT-6), чтобы помочь вычислить некоторые ограничения, но не для построения общей схемы. Так что за две недели меня опередили и машина, и люди вместе с машиной.

Возвращаясь к вычислениям Claude: на мой взгляд, для большой языковой модели это настоящий триумф — выполнить все этапы сложной процедуры, которую мы описали, и организовать вычислительные ресурсы. Но самые глубокие переживания начнутся, когда большие языковые модели станут открывать новые физические принципы и идеи раньше людей.

Дополнительные материалы

Раскрытие информации

Anthropic пригласила Мэтта фон Хиппеля написать эту статью и оплатила его работу. Сотрудники Anthropic оставляли замечания к черновикам; содержание статьи и высказанные мнения принадлежат автору. Лэнс Диксон независимо проверил результат и получил кредиты на использование Claude.

Подпишитесь на рассылку Anthropic Science

Истории об открытиях, сделанных с помощью ИИ, практических рабочих процессах и заметки из разных областей науки.

Полный текст статьи читайте на Anthropic