Как масштабируется обучение ИИ

Читать статью
How AI Training Scales

Мы обнаружили, что масштаб шума градиента — простая статистическая метрика — позволяет предсказать степень параллелизуемости обучения нейронных сетей для широкого спектра задач. Поскольку сложные задачи, как правило, характеризуются более зашумленными градиентами, в будущем станет целесообразно использовать все большие размеры батчей (пакетов данных), что устранит одно из потенциальных препятствий на пути дальнейшего роста систем ИИ. В более широком смысле эти результаты показывают, что обучение нейронных сетей не обязательно должно считаться загадочным искусством — его можно сделать строгим и систематизированным.

За последние несколько лет исследователи в области ИИ добились больших успехов в ускорении обучения нейронных сетей с помощью параллелизма данных, при котором большие пакеты данных распределяются между множеством машин. Исследователи успешно использовали размеры батчей, исчисляемые десятками тысяч, для классификации изображений и языкового моделирования, и даже миллионы для агентов с подкреплением, играющих в Dota 2. Такие большие пакеты позволяют эффективно направлять возрастающие объемы вычислительных мощностей на обучение одной модели и выступают важным фактором быстрого роста вычислений для ИИ. Однако слишком большие размеры батчей демонстрируют быстро убывающую алгоритмическую отдачу, и пока не до конца понятно, почему эти пределы выше для одних задач и ниже для других.A

Graph of a gradient noise scale

Мы выяснили, что измеряя масштаб шума градиента — простой статистический показатель, количественно определяющий отношение сигнала к шуму градиентов сетиB, мы можем приблизительно предсказать максимально полезный размер батча. Эвристически масштаб шума отражает вариативность данных с точки зрения модели (на определенном этапе обучения). Когда масштаб шума мал, одновременный просмотр большого количества данных быстро становится избыточным, тогда как при большом масштабе шума мы все еще можем извлечь много полезного из огромных пакетов данных.

Подобный тип статистики широко применяется для определения объемавыборки и подбора параметров, а также предлагался для использования в глубокомобучении, однако он не измерялся и не применялся систематически в современных прогонах обучения. Мы проверили это предсказание на широком спектре задач машинного обучения, показанных на рисунке выше, включая распознавание изображений, языковое моделирование, игры Atari и Dota. В частности, мы провели циклы обучения с самыми разными размерами батчей (настраивая скорость обучения отдельно для каждого случая) для всех этих задач и сравнили ускорение обучения с тем, что предсказывает масштаб шума. Поскольку большие размеры батчей часто требуют тщательной и дорогостоящей настройки или специальных графиков скорости обучения для достижения эффективности, знание верхнего предела заранее дает значительное практическое преимущество при обучении новых моделей.

Мы выяснили, что результаты этих экспериментов удобно визуализировать в виде компромисса между реальным временем обучения (wall time) и общим объемом вычислений, затраченных на обучение (пропорциональным денежным затратам). При очень малых размерах батчей удвоение батча позволяет нам обучать модель в два раза быстрее без дополнительных вычислений (мы задействуем вдвое больше чипов в течение вдвое меньшего времени). При очень больших размерах батчей дальнейшая параллелизация не приводит к ускорению обучения. На графике посередине возникает «изгиб», и масштаб шума градиента позволяет точно предсказать, где именно он происходит.

Basic scaling diagram with overlap between economically feasible and technically feasible

Мы строим эти кривые, задавая определенный уровень производительности (например, достижение счета 1000 в игре Atari Beam Rider) и оценивая, сколько времени требуется для его достижения при различных размерах батча. Результаты довольно точно соответствуют предсказаниям нашей модели для самых разных целевых показателей производительности.

Закономерности в масштабе шума градиента

Мы выявили несколько закономерностей в масштабе шума градиента, которые дают ключи к пониманию того, каким может быть будущее обучения ИИ.

Во-первых, в наших экспериментах масштаб шума обычно увеличивается на порядок или более в процессе обучения. Интуитивно это означает, что на ранних этапах обучения сеть изучает более «очевидные» признаки задачи, а на поздних — более сложные. Например, в случае классификатора изображений сеть может сначала научиться определять мелкомасштабные признаки, такие как границы или текстуры, присутствующие на большинстве изображений, и лишь затем объединять эти элементы в более общие понятия, такие как кошки и собаки. Чтобы увидеть все разнообразие границ или текстур, сети требуется просмотреть лишь небольшое количество изображений, поэтому масштаб шума невелик; как только сеть узнает больше о более крупных объектах, она может обрабатывать гораздо больше изображений за раз без дублирования данных.

У нас есть некоторые предварительные свидетельства того, что этот же эффект наблюдается для разных моделей на одном и том же наборе данных: более мощные модели имеют более высокий масштаб шума градиента, но исключительно потому, что они достигают меньших потерь. Таким образом, есть основания полагать, что рост масштаба шума в ходе обучения — это не просто артефакт сходимости, а следствие совершенствования модели. Если это так, то в будущем мы можем ожидать, что более мощные модели будут иметь более высокий масштаб шума и, следовательно, лучше поддаваться параллелизации.

Во-вторых, задачи, которые субъективно кажутся более сложными, также лучше поддаются параллелизации. В контексте обучения с учителем прослеживается четкая прогрессия от MNIST к SVHN, а затем к ImageNet. В контексте обучения с подкреплением прослеживается четкая прогрессия от Atari Pong к Dota 1v1 и Dota 5v5, причем оптимальные размеры батчей различаются более чем в 10 000 раз. Таким образом, по мере перехода ИИ к новым, более сложным задачам мы ожидаем, что модели смогут эффективно использовать еще большие размеры батчей.

Последствия

Степень параллелизма данных существенно влияет на скорость развития возможностей ИИ. Более быстрое обучение делает возможным создание более мощных моделей и ускоряет исследования за счет сокращения циклов итераций.

В более раннем исследовании «ИИ и вычисления» (AI and Compute), мы отмечали, что вычислительные мощности, используемые для обучения крупнейших моделей машинного обучения, удваиваются каждые 3,5 месяца, и указали, что эта тенденция обусловлена сочетанием экономических факторов (готовности тратить деньги на вычисления) и алгоритмической возможности распараллеливать обучение. Последний фактор (алгоритмическая параллелизуемость) труднее поддается прогнозированию, и его пределы изучены недостаточно хорошо, однако наши текущие результаты представляют собой шаг к его систематизации и количественной оценке. В частности, у нас есть доказательства того, что более сложные задачи и более мощные модели для той же задачи позволят использовать более радикальный параллелизм данных, чем наблюдалось до сих пор, обеспечивая ключевой драйвер для дальнейшего быстрого экспоненциального роста вычислительных ресурсов для обучения. (И это даже без учета недавних достижений в области параллелизма моделей, которые могут обеспечить еще большую параллелизацию поверх параллелизма данных).

Продолжающийся рост вычислительных мощностей для обучения и его очевидная предсказуемая алгоритмическая база дополнительно подчеркивают вероятность быстрого расширения возможностей ИИ в ближайшие несколько лет, а также акцентируют срочность исследований, направленных на обеспечение безопасности таких систем и их ответственное использование. Центральной задачей политики в сфере ИИ станет разработка подходов к использованию подобных метрик для прогнозирования характеристик будущих систем ИИ, а также применение этих знаний для формирования такой политики, которая позволит обществу максимизировать пользу и минимизировать риски от этих технологий.

OpenAI стремится как продолжать проведение строгих аналитических исследований, дающих представление о будущем ИИ, так и действовать для решения проблем, которые поднимает этот анализ.

Если вы хотите изучать «науку об ИИ» и помочь нам сделать обучение нейронных сетей более управляемым на основе данных, рассмотрите возможность работы в OpenAI.

Сноски

  1. A

    В аналогичном исследовании, проведенном параллельно с данным, выполнялись тщательные экспериментальные тесты обучения с большими батчами, а также проводился масштабный обзор предыдущей литературы, что позволило устранить ряд несоответствий в более ранних работах. Авторы обнаружили значительные различия в потенциале параллелизма между задачами, и наша работа, судя по всему, объясняет большую часть этой вариативности. Их работа также предполагает, что обучение на больших батчах не влияет на обобщающую способность. Мы верим, что систематические обзоры, подобные этому и другим, невероятно ценны для данной области, и мы намерены продолжать работу в рамках «науки об ИИ».

  2. B

    При обучении нейронных сетей мы обычно обрабатываем за раз лишь небольшой батч данных, что дает зашумленную оценку истинного градиента сети. Мы обнаружили, что масштаб шума градиента _B_noise=E[|G-_G_true|2] / |_G_true|2, где математическое ожидание берется по отдельным точкам данных, оценивает максимально полезный размер батча. Когда градиент вычисляется по батчу размера B, нормированное расстояние между оценкой градиента и истинным градиентом задается формулой E[|_G_B-_G_true|2/|_G_true|2] = _B_noise/B. Точка, в которой увеличение B перестает существенно снижать зашумленность градиента, находится примерно в районе B = _B_noise, и это же значение служит точкой, где прирост скорости обучения начинает снижаться.

Авторы

Сэм МакКэндлиш (Sam McCandlish), Джаред Каплан (Jared Kaplan), Дарио Амодей (Dario Amodei)

Благодарности

Спасибо команде OpenAI Dota (Грег Брокман (Greg Brockman), Брук Чан (Brooke Chan), Пшемыслав Дебяк (Przemysław Debiak), Кристи Деннисон (Christy Dennison), Дэвид Фархи (David Farhi), Рафал Юзефович (Rafał Józefowicz), Якуб Пахоцкий (Jakub Pachocki), Михаил Петров (Michael Petrov), Энрике Понде (Henrique Pondé), Джонатан Райман (Jonathan Raiman), Шимон Сидор (Szymon Sidor), Цзе Тан (Jie Tang), Филип Вольский (Filip Wolski) и Сьюзан Чжан (Susan Zhang)) за их вклад в это исследование.

Мы также благодарим следующих лиц за отзывы о черновиках этой публикации: Грег Брокман (Greg Brockman), Пол Кристиано (Paul Christiano), Дэнни Эрнандес (Danny Hernandez), Джоэл Хестнесс (Joel Hestness), Хиву Джун (Heewoo Jun), Джэхун Ли (Jaehoon Lee), Александер Мадры (Aleksander Madry), Крис Олах (Chris Olah) и Джон Шульман (John Schulman).

Редактор: Джек Кларк (Jack Clark) и Эшли Пилипишин (Ashley Pilipiszyn)

Дизайн: Джастин Джей Ван (Justin Jay Wang)

Иллюстрация на обложке: Бен Барри (Ben Barry)

Полный текст статьи читайте на OpenAI