ИИ и вычислительные мощности

AI And Compute

Мы публикуем анализ, который показывает, что с 2012 года объем вычислительных мощностей, используемых в крупнейших запусках обучения систем искусственного интеллекта, рос по экспоненте со временем удвоения в 3,4 месяца (для сравнения, закон Мура предполагал период удвоения в 2 года). С 2012 года этот показатель увеличился более чем в 300 000 раз (период удвоения в 2 года дал бы рост лишь в 7 раз). Улучшение вычислительных возможностей является ключевым компонентом прогресса в области ИИ, поэтому, пока эта тенденция сохраняется, стоит подготовиться к последствиям появления систем, далеко превосходящих сегодняшние возможности.

От AlexNet до AlphaGo Zero: увеличение вычислительных мощностей в 300 000 раз

  • Скачать графики

Обзор

Прогресс в области ИИ определяется тремя факторами: алгоритмическими инновациями, данными (которые могут представлять собой как размеченные данные, так и интерактивные среды) и объемом вычислительных мощностей, доступных для обучения. Алгоритмические инновации и данные отслеживать сложно, но вычислительные мощности поддаются количественной оценке необычайно легко, что дает возможность измерить один из вкладов в прогресс ИИ. Разумеется, использование огромных вычислительных мощностей иногда лишь обнажает недостатки наших текущих алгоритмов. Тем не менее, по крайней мере во многих текущих областях, увеличение вычислительных ресурсов ведет к предсказуемому повышению производительности, и зачастую дополняет алгоритмические достижения.

Для данного анализа, как мы полагаем, релевантным показателем является не скорость отдельного графического процессора и не емкость крупнейшего дата-центра, а объем вычислений, используемый для обучения одной модели — именно этот показатель с наибольшей вероятностью коррелирует с мощностью наших лучших моделей. Объем вычислений на одну модель сильно отличается от общего объема валовых вычислений, поскольку ограничения параллелизма (как аппаратного, так и алгоритмического) накладывают рамки на размер модели и степень ее эффективного обучения. Безусловно, важные прорывы по-прежнему совершаются с использованием скромных объемов вычислений — данный анализ посвящен исключительно вычислительным возможностям.

Эта тенденция отражает увеличение примерно в 10 раз каждый год. Отчасти она стимулировалась специализированным железом, позволяющим выполнять больше операций в секунду за определенную цену (GPU и TPU), но в первую очередь она подстегивалась тем, что исследователи неоднократно находили способы задействовать больше чипов параллельно и были готовы нести экономические затраты на это.

Эпохи

Глядя на график, мы можем условно выделить четыре четкие эпохи:

  • До 2012 года: Использование графических процессоров (GPU) для машинного обучения было нетипичным, из-за чего любые результаты, представленные на графике, было сложно достичь.
  • С 2012 по 2014 год: Инфраструктура для обучения на множестве GPU была редким явлением, поэтому в большинстве результатов использовалось от 1 до 8 графических процессоров производительностью 1–2 TFLOPS, что в сумме составляло 0,001–0,1 петафлопс-дней.
  • С 2014 по 2016 год: Крупномасштабные результаты достигались с использованием 10–100 GPU производительностью 5–10 TFLOPS, что давало 0,1–10 петафлопс-дней. Убывающая доходность от параллелизма данных означала, что масштабные запуски обучения имели ограниченную ценность.
  • С 2016 по 2017 год: Подходы, обеспечивающие больший алгоритмический параллелизм, такие как пакеты огромного размера,  поиск архитектур и итерация на основе экспертов, наряду со специализированным железом, вроде TPU, и более быстрыми интерконнектами, значительно расширили эти пределы, по крайней мере для некоторых применений.

AlphaGoZero/AlphaGo Zero — самый наглядный публичный пример масштабного алгоритмического параллелизма, однако многие другие приложения такого масштаба теперь стали возможны алгоритмически и, возможно, уже реализуются в продакшн-среде.

Взгляд в будущее

Мы видим множество причин полагать, что тенденция на графике может продолжиться. Многие аппаратные стартапы разрабатывают чипы, специализированные под ИИ, причем некоторые из них заявляют, что в ближайшие 1–2 года добьются существенного роста показателя FLOPS/Вт (который коррелирует с FLOPS/$). Прирост также может быть достигнут за счет простой реконфигурации оборудования для выполнения того же числа операций с меньшими экономическими затратами. Что касается параллелизма, многие из описанных выше недавних алгоритмических инноваций в принципе могут комбинироваться мультипликативно — например, поиск архитектур и массово-параллельный стохастический градиентный спуск (SGD).

С другой стороны, стоимость со временем ограничит аспект параллелизма в этой тенденции, а физика наложит ограничения на эффективность чипов. Полагаем, что в крупнейших сегодняшних процессах обучения используется оборудование стоимостью в несколько миллионов долларов (хотя амортизированные затраты значительно ниже). Тем не менее, большая часть вычислений нейросетей сегодня по-прежнему расходуется на инференс (развертывание), а не на обучение, что означает возможность для компаний перепрофилировать или позволить себе покупку гораздо более крупных парков чипов для обучения. Следовательно, при наличии достаточных экономических стимулов мы сможем увидеть еще более масштабно-параллельные запуски обучения, а значит, и продолжение этого тренда в течение еще нескольких лет. Мировой бюджет на аппаратное обеспечение составляет 1 триллион долларов в год, поэтому абсолютные пределы еще далеко. В целом, учитывая приведенные данные, прецеденты экспоненциальных тенденций в вычислениях, работы над специализированным под ИИ железом и действующие экономические стимулы, мы считаем ошибочным быть уверенными в том, что этот тренд не продолжится в краткосрочной перспективе.

Прошлые тенденции недостаточны для того, чтобы предсказать, как долго тренд продолжится в будущем или что произойдет, пока он продолжается. Но даже разумный потенциал быстрого роста возможностей означает критическую важность начала работы как над безопасностью, так и над вредоносным использованием ИИ уже сегодня. Предвидение имеет решающее значение для ответственного выработки политики и ответственного технологического развития, и мы должны опережать эти тенденции, а не реагировать на них с опозданием.

Если вы хотите помочь в обеспечении того, чтобыпрогресс в области ИИ приносил пользу всему человечеству, присоединяйтесь к намв OpenAI. Наши вакансии в области исследований и инжиниринга охватывают самые разные направления — отисследователей машинного обучениядоисследователей в области политики безопасностииинженеров инфраструктуры.

Дополнение: Вычислительные мощности, использованные в более ранних знаковых результатах

Мы обновили наш анализ, включив в него данные за период с 1959 по 2012 год. Рассматривая данные в целом, мы четко видим две разные эпохи обучения ИИ-систем с точки зрения использования вычислительных мощностей: (а) первая эпоха, с 1959 по 2012 год, которая определяется результатами, примерно следующими закону Мура, и (б) современная эпоха, с 2012 года по настоящее время, результаты которой используют вычислительную мощность, значительно опережающую макротенденции. История инвестиций в ИИ в целом обычно описывается как череда подъемов и спадов, но мы не наблюдаем этого в исторической динамике вычислительных мощностей, используемых обучаемыми системами. Похоже, что «зимы ИИ» и периоды ажиотажа оказали незначительное влияние на вычислительные ресурсы для обучения моделейB за последние полвека.

Две различные эпохи использования вычислений при обучении ИИ-систем

  • Скачать графики

Начиная с перцептрона в 1959 году, мы наблюдаем период удвоения объема вычислений, использованных в этих исторических результатах, составляющий примерно 2 года, — с переходом на период удвоения в 3,4 месяца примерно с 2012 года. Сделать однозначный вывод только на основе этих данных сложно, но мы считаем, что эта тенденция, вероятно, обусловлена сочетанием ограничений на объем вычислительных мощностей, которые можно было задействовать для тех результатов, и готовности тратить средства на масштабирование экспериментов. C

При проведении этого обновленного анализа мы следовали той же методологии, что и в оригинальной публикации. Когда это было возможно, мы программно подсчитывали количество FLOP в результатах, напрямую реализуя модели. Поскольку компьютерные архитектуры в прошлом различались, а многие научные работы опускали детали своей вычислительной настройки, эти более старые точки данных менее точны (наш первоначальный анализ данных после 2012 года был нацелен на точность в пределах коэффициента 2–3, однако для этих точек данных до 2012 года мы нацелены на оценку по порядку величины). Мы также создали графики, предоставляющие дополнительные ракурсы на данные: на одном графике показано использование вычислений в фундаментальных исследованиях, речи, языке, компьютерном зрении и играх с течением времени, а на другом визуализируются погрешности оценок вокруг каждой точки данных.

Мы испытываем большую неопределенность относительно будущего использования вычислительных мощностей в ИИ-системах, однако сложно быть уверенными в том, что недавняя тенденция к быстрому росту использования вычислений прекратится, и мы видим много причин, по которым этот тренд может продолжиться. Основываясь на этом анализе, мы считаем, что разработчикам государственной политики следует рассмотреть возможность увеличения финансированияD академических исследований в области ИИ, поскольку очевидно, что некоторые виды исследований в области ИИ становятся все более ресурсоемкими и, следовательно, дорогостоящими.

Сноски

  1. A

    Петафлопс-день (pfs-day) заключается в выполнении 1015 операций нейронной сети в секунду в течение одного дня, то есть в общей сложности около 1020 операций. Произведение вычислительной мощности на время используется для удобства восприятия, аналогично кВт⋅ч для энергии. Мы измеряем не пиковую теоретическую производительность (FLOPS) оборудования, а пытаемся оценить количество фактически выполненных операций. Мы считаем сложение и умножение как отдельные операции, учитываем любое сложение или умножение как единую операцию независимо от числовой точности (из-за чего «FLOP» является несколько неточным термином) и не учитываем ансамблевые модели. Примеры расчетов, использованных при построении этого графика, приведены в данном приложении. Время удвоения для показанной линии тренда составляет 3,4 месяца.

  2. B

    Как и в первоначальном анализе, мы сосредоточились на затратах на обучение моделей. Это не включает системы искусственного интеллекта вроде экспертных систем, которые привлекали значительные инвестиции в первую эпоху.

  3. C

    Одно из ярких описаний истории развития вычислений в области ИИ в этот период см. в разделе «Ложный старт» в статье Ханса Моравека.

  4. D

    Мы уже выступали за дополнительное финансирование академических кругов в нашей свидетельских показаниях в Конгрессе в этом году, а также за создание специализированных вычислительных кластеров, которые помогли бы академическому сообществу и индустрии совместно проводить бенчмаркинг и оценивать безопасность систем ИИ в ответ на запрос информации от NIST

Оригинальная публикация

Дарио Амодей (Dario Amodei), Дэнни Эрнандес (Danny Hernandez)

Дополнение

Гириш Састри (Girish Sastry), Джек Кларк (Jack Clark), Грег Брокман (Greg Brockman), Илья Суцкевер (Ilya Sutskever)

Благодарности

Авторы выражают благодарность Кате Грейс (Katja Grace), Джеффри Ирвингу (Geoffrey Irving), Джеку Кларку (Jack Clark), Тому Энтони (Thomas Anthony) и Майклу Пейджу (Michael Page) за помощь в подготовке этой публикации.

Полный текст статьи читайте на OpenAI