ИИ и эффективность

Читать статью
AI And Efficiency

Мы публикуем анализ, который показывает, что с 2012 года объем вычислительных ресурсов, необходимых для обучения нейронной сети до того же уровня производительности в задаче классификации ImageNet, сокращается в 2 раза каждые 16 месяцев. По сравнению с 2012 годом, для обучения нейронной сети до уровня AlexNet теперь требуется в 44 раза меньше вычислительных мощностей (для сравнения, закон Мура за этот период обеспечил бы улучшение стоимости в 11 раз). Наши результаты показывают, что для задач искусственного интеллекта с высоким уровнем недавних инвестиций алгоритмический прогресс принес больше пользы, чем классическая эффективность оборудования.

Ссылки к введению: Imagenet1, AlexNet2, закон Мура3

Алгоритмическое совершенствование является ключевым фактором, стимулирующим развитие искусственного интеллекта. Важно искать метрики, проливающие свет на общий алгоритмический прогресс, даже несмотря на то, что это сложнее, чем измерение подобных тенденций в области вычислений.4

Общий объем вычислительных ресурсов в терафлоп/с-сутках, использованных для обучения до уровня производительности AlexNet. Самые низкие показатели вычислений в любой данный момент времени показаны синим цветом, все измеренные точки — серым.2, 5, 6, 7, 8, 9, 10, 11, 12, 13, 14, 15, 16

Измерение эффективности

Алгоритмическую эффективность можно определить как сокращение объема вычислений, необходимых для обучения конкретной способности. Эффективность — это основной способ измерения алгоритмического прогресса в классических задачах информатики, таких как сортировка. Прирост эффективности в традиционных задачах вроде сортировки измерить проще, чем в машинном обучении, поскольку у них более четкий критерий сложности задачи.A Тем не менее, мы можем применить подход эффективности к машинному обучению, зафиксировав производительность на постоянном уровне. Тенденции эффективности можно сравнить в таких областях, как секвенирование ДНК17 (удвоение каждые 10 месяцев), солнечная энергетика18 (удвоение каждые 6 лет) и плотность транзисторов3 (удвоение каждые 2 года).

Для нашего анализа мы в основном использовали результаты открытой повторной реализации19, 20, 21, чтобы измерить прогресс в достижении производительности уровня AlexNet на длинной дистанции. Мы наблюдали аналогичный темп роста эффективности обучения для производительности уровня ResNet-50 на ImageNet (время удвоения — 17 месяцев).7, 16 Мы наблюдали более высокие темпы улучшений на более коротких временных интервалах в машинном переводе, игре Го и Dota 2:

  1. В сфере перевода модель Transformer22 превзошла производительность seq2seq23 в задаче перевода с английского на французский язык на WMT»14, затратив при этом в 61 раз меньше вычислительных ресурсов на обучение 3 года спустя.
  2. По нашим оценкам, AlphaZero24 потребовалось в 8 раз меньше вычислений для достижения производительности уровня AlphaGoZero25 1 год спустя.
  3. Для повторного запуска OpenAI Five (OpenAI Five Rerun) потребовалось в 5 раз меньше вычислительных ресурсов для обучения, чтобы превзойти оригинальную OpenAI Five26 (которая победила чемпионов мира, OG) 3 месяца спустя.

Бывает полезно мыслить категориями того, что вычислительные мощности 2012 года не равны вычислительным мощностям 2019 года, подобно тому, как доллары со временем должны корректироваться на уровень инфляции. Фиксированный объем вычислений в 2019 году позволял добиться большего, чем в 2012-м. Один из способов осмыслить это заключается в том, что некоторые типы исследований в области ИИ развиваются в два этапа, напоминая модель разработки «такт-так» (tick-tock), принятую в полупроводниковой промышленности: новые возможности («такт») обычно требуют значительных затрат вычислительных ресурсов для их получения, а затем усовершенствованные версии этих возможностей («так») становятся гораздо более эффективными во внедрении благодаря технологическим улучшениям.

Рост алгоритмической эффективности позволяет исследователям проводить больше интересных экспериментов за фиксированное время и с определенным бюджетом. Помимо того, что это показатель общего прогресса, повышение алгоритмической эффективности ускоряет будущие исследования в области ИИ способом, отчасти аналогичным увеличению вычислительных мощностей.

Другие показатели прогресса в области ИИ

Помимо эффективности, множество других показателей проливают свет на общий алгоритмический прогресс в ИИ. Стоимость обучения в долларах28 связана с этим, но в меньшей степени сфокусирована на алгоритмическом прогрессе, поскольку на нее также влияют усовершенствования базового оборудования, степень его использования и облачная инфраструктура. Эффективность использования данных является ключевым фактором в условиях дефицита данных, что характерно для многих интересных задач. Возможность обучать модели быстрее29 также ускоряет исследования и может рассматриваться как показатель возможности распараллеливания30 изучаемых возможностей обучения. Мы также считаем значимым рост эффективности инференса (вывода) с точки зрения времени GPU31, параметров16 и операций с плавающей запятой (flops), но главным образом в силу их экономических последствийB, а не их влияния на будущий прогресс в исследованиях. ShuffleNet13 достигла производительности уровня AlexNet с 18-кратным увеличением эффективности инференса за 5 лет (время удвоения — 15 месяцев), что говорит о том, что эффективность обучения и эффективность инференса могут улучшаться с сопоставимой скоростью. Создание наборов данных, сред и бенчмарков — это мощный метод, делающий конкретные интересующие нас возможности ИИ более измеримыми.

Основные ограничения

  1. У нас есть лишь небольшое количество точек данных об алгоритмической эффективности по нескольким задачам. Неясно, в какой степени наблюдаемые нами тенденции эффективности применимы к другим задачам ИИ. Систематические измерения могли бы прояснить, существует ли алгоритмический эквивалент закона МураC в области искусственного интеллекта, и если он существует, то какова его природа. Мы считаем это чрезвычайно интересным открытым вопросом. Мы подозреваем, что с большей вероятностью будем наблюдать аналогичные темпы роста эффективности для похожих задач. Под похожими задачами мы понимаем задачи в рамках этих поддоменов ИИ, в отношении которых в академическом сообществе существует согласие о достижении существенного прогресса, и которые имеют сопоставимые уровни инвестиций (вычислительных ресурсов и/или рабочего времени исследователей).
  2. Несмотря на то, что мы считаем AlexNet проявлением огромного прогресса, этот анализ не ставит перед собой задачу количественной оценки этого прогресса. В более общем плане, при первом создании какой-либо возможности алгоритмические прорывы могли снизить требования к ресурсам с абсолютно невыполнимыхD до просто высоких. Мы полагаем, что появление новых возможностей в целом составляет большую долю общего концептуального прогресса, чем наблюдаемый прирост эффективности того типа, который представлен здесь.
  3. Данный анализ сфокусирован на стоимости финального обучающего прогона для оптимизированной модели, а не на общих затратах на разработку. Некоторые алгоритмические улучшения облегчают обучение модели за счет значительного расширения пространства гиперпараметров, при которых обучение будет стабильным и обеспечит хорошую итоговую производительность. С другой стороны, поиск архитектур увеличивает разрыв между стоимостью финального обучения и общими затратами на обучение.
  4. Мы не строим предположенийE о том, в какой степени тенденции эффективности будут экстраполироваться во времени, а лишь представляем наши результаты и обсуждаем последствия в случае сохранения этих тенденций.

Измерения и политика в сфере ИИ

Мы считаем32, что выработка политики в области ИИ выиграет от большего внимания к измерению и оценке систем искусственного интеллекта — как с точки зрения технических характеристик, так и их общественного влияния. Мы полагаем, что подобные инициативы по измерениям могут пролить свет на важные вопросы государственной политики; наш анализ «ИИ и вычислительные мощности»4 говорит о том, что политикам следует увеличить финансирование вычислительных ресурсов для академических кругов, чтобы академические исследования могли реплицировать, воспроизводить и расширять исследования индустрии. Данный анализ эффективности показывает, что регулирующие органы могут сформировать точное интуитивное понимание стоимости развертывания возможностей ИИ — и того, как эти затраты будут меняться со временем, — если будут более тщательно оценивать темпы роста эффективности систем искусственного интеллекта.

Отслеживание эффективности в будущем

Если масштабные вычисления продолжают играть важную роль в достижении передовых (SOTA) общих результатов в таких областях, как обработка естественного языка и игры, то крайне важно уделять внимание оценке значимого прогресса, достигаемого с меньшими объемами вычислительных ресурсов (такой вклад часто вносят академические институты). Модели, достигающие передовой эффективности обучения по ключевым возможностям, являются перспективными кандидатами для масштабирования и потенциального достижения наивысших общих результатов. Кроме того, определение улучшений алгоритмической эффективности не представляет сложностьF, поскольку они представляют собой особо значимый срез кривых обучения, порождаемых любыми экспериментами.

Мы также считаем, что измерение долгосрочных тенденций в показателях эффективности SOTA поможет составить количественную картину общего алгоритмического прогресса. Мы наблюдаем, что прирост производительности за счет аппаратного и алгоритмического обеспечения носит мультипликативный характер и на значимых временных интервалах может находиться в одном масштабе, что говорит о необходимости интеграции показателей из обеих сфер в хорошую модель прогресса ИИ.

Наши результаты показывают, что для задач ИИ с высоким уровнем инвестиций (время исследователей и/или вычислительные мощности) алгоритмическая эффективность может опережать прирост за счет аппаратного обеспечения (закона Мура). Закон Мура был сформулирован в 1965 году, когда интегральные схемы содержали всего 64 транзистора (6 удвоений), а его наивная экстраполяция предсказала появление персональных компьютеров и смартфонов (iPhone 11 содержит 8,5 миллиардов транзисторов). Если мы наблюдаем десятилетия экспоненциального роста алгоритмической эффективности ИИ, к чему это может привести? Мы не уверены. Тот факт, что эти результаты заставляют нас задаваться этим вопросом, является для нас умеренным шагом к будущему с мощными ИИ-сервисами и технологиями.

По всем этим причинам мы начинаем публично отслеживать показатели эффективности SOTA. Мы начнем с бенчмарков эффективности в области компьютерного зрения и машинного перевода (ImageNetG и WMT14) и со временем планируем добавить другие бенчмарки. Мы уверены, что в этих бенчмарках существуют показатели эффективности SOTA, о которых мы не знаем, и призываем исследовательское сообщество присылать их сюда (мы укажем первоначальных авторов и соавторов).

Лидеры индустрии, директивные органы, экономисты и потенциальные исследователи — все они пытаются лучше понять прогресс в области ИИ и решить, сколько внимания следует уделять этой сфере и куда его направлять. Усилия по измерению могут помочь обосновать такие решения. Если вас интересует подобная работа,  рассмотрите возможность подачи заявки на работу в команде Foresight или Policy компании OpenAI!

Сноски

  1. A

    В примере с сортировкой «сложность» задачи — это длина списка. Стоимость быстрой сортировки (quicksort), широко используемого алгоритма, обозначается в «о-большое» нотации:  O (nlog⁡n) O (n\log{}n)

  2. B

    Затраты на инференс доминируют в общих расходах успешно развернутых систем. Затраты на инференс масштабируются в зависимости от использования системы, в то время как затраты на обучение необходимо оплатить только один раз.

  3. C

    В этой статье мы понимаем под законом Мура стабильное, долго наблюдаемое двухлетнее удвоение показателя «доллары за флопс». Закон Мура также можно интерпретировать как тенденцию изменения соотношения долларов и флопсов, которая в последнее время замедлилась.

  4. D

    Например, алгоритмический прогресс может изменить класс сложности какой-либо задачи с экспоненциальной до полиномиальной стоимости. Подобный прирост эффективности для интересующих нас возможностей сложно наблюдать напрямую, хотя его можно заметить с помощью асимптотического анализа или экстраполяции эмпирически выведенных законов масштабирования.

  5. E

    Составление достоверных прогнозов на такие темы — масштабная задача, и мы предпочитаем избежать её здесь, чем уделить ей недостаточное внимание.

  6. F

    Фактически эта работа была проделана в основном путем обучения моделей примеров на PyTorch с корректировками для улучшения раннего обучения.

  7. G

    ImageNet — единственный источник обучающих данных, разрешенный для бенчмарка компьютерного зрения. Никакие человеческие описания (кэпшены), другие изображения или иные данные не допускаются. Автоматическая аугментация разрешена.

Источники

  1. 1

    Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009).»ImageNet: A Large-Scale Hierarchical Image Database.» In CVPR09.

  2. 2

    Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012).»Imagenet classification with deep convolutional neural networks.» In F. Pereira, C.J. C. Burges, L. Bottou, & K.Q. Weinberger (Eds.), Advances in Neural Information Processing Systems 25 (pp. 1097–1105). Curran Associates,  Inc.

  3. 3

    Moore, G. E. (1965).»Cramming more components onto integrated circuits.» Electronics 38(8).

  4. 4

    Amodei, D. & Hernandez, D. (2018).»AI and Compute

  5. 5

    Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., & Rabinovich, A. (2014).»Going deeper with convolutions

  6. 6

    Simonyan, K. & Zisserman, A. (2014).»Very deep convolutional networks for large-scale image recognition

  7. 7

    He, K., Zhang, X., Ren, S., & Sun, J. (2015).»Deep residual learning for image recognition .»

  8. 8

    Iandola, F. N., Han, S., Moskewicz, M. W., Ashraf, K., Dally, W. J., & Keutzer, K. (2016).»Squeezenet: Alexnet-level accuracy with 50x fewer parameters and <0.5mb model size

  9. 9

    Zagoruyko, S. & Komodakis, N. (2016).»Wide residual networks

  10. Xie, S., Girshick, R., Dollár, P., Tu, Z., & He, K. (2016).»

Aggregated residual transforma- tions for deep neural networks

  1. 11

    Huang, G., Liu, Z., vanderMaaten, L.,&Weinberger, K.Q.(2016).»Densely connected convolutional networks

  2. 12

    Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., An- dreetto, M., & Adam, H. (2017).»Mobilenets: Efficient convolutional neural networks for mobile vision applications

  3. 13

    Zhang, X., Zhou, X., Lin, M., & Sun, J. (2017).»Shufflenet: An extremely efficient convolutional neural network for mobile devices

  4. 14

    Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., & Chen, L.-C. (2018).»Mobilenetv2: Inverted residuals and linear bottlenecks

  5. 15

    Ma, N., Zhang, X., Zheng, H.-T., & Sun, J. (2018).»Practical guidelines for efficient cnn architecture design

  6. 16

    Tan, M. & Le, Q. V. (2019).»Efficientnet: Rethinking model scaling for convolutional neural networks

  7. 17

    Sawyer, Eric (2011).»High Throughput Sequencing and Cost Trends

  8. 18

    Roberts, David (2019).»Getting to 100% renewables requires cheap energy storage. But how cheap?

  9. 19

    Paszke, A., Gross, S., Chintala, S., Chanan, G., Yang, E., DeVito, Z., Lin, Z., Desmai- son, A., Antiga, L., & Lerer, A. (2017).»Automatic differentiation in PyTorch. In NIPS Autodiff Workshop

  10. 20

    Huang, J. (2017).»Shufflenet in pytorch

  11. 21

    Xiao, H. (2017).»Pytorch mobilenet implementation of «mobilenets: Efficient convolutional neural networks for mobile vision applications»

  12. 22

    Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, L., & Polosukhin, I. (2017).»Attention is all you need. CoRR,  abs/1706.03762

  13. 23

    Sutskever, I., Vinyals, O., & Le, Q. V. (2014).»Sequence to sequence learning with neural networks. CoRR,  abs/1409.3215

  14. 24

    Silver, D., Hubert, T., Schrittwieser, J., Antonoglou, I., Lai, M., Guez, A., Lanctot, M., Sifre, L., Kumaran, D., Graepel, T., Lillicrap, T., Simonyan, K., & Hassabis, D. (2018).»A general reinforcement learning algorithm that masters chess, shogi, and go through self-play. Science, 362(6419),  1140–1144

  15. 25

    Silver, D., Schrittwieser, J., Simonyan, K., Antonoglou, I., Huang, A., Guez, A., Hubert, T., Baker, L., Lai, M., Bolton, A., Chen, Y., Lillicrap, T., Hui, F., Sifre, L., van den Driessche, G., Graepel, T., & Hassabis, D. (2017).»Mastering the game of go without human knowledge. Nature, 550,  354–

  16. OpenAI et. al, :, Berner, C., Brockman, G., Chan, B., Cheung, V., De ̨biak, P., Dennison, C., Farhi, D., Fischer, Q., Hashme, S., Hesse, C., Józefowicz, R., Gray, S., Olsson, C., Pachocki, J., Petrov, M., de Oliveira Pinto, H. P., Raiman, J., Salimans, T., Schlatter, J., Schneider, J., Sidor, S., Sutskever, I., Tang, J., Wolski, F., & Zhang, S. (2019).»

Dota 2 with Large Scale Deep Reinforcement Learning

  1. Cody A. Coleman, Deepak Narayanan, Daniel Kang, Tian Zhao, Jian Zhang, Luigi Nardi, Peter Bailis, Kunle Olukotun, Chris Ré, and Matei Zaharia (2017).»

High Throughput Sequencing and Cost Trends

  1. 28

    Paszke, A., Gross, S., Chintala, S., Chanan, G., Yang, E., DeVito, Z., Lin, Z., Desmai- son, A., Antiga, L., & Lerer, A. (2017).»DAWNBench: An End-to-End Deep Learning Benchmark and Competition. NIPS ML SYSTEMS WORKSHOP,  2017

  2. 29

    Raymond Perrault, Yoav Shoham, E.B. J. C.J. E. B.G. T. L.J. M. S. M. & Niebles, J. C. (2019).»The AI Index 2019 Annual Report». Technical report, AI Index Steering Committee, Human-Centered AI Institute, Stanford University, Stanford,  CA

  3. 30

    McCandlish, S., Kaplan, J., Amodei, D., & Team, O. D. (2018).»An empirical model of large-batch training

  4. 31

    van den Oord, A., Li, Y., Babuschkin, I., Simonyan, K., Vinyals, O., Kavukcuoglu, K., van den Driessche, G., Lockhart, E., Cobo, L. C., Stimberg, F., Casagrande, N., Grewe, D., Noury, S., Dieleman, S., Elsen, E., Kalchbrenner, N., Zen, H., Graves, A., King, H., Walters, T., Belov, D., & Hassabis, D. (2017).»Parallel wavenet: Fast high-fidelity speech synthesis.

  5. 32

    Jack Clark (2019).»Written Testimony of Jack Clark, Policy Director at OpenAI. Hearing on «Artificial Intelligence: Societal and Ethical Implications» before the House Committee on Science, Space, & Technology

Авторы

Дэнни Эрнандес, Том Браун

Благодарности

Мы хотели бы поблагодарить следующих людей за полезные беседы и/или отзывы об этой публикации: Дарио Амодея (Dario Amodei), Джека Кларка (Jack Clark), Алека Радфорда (Alec Radford), Пола Кристиано (Paul Christiano), Сэма МакКэндлиша (Sam McCandlish), Илью Суцкевера (Ilya Sutskever), Джейкоба Стейнхардта (Jacob Steinhardt), Джареда Каплана (Jared Kaplan), Аманду Аскелл (Amanda Askell), Джона Шульмана (John Schulman), Джейкоба Хилтона (Jacob Hilton), Асю Бергал (Asya Bergal), Катю Грейс (Katja Grace), Райана Кэри (Ryan Carey), Николаса Джозефа (Nicholas Joseph), Джеффри Ирвинга (Geoffrey Irving), Джеффа Клюна (Jeff Clune) и Эшли Пилиписин (Ashley Pilipiszyn).

Спасибо Джастину Джею Вангу (Justin Jay Wang) за дизайн.

Спасибо Ники Пармар (Niki Parmar) за предоставление актуальных точек для оригинальных кривых обучения трансформера.

Также благодарим Минсина Тана (Mingxing Tan) за предоставление актуальных точек из кривых обучения EfficientNet и проведение эксперимента с уменьшенным периодом разогрева (warmup).

Полный текст статьи читайте на OpenAI