Image GPT

Читать научную статьюПосмотреть кодСтатья ICML 2020 (V1)
Image GPT

Иллюстрация: Бен Барри (Ben Barry)

Мы обнаружили, что подобно тому, как большая языковая модель-трансформер, обученная на тексте, способна генерировать связный текст, точно такая же модель, обученная на последовательностях пикселей, способна генерировать связные дополнения и образцы изображений. Установив корреляцию между качеством сгенерированных образцов и точностью классификации изображений, мы показываем, что наша лучшая генеративная модель также содержит признаки, не уступающие лучшим сверточным сетям в условиях без учителя.

Введение

Обучение без учителя и самообучение, 1 или обучение без размеченных человеком данных, представляет собой давнюю проблему машинного обучения. В последнее время оно добилось невероятных успехов в области работы с текстом, поскольку модели-трансформеры2, такие как BERT, 3 GPT‑2, 4 RoBERTa, 5 T56 и другие варианты7, 8, 9, 10, достигли высочайших результатов в широком спектре лингвистических задач. Однако тот же широкий класс моделей не преуспел в извлечении сильных признаков для классификации изображений.11 Наша работа направлена на то, чтобы понять и преодолеть этот разрыв.

Модели-трансформеры, такие как BERT и GPT‑2, не зависят от предметной области, что означает их прямую применимость к одномерным последовательностям любой формы. Когда мы обучаем GPT‑2 на изображениях, развернутых в длинные последовательности пикселей (процесс, который мы называем iGPT), мы обнаруживаем, что модель способна понимать характеристики двумерных изображений, такие как внешний вид объектов и их категории. Об этом свидетельствует разнообразный спектр создаваемых ею связных образцов изображений даже без руководства со стороны размеченных человеком данных. В качестве дополнительного доказательства, извлекаемые из модели признаки достигают передовых результатов на ряде датасетов для классификации и близкой к передовой точности без учителяA на ImageNet.

Оценка

Датасет

Наш результат

Лучший результат без iGPT

Логистическая регрессия на изученных признаках (линейный зонд)

CIFAR-10

96.3 iGPT‑L 32×32 с 1536 признаками

95.3 SimCLR12 с 8192 признаками

CIFAR-100

82.8 iGPT‑L 32×32 с 1536 признаками

80.2 SimCLR с 8192 признаками

STL-10

95.5 iGPT‑L 32×32 с 1536 признаками

94.2 AMDIM13 с 8192 признаками

ImageNet

72.0 iGPT‑XLa 64×64 с 15360 признаками

76.5 SimCLR с 8192 признаками

Полная донастройка

CIFAR-10

99.0 iGPT‑L 32×32, обучена на ImageNet

99.0b GPipe, 14 обучена на ImageNet

ImageNet 32×32

66.3 iGPT‑L 32×32

70.2 Isometric Nets15

  1. Мы приводим точность линейного зонда ImageNet только для iGPT‑XL, так как другие эксперименты не завершились до того, как нам потребовалось перейти на другие суперкомпьютерные мощности.
  2. Bit-L, обученная на JFT (300 млн изображений с 18 тыс. классов), достигла результата 99,3.

Чтобы подчеркнуть потенциал генеративного17, 18 моделирования последовательностей19, 20, 21, 22 как алгоритма обучения без учителя общего назначения, мы намеренно используем ту же архитектуру трансформера, что и GPT‑2 в работе с текстом. В результате нам требуется значительно больше вычислительных ресурсов для получения признаков, конкурентоспособных с признаками лучших сверточных сетей без учителя.13, 23, 24, 25, 12 Тем не менее, наши результаты показывают, что при столкновении с новой областью, где правильные априорные модели неизвестны, большая GPT‑2 способна изучать отличные признаки без необходимости в специфических для конкретной предметной области26, 27, 28 архитектурных решениях.

От языковой GPT к визуальной Image GPT

В лингвистике алгоритмы обучения без учителя, основанные на предсказании слов (такие как GPT‑2 и BERT), добились чрезвычайных успехов, показав наивысшую производительность в широком спектре языковых задач. Одна из возможных причин такого успеха заключается в том, что примеры нисходящих языковых задач естественным образом присутствуют в тексте: за вопросами часто следуют ответы (что может помочь в ответах на вопросы), а за отрывками текста — краткие изложения (что может помочь в суммаризации). В отличие от этого, последовательности пикселей не содержат явным образом меток для изображений, к которым они принадлежат.

Даже без такого явного контроля существует причина, почему GPT‑2 может работать с изображениями: достаточно большой трансформер, обученный предсказанию следующего пикселя, со временем может научиться генерировать разнообразныеB образцы с четко распознаваемыми объектами. Как только модель научится этому, идея, известная как «анализ через синтез»29, 30, C, предполагает, что модель также будет обладать информацией о категориях объектов. Многие ранние генеративные модели31, 32, 33, 34, 35, 36 были вдохновлены этой идеей, а в более recientes временах BigBiGAN37 стал примером, продемонстрировавшим обнадеживающие образцы и признаки. В нашей работе мы сначала показываем, что лучшие генеративные модели достигают более высокой производительности классификации. Затем, оптимизируя GPT‑2 для генеративных возможностей, мы добиваемся высочайшего уровня классификации в самых разных условиях, что служит дополнительным доказательством в пользу анализа через синтез.

На пути к общему обучению без учителя

Моделирование генеративных последовательностей — это универсальный алгоритм обучения без учителя: поскольку все типы данных могут быть представлены в виде последовательностей байтов, трансформер можно напрямую применять к любому типу данных без дополнительной инженерии. Наша работа проверяет силу этой универсальности, непосредственно применяя архитектуру, использовавшуюся для обучения GPT‑2 на естественном языке, к генерации изображений. Мы намеренно отказались от ручного кодирования каких-либо специфичных для изображений знаний в виде свёрток38 или таких методов, как относительное внимание, 39 разреженное внимание, 40 и двумерные позиционные эмбеддинги.27

В силу своей универсальности наш метод требует значительно больше вычислительных ресурсов для достижения конкурентоспособной производительности в условиях обучения без учителя. Действительно, контрастные методы41, 42, 43, 44, 45, 13, 23, 24, 25, 12 по-прежнему остаются наиболее эффективными с точки зрения вычислений методами получения высококачественных признаков из изображений. Однако, показав, что модель трансформера без учителя не уступает лучшим сверточным сетям без учителя, 24, 25, 12 мы доказываем, что можно обменять знания о предметной области, заложенные вручную, на вычислительную мощность. В новых областях, 46, 47 где у нас не так много знаний для ручного кодирования, масштабирование вычислений представляется подходящим методом для проверки.

Подход

Мы обучаем iGPT‑S, iGPT‑M и iGPT‑L — трансформеры, содержащие соответственно 76 млн, 455 млн и 1,4 млрд параметров — на наборе данных ImageNet. Мы также обучаем iGPT‑XLD — трансформер с 6,8 миллиарда параметров на смеси ImageNet и изображений из сети. Из-за больших вычислительных затрат на моделирование длинных последовательностей с плотным вниманием мы проводим обучение при низких разрешениях: 32×32, 48×48 и 64×64.

Хотя возникает соблазн работать с еще более низкими разрешениями для дальнейшего снижения вычислительных затрат, предыдущие исследования показали, что результаты распознавания изображений человеком начинают стремительно падать при уменьшении размеров ниже этих значений.48 Вместо этого, вдохновленные палитрами ранних цветных дисплеев, 49 мы создаем собственную 9-битную цветовую палитру для представления пикселей. Использование этой палитры дает длину входной последовательности в 3 раза короче, чем у стандартной палитры (R, G, B), при этом цвета кодируются достаточно точно.

Результаты экспериментов

Мы используем два метода для оценки производительности модели, оба из которых включают задачу последующей классификации (downstream classification). Первый, который мы называем линейным зондом (linear probe), использует обученную модель для извлечения признаковE из изображений в целевом датасете, а затем подгоняет логистическую регрессию под метки. Второй метод дообучаетF всю модель целиком на целевом наборе данных.

Поскольку предсказание следующего пикселя напрямую не связано с классификацией изображений, признаки из финального слоя могут не быть самыми предсказательными для категории объекта. Наш первый результат показывает, что качество признаков является сначала резко возрастающей, а затем плавно убывающей функцией от глубины. Такое поведение предполагает, что генеративная модель на основе трансформера работает в две фазы: на первой фазе каждая позиция собирает информацию из окружающего контекста для построения контекстуализированного признака изображения. На второй фазе этот контекстуализированный признак используется для решения задачи условного предсказания следующего пикселя. Наблюдаемая двухэтапная производительность наших линейных зондов напоминает другую нейросеть без учителя — автокодировщик с «бутылочным горлышком» (bottleneck autoencoder), который вручную спроектирован так, чтобы задействовать признаки посередине.

Наш следующий результат устанавливает связь между генеративной производительностью и качеством признаков. Мы обнаружили, что как увеличение масштаба наших моделей, так и обучение в течение большего числа итераций приводят к улучшению генеративных характеристик, что напрямую трансформируется в лучшее качество признаков.

Когда мы оцениваем наши признаки с помощью линейных зондов на датасетах CIFAR-10, CIFAR-100 и STL-10, мы превосходим признаки всех алгоритмов трансфера с учителем и без учителя. Наши результаты также убедительны в режиме полного дообучения.

Предобучено на ImageNet

Оценка

Модель

Точность

без меток

с метками

CIFAR-10

Линейный зонд

ResNet-15250

94.0

SimCLR12

95.3

iGPT‑L 32×32

96.3

CIFAR-100

Линейный зонд

ResNet-152

78.0

SimCLR

80.2

iGPT‑L 32×32

82.8

STL-10

Линейный зонд

AMDIM-L

94.2

iGPT‑L 32×32

95.5

CIFAR-10

Дообучение

AutoAugment

98.5

SimCLR

98.6

GPipe

99.0

iGPT‑L

99.0

CIFAR-100

Дообучение

iGPT‑L

88.5

SimCLR

89.0

AutoAugment

89.3

EfficientNet52

91.7

Сравнение точности линейного зондирования и дообучения между нашими моделями и лучшими моделями, использующими трансфер на ImageNet с учителем или без учителя. Мы также включили AutoAugment — модель с лучшей производительностью, обученную end-to-end на CIFAR.

Учитывая возросший интерес к обучению без учителя и самообучению на ImageNet, мы также оцениваем производительность наших моделей с использованием линейных зондов на ImageNet. Это особенно сложная задача, поскольку мы не проводим обучение при стандартном разрешении ввода ImageNet. Тем не менее, линейный зонд на 1536 признаках из лучшего слоя iGPT‑L, обученного на изображениях 48×48, дает точность top-1 на уровне 65.2%, превосходя AlexNet.

Контрастные методы обычно сообщают о своих лучших результатах на 8192 признаках, поэтому для сравнения в идеале нам следовало бы оценить iGPT с размерностью эмбеддингов 8192. Однако обучение такой модели непомерно дорого, поэтому в качестве приближения мы конкатенируем признаки из нескольких слоев. К сожалению, наши признаки имеют тенденцию коррелировать между собой в разных слоях, поэтому для конкурентоспособности нам требуется их большее количество. Взятие 15360 признаков из 5 слоев в iGPT‑XL дает точность top-1 на уровне 72.0%, превосходя AMDIM, MoCo и CPC v2, но все еще значительно отставая от SimCLR.

Метод

Входное разрешение

Признаки

Параметры

Точность

Rotation53

оригинал

8192

86M

55.4

iGPT‑L

32×32

1536

1362M

60.3

BigBiGAN37

оригинал

16384

86M

61.3

iGPT‑L

48×48

1536

1362M

65.2

AMDIM13

оригинал

8192

626M

68.1

MoCo24

оригинал

8192

375M

68.6

iGPT‑XL

64×64

3072

6801M

68.7

SimCLR12

оригинал

2048

24M

69.3

CPC v225

оригинал

4096

303M

71.5

iGPT‑XL

64×64

3072×5

6801M

72.0

SimCLR

оригинал

8192

375M

76.5

Сравнение точности линейного зондирования между нашими моделями и современными самообучаемыми моделями. Мы достигаем конкурентоспособной производительности при обучении на значительно более низких разрешениях входных данных, хотя наш метод требует большего количества параметров и вычислительных ресурсов.

Поскольку маскированные языковые модели, такие как BERT, превзошли генеративные модели в большинстве языковых задач, мы также оцениваем производительность BERT на наших моделях изображений. Вместо того чтобы обучать нашу модель предсказывать следующий пиксель по всем предшествующим пикселям, мы маскируем 15% пикселей и обучаем модель предсказывать их по незамаскированным. Мы обнаружили, что хотя производительность линейного зондирования на моделях BERT значительно хуже, они превосходно показывают себя при дообучении:

Хотя неконтролируемое обучение обещает отличные возможности без необходимости использования размеченных человеком данных, за последнее время был достигнут значительный прогресс в рамках более гибкого подхода полуконтролируемого обучения, которое допускает использование ограниченного объема размеченных человеком данных. Успешные методы полуконтролируемого обучения часто опираются на хитроумные приемы, такие как регуляризация согласованности, аугментация данных или псевдоразметка, в то время как чисто генеративные подходы54, 55 не выдерживали конкуренции в течение многих лет. Мы оцениваем iGPT‑LG на конкурентном бенчмарке для этой подобласти и обнаруживаем, что простой линейный зонд для признаков из неаугментированных изображений превосходит Mean Teacher56 и MixMatch, 57 хотя и уступает FixMatch.59

Модель

40 меток

250 меток

4000 меток

Improved GAN55

81.4 ± 2.3

Mean Teacher56

67.7 ± 2.3

90.8 ± 0.2

MixMatch57

52.5 ± 11.5

89.0 ± 0.9

93.6 ± 0.1

iGPT‑L

73.2 ± 01.5

87.6 ± 0.6

94.3 ± 0.1

UDA58

71.0 ± 05.9

91.2 ± 1.1

95.1 ± 0.2

FixMatch59 RA

86.2 ± 03.4

94.9 ± 0.7

95.7 ± 0.1

FixMatch CTA

88.6 ± 03.4

94.9 ± 0.3

95.7 ± 0.2

Сравнение производительности на CIFAR-10 с малым количеством данных. Используя множество неразмеченных изображений ImageNet, iGPT‑L способна превзойти такие методы, как Mean Teacher и MixMatch, но все же уступает современным передовым методам. Наш подход к полуконтролируемому обучению очень прост, поскольку мы лишь настраиваем классификатор логистической регрессии на признаках iGPT‑L без какой-либо аугментации данных или дообучения, что существенно отличает его от специально разработанных полуконтролируемых подходов.

Ограничения

Хотя мы показали, что iGPT способна извлекать мощные признаки изображений, у нашего подхода все еще есть существенные ограничения. Поскольку мы используем универсальный последовательный трансформер, применяемый для GPT‑2 в задачах обработки текста, наш метод требует огромных вычислительных ресурсов: модель iGPT‑L обучалась в течение примерно 2500 V100-дней, в то время как аналогичная по эффективности модель MoCo24 может быть обучена примерно за 70 V100-дней.

Кроме того, мы моделируем входы с низким разрешением с помощью трансформера, в то время как большинство результатов в области самоконтролируемого обучения используют сверточные энкодеры, способные легко обрабатывать входы высокого разрешения. Для дальнейшего масштабирования может потребоваться новая архитектура, такая как доменно-независимый многомасштабный трансформер. Учитывая эти ограничения, наша работа служит прежде всего доказательством концепции способности крупных языковых моделей на базе трансформеров изучать отличные неконтролируемые представления в новых доменах без необходимости использования жестко закодированных знаний о предметной области. Тем не менее, значительные ресурсные затраты на обучение этих моделей и более высокая точность методов на основе сверточных нейронных сетей препятствуют практическому применению этих представлений в реальном мире в сфере компьютерного зрения.

Наконец, генеративные модели могут демонстрировать предвзятость, которая является следствием данных, на которых они обучались. Многие из этих предвзятостей полезны — например, предположение о том, что комбинация коричневых и зеленых пикселей представляет собой ветку, покрытую листьями, с последующим использованием этого предположения для дорисовывания изображения. Однако некоторые из таких предвзятостей могут оказаться вредными, если рассматривать их с точки зрения справедливости и репрезентативности. Например, если у модели формируется визуальное представление об ученых, смещенное в сторону мужчин, она может неизменно дополнять изображения ученых персонажами мужского пола, а не смесью гендеров. Мы ожидаем, что разработчикам придется уделять все больше внимания данным, которые они подают в свои системы, и лучше понимать их связь с предвзятостью в обученных моделях.

Заключение

Мы показали, что, пожертвовав двухмерными знаниями ради масштаба60 и выбрав предиктивные признаки из середины сети, последовательный трансформер может успешно конкурировать с лучшими сверточными сетями в задаче неконтролируемой классификации изображений. Примечательно, что мы достигли таких результатов, напрямую применяя языковую модель GPT‑2 для генерации изображений. Наши результаты показывают, что благодаря своей простоте и универсальности последовательный трансформер при условии выделения достаточных вычислительных мощностей в конечном итоге может стать эффективным способом изучения превосходных признаков в самых разных областях.

Если вы хотите работать с нами в этой области исследований, мы нанимаем сотрудников!

Сноски

  1. A

    Измерено с помощью логистической регрессии по изученным признакам (линейный зонд).

  2. B

    Трансформер обучается максимизировать правдоподобие и, следовательно, охватывает моды распределения, что автоматически обеспечивает разнообразие его выборок.

  3. C

    Идея анализа через синтез (analysis-by-synthesis) в большей степени является аргументом в пользу генеративных моделей со скрытыми переменными, но поскольку генеративные модели без скрытых переменных гораздо лучше справлялись с моделированием распределения данных, мы подумали, что предположение об анализе через синтез должно быть справедливо и для них.

  4. D

    Мы приводим точность линейного зонда на ImageNet только для iGPT-XL, так как другие эксперименты не успели завершиться до того, как нам потребовалось перейти на другие суперкомпьютерные мощности.

  5. E

    Для извлечения признаков для линейного зонда мы берем входные данные блока внимания после нормализации слоев (layernorm) на определенном слое и применяем усредняющий пулинг (average pooling) по размерности последовательности.

  6. F

    Для дообучения мы берем выходные данные трансформера после нормализации слоев и применяем усредняющий пулинг по размерности последовательности в качестве входа для классификационной «головы».

  7. G

    Генеративная модель, которая изучает признаки чисто неконтролируемым образом.

Ссылки

  1. 1

    LeCun, Y. (2017).»Predictive Learning

  2. 2

    Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A., Kaiser, L., & Polosukhin, I.»Attention is All you Need.» In NeurIPS 2017.

  3. 3

    Devlin, J., Chang, M., Lee, K., & Toutanova, K. (2018).»BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding.» arXiv preprint.

  4. 4

    Radford, A., Wu, J., Child, R., Luan, D., Amodei, D., & Sutskever, I. (2019).»Language Models are Unsupervised Multitask Learners.» Technical Report,  OpenAI.

  5. 5

    Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., & Stoyanov, V. (2019).»RoBERTa: A Robustly Optimized BERT Pretraining Approach.» arXiv preprint.

  6. 6

    Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., & Liu, P. (2019).»Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.» arXiv preprint.

  7. 7

    Dai, A., Le, Q. V. (2015).»Semi-supervised sequence learning.» In NeurIPS 2015.

  8. 8

    Peters, M., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., & Zettlemoyer, L. (2018).»Deep Contextualized Word Representations.» In NAACL 2018.

  9. 9

    Howard, J., Ruder, S. (2018).»Universal Language Model Fine-tuning for Text Classification.» In ACL 2018.

  10. 10

    Radford, A., Narasimhan, K., Salimans, T., & Sutskever, I. (2018).»Improving language understanding by generative pre-training.» Technical Report,  OpenAI.

  11. 11

    Ke N., Goyal, A., Bilaniuk, O., Binas, J., Mozer, M., Pal, C., Bengio, Y (2018).»Sparse attentive backtracking: Temporal credit assignment through reminding.» In NeurIPS 2018.

  12. 12

    Chen, T., Kornblith, S., Norouzi, M., Hinton, G. (2020).»A Simple Framework for Contrastive Learning of Visual Representations.» arXiv preprint.

  13. 13

    Bachman, P., Hjelm, R., & Buchwalter, W. (2019).»Learning representations by maximizing mutual information across views.» In NeurIPS 2019.

  14. 14

    Kolesnikov, A. & Beyer, L. & Zhai, X., Puigcerver, J., Yung, J., Gelly, S., Houlsby, N. (2019).»Big Transfer (BiT): General Visual Representation Learning.» arXiv preprint.

  15. 15

    Huang, Y., Cheng, Y., Bapna, A., Firat, O., Chen, D., Chen, M., Lee, H., Ngiam, J., Le, Q. V., Wu, Y., & Chen, Z. (2019) »GPipe: Efficient Training of Giant Neural Networks using Pipeline Parallelism.» In NeurIPS 2019.

  16. 16

    Sandler, M., Baccash, J., Zhmoginov, A., & Howard, A. (2019).»Non-discriminative data or weak model? On the relative importance of data and model resolution.» In ICCV 2019.

  17. 17

    Lasserre, J., Bishop, C., & Minka, T. P. (2006).»Principled Hybrids of Generative and Discriminative Models.» In CVPR 2006.

  18. 18

    Erhan, D., Bengio, Y., Courville, A., Manzagol, P., Vincent, P., Bengio, S. (2010).»Why does unsupervised pre-training help deep learning? .» In JMLR 2010.

  19. 19

    Elman, J. (1990).»Finding Structure in Time.» In Cognitive Science 1990.

  20. 20

    Mikolov, T., Karafiat, M., Burget, L., Cernocky, J., Khudanpur, S. (2010).»Recurrent neural network based language model.» In INTERSPEECH-2010.

  21. 21

    Larochelle, H., Murray, I. (2011).»The neural autoregressive distribution estimator.» In AISTATS 2011.

  22. 22

    Graves, A. (2013).»Generating sequences with recurrent neural networks.» arXiv preprint.

  23. 23

    Tian, Y., Krishnan, D., & Isola, P. (2019).»Contrastive multiview coding.» arXiv preprint.

  24. 24

    He, K., Fan, H., Wu, Y., Xie, S., & Girshick, R. (2019).»Momentum Contrast for Unsupervised Visual Representation Learning.» arXiv preprint.

  25. 25

    Henaff, O., Srinivas, A., De Fauw, J., Razavi, A., Doersch, C., Eslami, S., Oord, A. (2019).»Data-Efficient Image Recognition with Contrastive Predictive Coding .» arXiv preprint.

  26. 26

    Oord, A., Kalchbrenner, N., Kavukcuoglu, K. (2016).»Pixel recurrent neural networks.» arXiv preprint.

  27. 27

    Parmar, N., Vaswani, A., Uszkoreit, J., Kaiser, L., Shazeer, N., Ku, A., & Tran, D. (2018).»Image transformer.» In ICML 2018.

  28. 28

    Menick, J., Kalchbrenner, N. (2018).»Generating High Fidelity Images with Subscale Pixel Networks and Multidimensional Upscaling.» arXiv preprint.

  29. 29

    Mumford, D. (1992).»On the computational architecture of the neocortex.» In Biol. Cybern.

  30. 30

    Rao, R., Ballard, D. (1999).»Predictive coding in the visual cortex: a functional interpretation of some extra-classical receptive-field effects.» In Nature Neuroscience.

  31. 31

    Smolensky, P. (1986).»Information processing in dynamical systems: Foundations of harmony theory

  32. 32

    Hinton, G. (2002).»Training Products of Experts by Minimizing Contrastive Divergence.» In MIT Press.

  1. 33

    Hinton, G., Osindero, S., & Teh, Y. (2006).»A fast learning algorithm for deep belief nets.» In Neural Computation.

  2. 34

    Vincent, P., Larochelle, H., Bengio, Y., & Manzagol, P. (2008).»Extracting and composing robust features with denoising autoencoders.» In ICML 2008.

  3. 35

    Coates, A., Lee, H., & Ng, A. Y. (2011).»An analysis of single-layer networks in unsupervised feature learning.» In AISTATS 2011.

  4. 36

    Le, Q. V., Ranzato, M., Monga, R., Devin, M., Chen, K., Corrado, G., Dean, J. & Ng, A. Y. (2012).»Building high-level features using large scale unsupervised learning.» In ICML 2012.

  5. 37

    Donahue, J., Simonyan, K. (2019).»Large scale adversarial representation learning.» In NeurIPS 2019.

  6. 38

    Ciresan, D., Meier, U., Gambardella, L. & Schmidhuber, J. (2010).»Deep Big Simple Neural Nets Excel on Handwritten Digit Recognition.» In CoRR 2010.

  7. 39

    Shaw, P., Uszkoreit, J., & Vaswani A. (2018).»Self-attention with relative position representations.» In NAACL 2018.

  8. 40

    Child, R., Gray, S., Radford, A., & Sutskever, I. (2019).»Generating long sequences with sparse transformers.» arXiv preprint.

  9. 41

    Becker, S., Hinton, G. (1991).»Self-organizing neural network that discovers surfaces in random-dot stereograms.» In Nature.

  10. 42

    Bromley, J., Guyon, I., LeCun, Y., Sackinger, E., & Shah, R. (1994).»Signature verification using a» siamese» time delay neural network.» In NeurIPS 1994.

  11. 43

    Mikolov, T., Sutskever, I., Chen, K., Corrado, G., & Dean, J. (2013).»Distributed Representations of Words and Phrases and their Compositionality .» In NeurIPS 2013.

  12. 44

    Oord, A., Li, Y., Vinyals, O. (2018).»Representation Learning with Contrastive Predictive Coding .» arXiv preprint.

  13. 45

    Hjelm, R., Fedorov, A., Lavoie-Marchildon, S., Grewal, K., Bachman, P., Trischler, A., & Bengio, Y. (2018).»Learning deep representations by mutual information estimation and maximization.» In ICLR 2019.

  14. 46

    Alley, E., Khimulya, G., Biswas, S., AlQuraishi, M., Church, G. (2019).»Unified rational protein engineering with sequence-only deep representation learning.» In Nature Methods.

  15. 47

    Rives, A., Goyal, S., Meier, J., Guo, D., Ott, M., Zitnick, C., Ma, J., Fergus, R. (2019).»Biological Structure and Function Emerge from Scaling Unsupervised Learning to 250 Million Protein Sequences.» bioRxiv preprint.

  16. 48

    Torralba, A., Fergus, R., Freeman, W. (2008).»80 million tiny images: A large data set for nonparametric object and scene recognition.» In IEEE transactions on pattern analysis and machine intelligence.

  17. 49

    »List of 8-Bit Computer Hardware Graphics.» Wikipedia, 8 May 2020

  18. 50

    Kornblith, S., Shlens, J., & Le, Q. V. (2019).»Do Better ImageNet Models Transfer Better? .» In CVPR 2019.

  19. 51

    Cubuk, E., Zoph, B., Mane, D., Vasudevan, V., & Le, Q. V. (2019).»AutoAugment: Learning Augmentation Strategies From Data.» In CVPR 2019.

  20. 52

    Tan, M., Le, Q. V. (2019).»EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks.» In ICML 2019.

  21. 53

    Gidaris, S., Singh, P., & Komodakis, N. (2018).»Unsupervised Representation Learning by Predicting Image Rotations.» In ICLR 2018.

  22. 54

    Kingma, D., Rezende, D. J., Mohamed, S., & Welling, M. (2014).»Semi-Supervised Learning with Deep Generative Models.» In NeurIPS 2014.

  23. 55

    Salimans, T., Goodfellow, I., Zaremba, W., Cheung, V., Radford, A., Chen, X. (2016).»Improved techniques for training gans.» In NeurIPS 2016.

  24. 56

    Tarvainen, A., Valpola, H. (2017).»Mean teachers are better role models: Weight-averaged consistency targets improve semi-supervised deep learning results.» In NeurIPS 2017.

  25. 57

    Berthelot, D., Carlini, N., Goodfellow, I., Papernot, N., Oliver, A., Raffel, C. (2019).»MixMatch: A Holistic Approach to Semi-Supervised Learning.» In NeurIPS 2019.

  26. 58

    Xie, Q., Dai, Z., Hovy, E., Luong, M., & Le, Q. V. (2019).»Unsupervised Data Augmentation for Consistency Training.» arXiv preprint.

  27. 59

    Sohn, K., Berthelot, D., Li, C., Zhang, Z., Carlini, N., Cubuk, E., Kurakin, A., Zhang, H., Raffel, C. (2020).»Fixmatch: Simplifying semi-supervised learning with consistency and confidence.» arXiv preprint.

  28. 60

    Sutton, R. (2019).»The Bitter Lesson

Авторы

Марк Чен (Mark Chen), Алек Радфорд (Alec Radford), Илья Суцкевер (Ilya Sutskever)

Благодарности

Прежде всего, мы хотели бы выразить признательность соавторам нашей научной работы — Ревону Чайлду (Rewon Child), Джеффу Ву (Jeff Wu), Хиву Джуну (Heewoo Jun), Прафулле Дхаривалу (Prafulla Dhariwal) и Дэвиду Луану (David Luan).

Спасибо следующим лицам за их отзывы об этой работе и вклад в данный релиз: Веданту Мисре (Vedant Misra), Ною Голманту (Noah Golmant), Йоханнесу Оттербаху (Johannes Otterbach), Пранаву Шьяму (Pranav Shyam), Адитье Рамешу (Aditya Ramesh), Юре Бурде (Yura Burda), Харри Эдвардсу (Harri Edwards), Крісу Халласи (Chris Hallacy), Джеффу Клюну (Jeff Clune), Джеку Кларку (Jack Clark), Ирен Солайман (Irene Solaiman), Райану Лоу (Ryan Lowe), Грегу Брокману (Greg Brockman), Келли Симс (Kelly Sims), Дэвиду Фархи (David Farhi), Уиллу Гассу (Will Guss), Куоку В. Ле (Quoc V. Le) и Ашишу Вазвани (Ashish Vaswani).

Редактор: Эшли Пилиписин (Ashley Pilipiszyn)

Дизайн: Джастин Джей Ван (Justin Jay Wang)

Иллюстрация на обложке: Бен Барри (Ben Barry)

Полный текст статьи читайте на OpenAI