Image GPT

Иллюстрация: Бен Барри (Ben Barry)
Мы обнаружили, что подобно тому, как большая языковая модель-трансформер, обученная на тексте, способна генерировать связный текст, точно такая же модель, обученная на последовательностях пикселей, способна генерировать связные дополнения и образцы изображений. Установив корреляцию между качеством сгенерированных образцов и точностью классификации изображений, мы показываем, что наша лучшая генеративная модель также содержит признаки, не уступающие лучшим сверточным сетям в условиях без учителя.
Введение
Обучение без учителя и самообучение,
Модели-трансформеры, такие как BERT и GPT‑2, не зависят от предметной области, что означает их прямую применимость к одномерным последовательностям любой формы. Когда мы обучаем GPT‑2 на изображениях, развернутых в длинные последовательности пикселей (процесс, который мы называем iGPT), мы обнаруживаем, что модель способна понимать характеристики двумерных изображений, такие как внешний вид объектов и их категории. Об этом свидетельствует разнообразный спектр создаваемых ею связных образцов изображений даже без руководства со стороны размеченных человеком данных. В качестве дополнительного доказательства, извлекаемые из модели признаки достигают передовых результатов на ряде датасетов для классификации и близкой к передовой точности без учителя
Оценка | Датасет | Наш результат | Лучший результат без iGPT |
|---|---|---|---|
Логистическая регрессия на изученных признаках (линейный зонд) | CIFAR-10 | 96.3 iGPT‑L 32×32 с 1536 признаками | 95.3 SimCLR12 с 8192 признаками |
CIFAR-100 | 82.8 iGPT‑L 32×32 с 1536 признаками | 80.2 SimCLR с 8192 признаками | |
STL-10 | 95.5 iGPT‑L 32×32 с 1536 признаками | 94.2 AMDIM13 с 8192 признаками | |
ImageNet | 72.0 iGPT‑XLa 64×64 с 15360 признаками | 76.5 SimCLR с 8192 признаками | |
Полная донастройка | CIFAR-10 | 99.0 iGPT‑L 32×32, обучена на ImageNet | 99.0b GPipe, 14 обучена на ImageNet |
ImageNet 32×32 | 66.3 iGPT‑L 32×32 | 70.2 Isometric Nets15 |
- Мы приводим точность линейного зонда ImageNet только для iGPT‑XL, так как другие эксперименты не завершились до того, как нам потребовалось перейти на другие суперкомпьютерные мощности.
- Bit-L, обученная на JFT (300 млн изображений с 18 тыс. классов), достигла результата 99,3.
Чтобы подчеркнуть потенциал генеративного,
От языковой GPT к визуальной Image GPT
В лингвистике алгоритмы обучения без учителя, основанные на предсказании слов (такие как GPT‑2 и BERT), добились чрезвычайных успехов, показав наивысшую производительность в широком спектре языковых задач. Одна из возможных причин такого успеха заключается в том, что примеры нисходящих языковых задач естественным образом присутствуют в тексте: за вопросами часто следуют ответы (что может помочь в ответах на вопросы), а за отрывками текста — краткие изложения (что может помочь в суммаризации). В отличие от этого, последовательности пикселей не содержат явным образом меток для изображений, к которым они принадлежат.
Даже без такого явного контроля существует причина, почему GPT‑2 может работать с изображениями: достаточно большой трансформер, обученный предсказанию следующего пикселя, со временем может научиться генерировать разнообразные
На пути к общему обучению без учителя
Моделирование генеративных последовательностей — это универсальный алгоритм обучения без учителя: поскольку все типы данных могут быть представлены в виде последовательностей байтов, трансформер можно напрямую применять к любому типу данных без дополнительной инженерии. Наша работа проверяет силу этой универсальности, непосредственно применяя архитектуру, использовавшуюся для обучения GPT‑2 на естественном языке, к генерации изображений. Мы намеренно отказались от ручного кодирования каких-либо специфичных для изображений знаний в виде свёрток
В силу своей универсальности наш метод требует значительно больше вычислительных ресурсов для достижения конкурентоспособной производительности в условиях обучения без учителя. Действительно, контрастные методы, , , , , , , , ,
Подход
Мы обучаем iGPT‑S, iGPT‑M и iGPT‑L — трансформеры, содержащие соответственно 76 млн, 455 млн и 1,4 млрд параметров — на наборе данных ImageNet. Мы также обучаем iGPT‑XL
Хотя возникает соблазн работать с еще более низкими разрешениями для дальнейшего снижения вычислительных затрат, предыдущие исследования показали, что результаты распознавания изображений человеком начинают стремительно падать при уменьшении размеров ниже этих значений.
Результаты экспериментов
Мы используем два метода для оценки производительности модели, оба из которых включают задачу последующей классификации (downstream classification). Первый, который мы называем линейным зондом (linear probe), использует обученную модель для извлечения признаков
Поскольку предсказание следующего пикселя напрямую не связано с классификацией изображений, признаки из финального слоя могут не быть самыми предсказательными для категории объекта. Наш первый результат показывает, что качество признаков является сначала резко возрастающей, а затем плавно убывающей функцией от глубины. Такое поведение предполагает, что генеративная модель на основе трансформера работает в две фазы: на первой фазе каждая позиция собирает информацию из окружающего контекста для построения контекстуализированного признака изображения. На второй фазе этот контекстуализированный признак используется для решения задачи условного предсказания следующего пикселя. Наблюдаемая двухэтапная производительность наших линейных зондов напоминает другую нейросеть без учителя — автокодировщик с «бутылочным горлышком» (bottleneck autoencoder), который вручную спроектирован так, чтобы задействовать признаки посередине.
Наш следующий результат устанавливает связь между генеративной производительностью и качеством признаков. Мы обнаружили, что как увеличение масштаба наших моделей, так и обучение в течение большего числа итераций приводят к улучшению генеративных характеристик, что напрямую трансформируется в лучшее качество признаков.
Когда мы оцениваем наши признаки с помощью линейных зондов на датасетах CIFAR-10, CIFAR-100 и STL-10, мы превосходим признаки всех алгоритмов трансфера с учителем и без учителя. Наши результаты также убедительны в режиме полного дообучения.
Предобучено на ImageNet | ||||
Оценка | Модель | Точность | без меток | с метками |
CIFAR-10 Линейный зонд | ResNet-152 | 94.0 | ✔ | |
SimCLR | 95.3 | ✔ | ||
iGPT‑L 32×32 | 96.3 | ✔ | ✔ | |
CIFAR-100 Линейный зонд | ResNet-152 | 78.0 | ✔ | |
SimCLR | 80.2 | ✔ | ||
iGPT‑L 32×32 | 82.8 | ✔ | ||
STL-10 Линейный зонд | AMDIM-L | 94.2 | ✔ | |
iGPT‑L 32×32 | 95.5 | ✔ | ||
CIFAR-10 Дообучение | AutoAugment | 98.5 | ||
SimCLR | 98.6 | ✔ | ||
GPipe | 99.0 | ✔ | ||
iGPT‑L | 99.0 | ✔ | ||
CIFAR-100 Дообучение | iGPT‑L | 88.5 | ✔ | |
SimCLR | 89.0 | ✔ | ||
AutoAugment | 89.3 | |||
EfficientNet | 91.7 | ✔ |
Сравнение точности линейного зондирования и дообучения между нашими моделями и лучшими моделями, использующими трансфер на ImageNet с учителем или без учителя. Мы также включили AutoAugment — модель с лучшей производительностью, обученную end-to-end на CIFAR.
Учитывая возросший интерес к обучению без учителя и самообучению на ImageNet, мы также оцениваем производительность наших моделей с использованием линейных зондов на ImageNet. Это особенно сложная задача, поскольку мы не проводим обучение при стандартном разрешении ввода ImageNet. Тем не менее, линейный зонд на 1536 признаках из лучшего слоя iGPT‑L, обученного на изображениях 48×48, дает точность top-1 на уровне 65.2%, превосходя AlexNet.
Контрастные методы обычно сообщают о своих лучших результатах на 8192 признаках, поэтому для сравнения в идеале нам следовало бы оценить iGPT с размерностью эмбеддингов 8192. Однако обучение такой модели непомерно дорого, поэтому в качестве приближения мы конкатенируем признаки из нескольких слоев. К сожалению, наши признаки имеют тенденцию коррелировать между собой в разных слоях, поэтому для конкурентоспособности нам требуется их большее количество. Взятие 15360 признаков из 5 слоев в iGPT‑XL дает точность top-1 на уровне 72.0%, превосходя AMDIM, MoCo и CPC v2, но все еще значительно отставая от SimCLR.
Метод | Входное разрешение | Признаки | Параметры | Точность |
Rotation | оригинал | 8192 | 86M | 55.4 |
iGPT‑L | 32×32 | 1536 | 1362M | 60.3 |
BigBiGAN | оригинал | 16384 | 86M | 61.3 |
iGPT‑L | 48×48 | 1536 | 1362M | 65.2 |
AMDIM | оригинал | 8192 | 626M | 68.1 |
MoCo | оригинал | 8192 | 375M | 68.6 |
iGPT‑XL | 64×64 | 3072 | 6801M | 68.7 |
SimCLR | оригинал | 2048 | 24M | 69.3 |
CPC v2 | оригинал | 4096 | 303M | 71.5 |
iGPT‑XL | 64×64 | 3072×5 | 6801M | 72.0 |
SimCLR | оригинал | 8192 | 375M | 76.5 |
Сравнение точности линейного зондирования между нашими моделями и современными самообучаемыми моделями. Мы достигаем конкурентоспособной производительности при обучении на значительно более низких разрешениях входных данных, хотя наш метод требует большего количества параметров и вычислительных ресурсов.
Поскольку маскированные языковые модели, такие как BERT, превзошли генеративные модели в большинстве языковых задач, мы также оцениваем производительность BERT на наших моделях изображений. Вместо того чтобы обучать нашу модель предсказывать следующий пиксель по всем предшествующим пикселям, мы маскируем 15% пикселей и обучаем модель предсказывать их по незамаскированным. Мы обнаружили, что хотя производительность линейного зондирования на моделях BERT значительно хуже, они превосходно показывают себя при дообучении:
Хотя неконтролируемое обучение обещает отличные возможности без необходимости использования размеченных человеком данных, за последнее время был достигнут значительный прогресс в рамках более гибкого подхода полуконтролируемого обучения, которое допускает использование ограниченного объема размеченных человеком данных. Успешные методы полуконтролируемого обучения часто опираются на хитроумные приемы, такие как регуляризация согласованности, аугментация данных или псевдоразметка, в то время как чисто генеративные подходы,
Модель | 40 меток | 250 меток | 4000 меток |
Improved GAN | — | — | 81.4 ± 2.3 |
Mean Teacher | — | 67.7 ± 2.3 | 90.8 ± 0.2 |
MixMatch | 52.5 ± 11.5 | 89.0 ± 0.9 | 93.6 ± 0.1 |
iGPT‑L | 73.2 ± 01.5 | 87.6 ± 0.6 | 94.3 ± 0.1 |
UDA | 71.0 ± 05.9 | 91.2 ± 1.1 | 95.1 ± 0.2 |
FixMatch | 86.2 ± 03.4 | 94.9 ± 0.7 | 95.7 ± 0.1 |
FixMatch CTA | 88.6 ± 03.4 | 94.9 ± 0.3 | 95.7 ± 0.2 |
Сравнение производительности на CIFAR-10 с малым количеством данных. Используя множество неразмеченных изображений ImageNet, iGPT‑L способна превзойти такие методы, как Mean Teacher и MixMatch, но все же уступает современным передовым методам. Наш подход к полуконтролируемому обучению очень прост, поскольку мы лишь настраиваем классификатор логистической регрессии на признаках iGPT‑L без какой-либо аугментации данных или дообучения, что существенно отличает его от специально разработанных полуконтролируемых подходов.
Ограничения
Хотя мы показали, что iGPT способна извлекать мощные признаки изображений, у нашего подхода все еще есть существенные ограничения. Поскольку мы используем универсальный последовательный трансформер, применяемый для GPT‑2 в задачах обработки текста, наш метод требует огромных вычислительных ресурсов: модель iGPT‑L обучалась в течение примерно 2500 V100-дней, в то время как аналогичная по эффективности модель MoCo24 может быть обучена примерно за 70 V100-дней.
Кроме того, мы моделируем входы с низким разрешением с помощью трансформера, в то время как большинство результатов в области самоконтролируемого обучения используют сверточные энкодеры, способные легко обрабатывать входы высокого разрешения. Для дальнейшего масштабирования может потребоваться новая архитектура, такая как доменно-независимый многомасштабный трансформер. Учитывая эти ограничения, наша работа служит прежде всего доказательством концепции способности крупных языковых моделей на базе трансформеров изучать отличные неконтролируемые представления в новых доменах без необходимости использования жестко закодированных знаний о предметной области. Тем не менее, значительные ресурсные затраты на обучение этих моделей и более высокая точность методов на основе сверточных нейронных сетей препятствуют практическому применению этих представлений в реальном мире в сфере компьютерного зрения.
Наконец, генеративные модели могут демонстрировать предвзятость, которая является следствием данных, на которых они обучались. Многие из этих предвзятостей полезны — например, предположение о том, что комбинация коричневых и зеленых пикселей представляет собой ветку, покрытую листьями, с последующим использованием этого предположения для дорисовывания изображения. Однако некоторые из таких предвзятостей могут оказаться вредными, если рассматривать их с точки зрения справедливости и репрезентативности. Например, если у модели формируется визуальное представление об ученых, смещенное в сторону мужчин, она может неизменно дополнять изображения ученых персонажами мужского пола, а не смесью гендеров. Мы ожидаем, что разработчикам придется уделять все больше внимания данным, которые они подают в свои системы, и лучше понимать их связь с предвзятостью в обученных моделях.
Заключение
Мы показали, что, пожертвовав двухмерными знаниями ради масштаба
Если вы хотите работать с нами в этой области исследований, мы нанимаем сотрудников!
Сноски
Ссылки
Авторы
Благодарности
Прежде всего, мы хотели бы выразить признательность соавторам нашей научной работы — Ревону Чайлду (Rewon Child), Джеффу Ву (Jeff Wu), Хиву Джуну (Heewoo Jun), Прафулле Дхаривалу (Prafulla Dhariwal) и Дэвиду Луану (David Luan).
Спасибо следующим лицам за их отзывы об этой работе и вклад в данный релиз: Веданту Мисре (Vedant Misra), Ною Голманту (Noah Golmant), Йоханнесу Оттербаху (Johannes Otterbach), Пранаву Шьяму (Pranav Shyam), Адитье Рамешу (Aditya Ramesh), Юре Бурде (Yura Burda), Харри Эдвардсу (Harri Edwards), Крісу Халласи (Chris Hallacy), Джеффу Клюну (Jeff Clune), Джеку Кларку (Jack Clark), Ирен Солайман (Irene Solaiman), Райану Лоу (Ryan Lowe), Грегу Брокману (Greg Brockman), Келли Симс (Kelly Sims), Дэвиду Фархи (David Farhi), Уиллу Гассу (Will Guss), Куоку В. Ле (Quoc V. Le) и Ашишу Вазвани (Ashish Vaswani).
Редактор: Эшли Пилиписин (Ashley Pilipiszyn)
Дизайн: Джастин Джей Ван (Justin Jay Wang)
Иллюстрация на обложке: Бен Барри (Ben Barry)
Полный текст статьи читайте на OpenAI
