Улучшение понимания языка с помощью неконтролируемого обучения

Читать доклад
Language Unsupervised

Иллюстрация:  Бен Барри (Ben Barry)

Мы добились передовых результатов в ряде разнообразных языковых задач с помощью масштабируемой системы, не зависящей от конкретной задачи, которую мы также выпускаем в открытый доступ. Наш подход представляет собой комбинацию двух существующих идей: трансформеров и неконтролируемого предварительного обучения. Эти результаты служат убедительным доказательством того, что сочетание методов обучения с учителем и неконтролируемого предварительного обучения работает очень эффективно. Эту идею многие исследовали в прошлом, и мы надеемся, что наш результат послужит стимулом для дальнейших исследований по ее применению к более крупным и разнообразным наборам данных.

Набор данных

Задача

SOTA

Наш результат

SNLI

Текстовое влечение (Entailment)

89.3

89.9

MNLI matched

Текстовое влечение

80.6

82.1

MNLI mismatched

Текстовое влечение

80.1

81.4

SciTail

Текстовое влечение

83.3

88.3

QNLI

Текстовое влечение

82.3

88.1

RTE

Текстовое влечение

61.7

56.0

STS-B

Смысловая близость

81.0

82.0

QQP

Смысловая близость

66.1

70.3

MRPC

Смысловая близость

86.0

82.3

RACE

Понимание прочитанного

53.3

59.0

ROCStories

Рассуждения на основе здравого смысла

77.6

86.5

COPA

Рассуждения на основе здравого смысла

71.2

78.6

SST-2

Анализ тональности

93.2

91.3

CoLA

Лингвистическая приемлемость

35.0

45.4

GLUE

Многозадачный бенчмарк

68.9

72.8

Наша система работает в два этапа: сначала мы обучаем модель-трансформер на очень большом объеме данных без учителя (используя языковое моделирование в качестве обучающего сигнала), а затем дорабатываем (fine-tune) эту модель на гораздо меньших наборах данных с учителем, чтобы помочь ей решать конкретные задачи. Мы разработали этот подход после нашей работы над нейроном тональности, в которой мы отметили, что методы неконтролируемого обучения могут давать удивительно дискриминативные признаки при обучении на достаточном количестве данных. Здесь мы хотели продолжить исследование этой идеи: можем ли мы разработать одну модель, обучить ее без учителя на большом объеме данных, а затем дообучить для достижения хорошей производительности во множестве различных задач? Наши результаты показывают, что этот подход работает на удивление хорошо; одна и та же базовая модель может быть дообучена для решения совершенно разных задач с минимальной адаптацией.

Эта работа опирается на подход, представленный в работе Полуконтролируемое обучение последовательностей, который показал, как улучшить показатели классификации документов с помощью неконтролируемого предварительного обучения LSTM с последующей доработкой с учителем. Она также расширяет исследование ULMFiT, в котором показано, как единая языковая модель LSTM, не зависящая от набора данных, может быть дообучена для получения передовых результатов на различных наборах данных классификации документов. Наша работа демонстрирует, как модель на базе архитектуры Transformer может быть использована в рамках этого подхода для успешного решения более широкого круга задач, выходящих за рамки классификации документов, таких как рассуждения на основе здравого смысла, смысловое сходство и понимание прочитанного. Она также похожа на ELMo, но в меньшей степени зависит от конкретных задач (более универсальна). ELMo включает предварительное обучение, но использует специализированные под задачи архитектуры для достижения передовых результатов в широком спектре задач.

Для достижения наших результатов потребовалось совсем немного настроек. Во всех наборах данных используется единая прямая языковая модель без каких-либо ансамблей, а в большинстве заявленных результатов применяются абсолютно одинаковые настройки гиперпараметров.

Результат, который вызывает у нас особое воодушевление, — это производительность нашего подхода на трех наборах данных — COPA, RACE и ROCStories, — предназначенных для проверки рассуждений на основе здравого смысла и понимания прочитанного. Наша модель устанавливает новые рекорды на этих наборах данных с большим отрывом. Считается, что для решения этих задач требуются многопредложенческие рассуждения и значительные знания об окружающем мире, что говорит о том, что наша модель улучшает эти навыки преимущественно за счет неконтролируемого обучения. Это свидетельствует о наличии надежды на развитие комплексных возможностей понимания языка с помощью неконтролируемых методов.

Почему неконтролируемое обучение?

Обучение с учителем лежит в основе большинства недавних успехов машиннного обучения. Тем не менее, для его эффективной работы могут потребоваться крупные, тщательно очищенные и дорогие в создании наборы данных. Неконтролируемое обучение привлекательно тем, что оно потенциально способно устранить эти недостатки. Поскольку обучение без учителя устраняет узкое место в виде ручной разметки людьми, оно также хорошо масштабируется в соответствии с современными тенденциями роста вычислительных мощностей и доступности сырых данных. Неконтролируемое обучение — это оченьактивнаяобластьисследований, однако практическое применение его все еще зачастую ограничено.

В последнее время наблюдается стремление расширить языковые возможности за счет использования неконтролируемого обучения для дополнения систем большими объемами неразмеченных данных; представления слов, обученные с помощью неконтролируемых методов, могут использовать огромные наборы данных объемом в терабайты информации и, при интеграции с обучением с учителем, улучшать производительность в широком спектре задач обработки естественного языка (NLP). До недавнего времени эти неконтролируемые методы для NLP (например, GLoVe и word2vec) использовали простые модели (векторы слов) и обучающие сигналы (локальное совместное появление слов). Skip-Thought Vectors — это заметная ранняя демонстрация потенциальных улучшений, которых могут достичь более сложне подходы. Но сейчас используются новые методы, которые еще больше повышают производительность. К ним относятся использование предварительно обученных моделей представления предложений, контекстуализированные векторные представления слов (в частности, ELMo и CoVE), а также подходы, использующие специализированные архитектуры для объединения неконтролируемого предварительного обучения с дообучением с учителем, подобные нашему.

Two side-by-side graphs demonstrating how Zero Shot Transfer can directly accelerate Supervised Fine-Tuning

Мы также заметили, что можем использовать базовую языковую модель для выполнения задач без какого-либо предварительного обучения на них. Например, показатели в таких задачах, как выбор правильного ответа на вопрос с множественным выбором, неуклонно растут по мере совершенствования лежащей в основе языковой модели. Хотя абсолютная производительность этих методов все еще часто довольно низка по сравнению с современными подходами с учителем (для задачи ответов на вопросы она по-прежнему уступает простому базовому методу скользящего окна), обнадеживает то, что такое поведение является устойчивым для широкого круга задач. Случайным образом инициализированные сети, не содержащие никакой информации о задаче и мире, справляются с этими эвристиками не лучше случайного угадывания. Это дает некоторое понимание того, почему генеративное предварительное обучение может улучшить производительность при решении последующих (downstream) задач.

Мы также можем использовать существующую языковую функциональность модели для анализа тональности. Для набора данных Stanford Sentiment Treebank, который состоит из предложений из положительных и отрицательных рецензий на фильмы, мы можем использовать языковую модель, чтобы угадать, является ли рецензия положительной или отрицательной, введя слово «очень» (very) после предложения и проверив, какое слово модель предсказывает как более вероятное — «положительный» (positive) или «отрицательный» (negative). Этот подход, вообще без адаптации модели к задаче, демонстрирует результаты на уровне классических базовых методов с точностью около 80%.

Наша работа также является подтверждением надежности и полезности архитектуры трансформера, показывая, что она достаточно гибкая для достижения передовых результатов в широком спектре задач без необходимости сложной специфической для задачи кастомизации или настройки гиперпараметров.

Недостатки

У этого проекта есть несколько нерешенных проблем, на которые стоит обратить внимание:

  • Требования к вычислительным ресурсам: Многие предыдущие подходы к задачам NLP обучают относительно небольшие модели на одном графическом процессоре с нуля. Наш подход требует дорогостоящего этапа предварительного обучения — 1 месяц на 8 графических процессорах. К счастью, это нужно сделать всего один раз, и мы выкладываем нашу модель в открытый доступ, чтобы другие могли этого избежать. Это также большая модель (по сравнению с предыдущими работами) и, следовательно, она потребляет больше вычислительных ресурсов и памяти — мы использовали 37-слойную (12 блоков) архитектуру Transformer и обучались на последовательностях длиной до 512 токенов. Большинство экспериментов проводилось на системах с 4 и 8 графическими процессорами. Модель очень быстро дообучается под новые задачи, что помогает смягчить требования к дополнительным ресурсам.
  • Ограничения и предвзятость познания мира через текст: Книги и тексты, легко доступные в интернете, не содержат полной или даже точной информации о мире. Недавние исследования показали, что определенные виды информации трудно усвоить исключительно через текст, а другие работы продемонстрировали, что модели усваивают и используют предвзятости в распределении данных.
  • Все еще хрупкая генерализация: Хотя наш подход улучшает производительность в широком спектре задач, современные модели глубокого обучения для NLP все еще демонстрируют удивительное и контринтуитивное поведение — особенно при оценке систематическим, состязательным (adversarial) образом или на данных вне распределения. Наш подход не защищен от этих проблем, хотя мы и наблюдаем некоторые признаки прогресса. Наш подход демонстрирует повышенную лексическую надежность по сравнению с предыдущими чисто нейронными подходами к задаче текстового влечения (entailment). На наборе данных, представленном в работе Glockner et al. (2018), наша модель достигает точности 83.75%, показывая результаты, аналогичные модели KIM, которая включает внешние знания через WordNet.

Будущее

  • Масштабирование подхода: Мы заметили, что улучшения производительности языковой модели хорошо коррелируют с улучшениями в решении последующих задач. В настоящее время мы используем стандартное железо (одну машину с 8 графическими процессорами) и набор данных для обучения объемом всего в несколько тысяч книг (~5 ГБ текста). Это говорит о том, что имеется значительный потенциал для улучшения за счет хорошо проверенного подхода с увеличением вычислительных мощностей и данных.
  • Улучшенное дообучение (fine-tuning): Наш подход в настоящее время очень прост. Весьма вероятно, что существенных улучшений можно добиться, используя более сложные методы адаптации и переноса знаний, подобные тем, что исследовались в ULMFiT.
  • Лучшее понимание того, почему генеративное предварительное обучение помогает: Хотя мы обсудили здесь некоторые идеи, к которым склонны, более целенаправленные эксперименты и исследования помогут сделать выбор между конкурирующими объяснениями. Например, какая доля наблюдаемых нами преимуществ обусловлена улучшенной способностью обрабатывать более широкий контекст, а какая — улучшенными знаниями о мире?

Приложение: Примеры наборов данных

Вычислительные ресурсы

Мы все больше заинтересованы в понимании взаимосвязи между вычислительными ресурсами, затрачиваемыми на обучение моделей, и получаемыми результатами. Общий объем вычислений, использованных для обучения этой модели, составил 0,96 петафлопс-дней (pfs-days).

Обычный текст

1
8 P600 GPU's * 30 days * 12 TFLOPS/GPU * 0.33 utilization =
2
= .96 pfs-days

Автор

Alec Radford

Полный текст статьи читайте на OpenAI