Нейрон неконтролируемого анализа тональности

Мы разработали неконтролируемую систему, которая формирует отличное представление тональности текста, несмотря на то, что обучение сводилось лишь к прогнозированию следующего символа в отзывах на Amazon.

Unsupervised Sentiment Neuron

Иллюстрация:  Людвиг Петтерссон (Ludwig Pettersson)

Линейная модель, использующая это представление, достигает непревзойденной точности анализа тональности на небольшом, но тщательно изученном наборе данных Stanford Sentiment Treebank (мы получаем точность 91.8% против предыдущего лучшего показателя в 90.2%) и способна соответствовать производительности прошлых систем с учителем, используя при этом в 30–100 раз меньше размеченных примеров. Наше представление также содержит отдельный »нейрон тональности», который вбирает в себя практически весь сигнал тональности.

Наша система превосходит другие подходы на датасете Stanford Sentiment Treebank, используя при этом значительно меньше данных.

Graph of labelled training examples

Количество размеченных примеров, необходимых двум вариантам нашей модели (зеленая и синяя линии), чтобы сравняться по эффективности с полностью контролируемыми подходами, каждый из которых обучен на 6920 примерах (штриховые серые линии). Наша модель с L1-регуляризацией (предварительно обученная без учителя на отзывах Amazon) достигает производительности многоканальной сверточной нейросети (multichannel CNN) всего на 11 размеченных примерах, а передовых ансамблей CT-LSTM — на 232 примерах.

Мы были крайне удивлены тем, что наша модель выучила интерпретируемый признак и что простое прогнозирование следующего символа в отзывах Amazon привело к открытию концепции тональности. Мы считаем, что это явление не уникально для нашей модели, а является общим свойством некоторых крупных нейронных сетей, обучаемых предсказывать следующий шаг или измерение в своих входных данных.

Методология

Сначала мы обучили мультипликативную LSTM с 4096 юнитами на корпусе из 82 миллионов отзывов Amazon для прогнозирования следующего символа в фрагменте текста. Обучение заняло один месяц на четырех графических процессорах NVIDIA Pascal, при этом наша модель обрабатывала 12 500 символов в секунду.

Эти 4096 юнитов (которые представляют собой просто вектор чисел с плавающей запятой) можно рассматривать как вектор признаков, описывающий строку, прочитанную моделью. После обучения mLSTM мы превратили модель в классификатор тональности, взяв линейную комбинацию этих юнитов и обучив веса этой комбинации на имеющихся размеченных данных.

Нейрон тональности

Обучая линейную модель с L1-регуляризацией, мы заметили, что она задействует удивительно малое количество изученных юнитов. Разобравшись в ситуации, мы поняли, что на самом деле в ней существует единственный «нейрон тональности», который с высокой точностью предсказывает значение тональности.

Graph depicting positive and negative reviews of the value of the sentiment neuron

Как и аналогичные модели, нашу модель можно использовать для генерации текста. В отличие от других моделей, у нас есть прямой регулятор для управления тональностью результирующего текста: мы можем просто перезаписать значение нейрона тональности.

Пример

На диаграмме ниже показано значение нейрона тональности для каждого символа: отрицательные значения выделены красным цветом, а положительные — зеленым. Обратите внимание, что слова, ярко выражающие оценку, такие как »best» (лучший) или »horrendous» (ужасный), вызывают особенно резкие изменения цвета.

Sentiment Prediction

Изменение значения нейрона тональности символ за символом.

Интересно отметить, что система также производит масштабные обновления после завершения предложений и фраз. Например, в фразе »And about 99.8 percent of that got lost in the film» происходит отрицательное обновление после слова »lost» и более крупное обновление в конце предложения, хотя сама по себе фраза »in the film» не несет никакой эмоциональной окраски.

Обучение без учителя

Размеченные данные — это топливо для современного машинного обучения. Собирать данные легко, но масштабируемо размечать их — трудно. Генерация разметки целесообразна лишь для важнейших задач, где результат оправдывает усилия, таких как машинный перевод, распознавание речи или беспилотирование.

Исследователи в области машинного обучения давно мечтали разработать алгоритмыобучениябезучителя, чтобы формировать качественное представление датасета, которое затем можно использовать для решения задач с помощью всего нескольких размеченных примеров. Наше исследование предполагает, что простое обучение крупных неконтролируемых моделей прогнозирования следующего шага на больших объемах данных может оказаться отличным подходом при создании систем с хорошими возможностями обучения представлений.

Следующие шаги

Наши результаты — это многообещающий шаг на пути к общему обучению представлений без учителя. Мы пришли к этим результатам, исследуя вопрос о том, можно ли получить качественные представления как побочный эффект языкового моделирования, и масштабировав существующую модель на тщательно подобранном наборе данных. Тем не менее, лежащие в основе явления феномены остаются более загадочными, чем понятными.

  • Эти результаты оказались не столь сильными для датасетов с длинными документами. Мы предполагаем, что наша посимвольная модель испытывает трудности с запоминанием информации на протяжении сотен и тысяч временных шагов. Мы считаем, что стоит попробовать иерархические модели, способные адаптировать временные масштабы, на которых они функционируют. Дальнейшее масштабирование таких моделей может еще больше улучшить точность представлений и производительность в задачах анализа тональности и аналогичных задачах.
  • Модель испытывает тем больше трудностей, чем сильнее входной текст отклоняется от данных отзывов. Стоит проверить, приведет ли расширение корпуса текстовых примеров к столь же информативному представлению, которое применимо и к более широким доменам.
  • Наши результаты показывают, что существуют условия, при которых очень крупные модели прогнозирования следующего шага обучаются превосходным неконтролируемым представлениям. Обучение крупной нейронной сети предсказыванию следующего кадра в большой коллекции видеоматериалов может привести к появлению неконтролируемых представлений для классификаторов объектов, сцен и действий.

В целом, важно понимать свойства моделей, режимов обучения и датасетов, которые надежно приводят к столь прекрасным представлениям.

Авторы

Алек Радфорд (Alec Radford), Илья Суцкевер (Ilya Sutskever), Рафал Юзефович (Rafał Józefowicz), Джек Кларк (Jack Clark), Грег Брокман (Greg Brockman)

Благодарности

Оформление: Людвиг Петтерссон (Ludwig Pettersson)

Полный текст статьи читайте на OpenAI