Языковые модели способны к обучению на основе малого числа примеров

image_126.png?w=1600&h=900&fit=fill
Читать научную работу

Недавние исследования продемонстрировали значительные успехи во многих задачах и бенчмарках по обработке естественного языка (NLP) за счет предварительного обучения на большом корпусе текста с последующей доработкой (fine-tuning) под конкретную задачу. Хотя этот подход обычно не зависит от архитектуры конкретной задачи, он все же требует специализированных датасетов для доработки, состоящих из тысяч или десятков тысяч примеров. В отличие от этого, люди обычно способны справляться с новыми языковыми задачами всего по нескольким примерам или простым инструкциям — с чем современные NLP-системы все еще испытывают большие трудности. В данной работе мы показываем, что масштабирование языковых моделей существенно улучшает их универсальную производительность в условиях обучения на малом числе примеров (few-shot), порой достигая уровня конкурентоспособности с предшествующими передовыми подходами на основе доработки. В частности, мы обучаем GPT‑3 — авторегрессионную языковую модель со 175 миллиардами параметров, что в 10 раз больше, чем у любой предыдущей неразреженной языковой модели, и тестируем ее эффективность в режиме few-shot. Для всех задач GPT‑3 применяется без каких-либо градиентных обновлений или доработки, причем сами задачи и демонстрации для обучения задаются исключительно посредством текстового взаимодействия с моделью. GPT‑3 демонстрирует высокие результаты на многих датасетах NLP, включая перевод, ответы на вопросы и заполнение пропусков, а также в ряде задач, требующих логических рассуждений на лету или адаптации к предметной области (например, расшифровка анаграмм слов, использование нового слова в предложении или выполнение трехзначной арифметики. В то же время мы также выявляем некоторые наборы данных, с которыми обучение GPT‑3 по малому числу примеров пока справляется с трудом, а также датасеты, где модель сталкивается с методологическими проблемами, связанными с обучением на обширных веб-корпусах. Наконец, мы обнаруживаем, что GPT‑3 способна генерировать фрагменты новостных статей, которые оценщикам-людям трудно отличить от текстов, написанных людьми. Мы обсуждаем более широкие социальные последствия этого открытия и модели GPT‑3 в целом.

Авторы

Том Браун (Tom Brown), Бенджамин Манн (Benjamin Mann), Ник Райдер (Nick Ryder), Мелани Суббия (Melanie Subbiah), Джаред Каплан (Jared Kaplan), Прафулла Даривал (Prafulla Dhariwal), Арвинд Нилакантан (Arvind Neelakantan), Пранав Шьям (Pranav Shyam), Гириш Шастри (Girish Sastry), Аманда Аскелл (Amanda Askell), Сандини Агаравал (Sandhini Agarwal), Ариэль Герберт-Восс (Ariel Herbert-Voss), Гретхен Крюгер (Gretchen Krueger), Том Хениган (Tom Henighan), Ревон Чайлд (Rewon Child), Адитья Рамеш (Aditya Ramesh)

Авторы

Даниэль Циглер (Daniel Ziegler), Джеффри Ву (Jeffrey Wu), Клеменс Винтер (Clemens Winter), Кристофер Хессе (Christopher Hesse), Марк Чен (Mark Chen), Эрик Сиглер (Eric Sigler), Матеуш Литвин (Mateusz Litwin), Скотт Грей (Scott Gray), Бенджамин Чесс (Benjamin Chess), Джек Кларк (Jack Clark), Кристофер Бернер (Christopher Berner), Сэм МакКэндлиш (Sam McCandlish), Алек Радфорд (Alec Radford), Илья Суцкевер (Ilya Sutskever), Дарио Амодей (Dario Amodei)

Полный текст статьи читайте на OpenAI