Языковые модели способны к обучению на основе малого числа примеров

Недавние исследования продемонстрировали значительные успехи во многих задачах и бенчмарках по обработке естественного языка (NLP) за счет предварительного обучения на большом корпусе текста с последующей доработкой (fine-tuning) под конкретную задачу. Хотя этот подход обычно не зависит от архитектуры конкретной задачи, он все же требует специализированных датасетов для доработки, состоящих из тысяч или десятков тысяч примеров. В отличие от этого, люди обычно способны справляться с новыми языковыми задачами всего по нескольким примерам или простым инструкциям — с чем современные NLP-системы все еще испытывают большие трудности. В данной работе мы показываем, что масштабирование языковых моделей существенно улучшает их универсальную производительность в условиях обучения на малом числе примеров (few-shot), порой достигая уровня конкурентоспособности с предшествующими передовыми подходами на основе доработки. В частности, мы обучаем GPT‑3 — авторегрессионную языковую модель со 175 миллиардами параметров, что в 10 раз больше, чем у любой предыдущей неразреженной языковой модели, и тестируем ее эффективность в режиме few-shot. Для всех задач GPT‑3 применяется без каких-либо градиентных обновлений или доработки, причем сами задачи и демонстрации для обучения задаются исключительно посредством текстового взаимодействия с моделью. GPT‑3 демонстрирует высокие результаты на многих датасетах NLP, включая перевод, ответы на вопросы и заполнение пропусков, а также в ряде задач, требующих логических рассуждений на лету или адаптации к предметной области (например, расшифровка анаграмм слов, использование нового слова в предложении или выполнение трехзначной арифметики. В то же время мы также выявляем некоторые наборы данных, с которыми обучение GPT‑3 по малому числу примеров пока справляется с трудом, а также датасеты, где модель сталкивается с методологическими проблемами, связанными с обучением на обширных веб-корпусах. Наконец, мы обнаруживаем, что GPT‑3 способна генерировать фрагменты новостных статей, которые оценщикам-людям трудно отличить от текстов, написанных людьми. Мы обсуждаем более широкие социальные последствия этого открытия и модели GPT‑3 в целом.
Авторы
Авторы
Полный текст статьи читайте на OpenAI
