Эффективное обучение языковых моделей заполнению пропусков в тексте

Читать статью
Efficient Training Of Language Models To Fill In The Middle

Аннотация

Мы показываем, что авторегрессионные языковые модели могут научиться заполнять пропуски в тексте после применения простой трансформации к набору данных, которая заключается в перемещении фрагмента текста из середины документа в его конец. Хотя эта аугментация данных привлекла большой интерес в последние годы, мы предоставляем обширные доказательства того, что обучение моделей с большой долей данных, преобразованных таким образом, не ухудшает исходную способность генерации слева направо, судя по перплексии и оценкам выборки в широком диапазоне масштабов. Учитывая полезность, простоту и эффективность обучения моделей заполнению пропусков (Fill-in-the-Middle, FIM), мы предлагаем по умолчанию обучать будущие авторегрессионные языковые модели с использованием FIM. Для этого мы проводим серию экспериментов по абляции ключевых гиперпараметров, таких как частота преобразования данных, структура преобразования и метод выбора заполняемого фрагмента. Мы используем эти результаты для формирования надежных настроек по умолчанию и передовых практик обучения моделей FIM. Мы выпустили нашу лучшую модель заполнения пропусков, обученную по лучшим практикам, в нашем API, а также опубликовали наши бенчмарки заполнения для поддержки дальнейших исследований.

Авторы

Мохаммад Бавариан, Хиву Джун, Николас Тезак, Джон Шульман, Кристин МакЛиви Пейн, Джерри Трорек, Марк Чен

Полный текст статьи читайте на OpenAI