Эффективное обучение языковых моделей заполнению пропусков в тексте

Аннотация
Мы показываем, что авторегрессионные языковые модели могут научиться заполнять пропуски в тексте после применения простой трансформации к набору данных, которая заключается в перемещении фрагмента текста из середины документа в его конец. Хотя эта аугментация данных привлекла большой интерес в последние годы, мы предоставляем обширные доказательства того, что обучение моделей с большой долей данных, преобразованных таким образом, не ухудшает исходную способность генерации слева направо, судя по перплексии и оценкам выборки в широком диапазоне масштабов. Учитывая полезность, простоту и эффективность обучения моделей заполнению пропусков (Fill-in-the-Middle, FIM), мы предлагаем по умолчанию обучать будущие авторегрессионные языковые модели с использованием FIM. Для этого мы проводим серию экспериментов по абляции ключевых гиперпараметров, таких как частота преобразования данных, структура преобразования и метод выбора заполняемого фрагмента. Мы используем эти результаты для формирования надежных настроек по умолчанию и передовых практик обучения моделей FIM. Мы выпустили нашу лучшую модель заполнения пропусков, обученную по лучшим практикам, в нашем API, а также опубликовали наши бенчмарки заполнения для поддержки дальнейших исследований.
Авторы
Полный текст статьи читайте на OpenAI
