Законы масштабирования для нейросетевых языковых моделей

Аннотация
Мы исследуем эмпирические законы масштабирования для производительности языковых моделей на основе кросс-энтропийных потерь. Значение потерь подчиняется степенному закону в зависимости от размера модели, размера набора данных и объема вычислительных ресурсов, используемых для обучения, причем некоторые тенденции охватывают более семи порядков. Другие детали архитектуры, такие как ширина или глубина сети, оказывают минимальное влияние в широком диапазоне. Простые уравнения определяют зависимость переобучения от размера модели/набора данных и зависимость скорости обучения от размера модели. Эти соотношения позволяют нам определить оптимальное распределение фиксированного бюджета вычислений. Более крупные модели значительно эффективнее используют выборку, так что оптимальное с точки зрения вычислений обучение предполагает тренировку очень больших моделей на относительно скромном объеме данных и остановку задолго до сходимости.
Авторы
Полный текст статьи читайте на OpenAI
