Законы масштабирования для нейросетевых языковых моделей

Читать статью
Scaling Laws For Neural Language Models

Аннотация

Мы исследуем эмпирические законы масштабирования для производительности языковых моделей на основе кросс-энтропийных потерь. Значение потерь подчиняется степенному закону в зависимости от размера модели, размера набора данных и объема вычислительных ресурсов, используемых для обучения, причем некоторые тенденции охватывают более семи порядков. Другие детали архитектуры, такие как ширина или глубина сети, оказывают минимальное влияние в широком диапазоне. Простые уравнения определяют зависимость переобучения от размера модели/набора данных и зависимость скорости обучения от размера модели. Эти соотношения позволяют нам определить оптимальное распределение фиксированного бюджета вычислений. Более крупные модели значительно эффективнее используют выборку, так что оптимальное с точки зрения вычислений обучение предполагает тренировку очень больших моделей на относительно скромном объеме данных и остановку задолго до сходимости.

Авторы

Джаред Каплан (Jared Kaplan), Сэм МакКэндлиш (Sam McCandlish), Том Хениган (Tom Henighan), Том Браун (Tom Brown), Бенджамин Чесс (Benjamin Chess), Ревон Чайлд (Rewon Child), Скотт Грей (Scott Gray), Алек Радфорд (Alec Radford), Джеффри Ву (Jeffrey Wu), Дарио Амодей (Dario Amodei)

Полный текст статьи читайте на OpenAI