Глубокий двойной спуск

Мы показываем, что феномен двойногоспусканаблюдается в сверточных нейросетях (CNN), ResNet и трансформерах: производительность сначала улучшается, затем ухудшается и снова улучшается по мере увеличения размера модели, объема данных или времени обучения. Этот эффект часто удается избежать с помощью аккуратной регуляризации. Хотя такое поведение кажется довольно универсальным, мы пока не до конца понимаем причины его возникновения и считаем дальнейшее изучение этого феномена важным направлением исследований.

Многие классы современных моделей глубокого обучения, включая CNN, ResNet и трансформеры, демонстрируют ранее описанный феномендвойногоспуска при отказе от ранней остановки (early stopping) или регуляризации. Пик предсказуемо возникает в «критическом режиме», когда модели едва способны подогнать обучающую выборку. По мере увеличения числа параметров в нейронной сети ошибка на тестовых данных сначала уменьшается, затем увеличивается и, ровно в тот момент, когда модель обретает способность подстраиваться под обучающую выборку, переживает второй спуск.
Не подтверждается ни традиционное мнение классических статистиков о том, что слишком большие модели хуже, ни современная парадигма машинного обучения, утверждающая, что чем больше модель, тем лучше. Мы обнаруживаем, что двойной спуск также наблюдается в разрезе эпох обучения. Удивительно, но мы показываем, что эти феномены могут приводить к режиму, при котором избыток данных вредит, и обучение глубокой сети на более крупной обучающей выборке фактически ухудшает результат.
Двойной спуск в зависимости от размера модели
1. Существует режим, в котором большие модели работают хуже.
Феномен двойного спуска по размеру модели может приводить к режиму, при котором обучение на большем объеме данных вредит. На графике выше пик ошибки на тестовой выборке возникает около порога интерполяции — когда модели лишь едва достаточны по размеру для подгонки под обучающую выборку.
Во всех наблюдавшихся нами случаях изменения, влияющие на порог интерполяции (такие как смена алгоритма оптимизации, количества обучающих примеров или уровня шума в метках), аналогичным образом влияют и на положение пика тестовой ошибки. Феномен двойного спуска наиболее ярко проявляется в условиях зашумленности меток; без нее пик оказывается меньше, и его легко пропустить. Добавление шума в метки усиливает это общее поведение и позволяет с легкостью его исследовать.
Монотонность, зависящая от объема выборки
2. Существует режим, в котором большее количество примеров вредит.
На графике выше представлены трансформеры, обученные на задаче машинного перевода без добавления шума в метки. Как и ожидалось, увеличение количества примеров смещает кривую вниз в сторону меньшей ошибки на тесте. Однако, поскольку для подгонки большего числа примеров требуются более крупные модели, увеличение объема выборки также сдвигает порог интерполяции (и пик тестовой ошибки) вправо.
Для моделей промежуточных размеров (красные стрелки) эти два эффекта объединяются, и мы видим, что обучение на выборке, превышающей исходную в 4.5 раза, на самом деле ухудшает тестовые показатели.
Двойной спуск по эпохам
3. Существует режим, в котором более продолжительное обучение обращает переобучение вспять.


На графиках выше представлены ошибки на тесте и обучении в зависимости как от размера модели, так и от количества шагов оптимизации. Для фиксированного числа шагов оптимизации (заданная координата y) ошибки на тесте и обучении демонстрируют двойной спуск по размеру модели. Для фиксированного размера модели (заданная координата x) по мере продолжения обучения ошибка на тесте и обучении уменьшается, увеличивается и снова уменьшается; этот феномен мы называем двойным спуском по эпохам.
Как правило, пик тестовой ошибки возникает закономерно в те моменты, когда модели лишь едва способны подогнать обучающую выборку.
Наша интуиция подсказывает, что для моделей, находящихся на пороге интерполяции, существует ровно одна модель, которая подгоняется под обучающие данные, и принудительное ее согласование даже с незначительно зашумленными или неверно специфицированными метками разрушит ее глобальную структуру. Иными словами, не существует «хороших моделей», которые одновременно интерполируют обучающую выборку и хорошо показывают себя на тесте. Тем не менее, в перепараметризованном режиме есть множество моделей, подгоняемых под обучающую выборку, и такие хорошие модели действительно существуют. Более того, неявная смещенность стохастического градиентного спуска (SGD) приводит алгоритм именно к таким хорошим моделям по причинам, которые нам пока не ясны.
Полное понимание механизмов, лежащих в основе двойного спуска в глубоких нейронных сетях, мы оставляем в качестве важной открытой задачи.
Авторы
Благодарности
Спасибо Михаилу Белкину и Крису Олаху за полезные обсуждения и отзывы на протяжении всей работы. Расширенную версию этой записи также можно найти в блоге Боаза Барака Windows on Theory.
Полный текст статьи читайте на OpenAI
