Чему нас научил турнир Parameter Golf

SEO.png?w=1600&h=900&fit=fill

Уроки от 1000+ участников, 2000+ отправленных решений и открытого соревнования по машинному обучению, в котором активно участвовали ИИ-агенты-программисты.

Мы запустили Parameter Golf, чтобы привлечь сообщество исследователей машинного обучения к решению новой, жестко ограниченной задачи и поддержать его. Мы хотели, чтобы соревнование было достаточно интересным для поощрения реального технического творчества, но при этом оставалось концептуально простым и легко проверяемым.

Участникам нужно было минимизировать потери на отложенной выборке (held-out loss) в фиксированном датасете FineWeb, уложившись в лимит артефактов в 16 МБ (включая как веса модели, так и код обучения), а также в 10-минутный бюджет на обучение на 8×H100. Мы предоставили базовое решение, набор данных и скрипты оценки, чтобы участники могли сделать форк репозитория, улучшить модель и отправить свои результаты через GitHub.

В течение восьми недель мы получили более 2000 заявок от более чем 1000 участников. Нас впечатлили технический кругозор, креативность и находчивость при обходе ограничений в представленных работах — от тонкой настройки оптимизаторов и квантования до новых идей в моделировании и обучения во время оценки (test-time training).

Одним из самых захватывающих моментов соревнования стало то, как широко участники использовали ИИ-агентов для написания кода. Агенты помогли снизить стоимость экспериментов, упростили участие для большего числа людей и изменили темп состязания. Они также создали новые задачи для проверки отправленных решений, определения авторства и подсчета баллов.

Кроме того, соревнование стало для нас ценным инструментом поиска талантов. Это была одна из целей Parameter Golf, и она подтвердила, что открытые технические задачи помогают выявить исключительный вкус к машинному обучению и настойчивость.

В этой статье мы рассказываем о некоторых решениях, которые показались нам неожиданными и интересными, а также делимся выводами об организации кодинг-конкурса в эпоху мощных ИИ-агентов.

Технические впечатления

Трек рекордов

Мы оценивали и независимо воспроизводили каждую работу из таблицы лидеров трека рекордов, а также проверяли, что каждое отправленное решение действительно устанавливало рекорд на момент подачи. Несколько тем привлекли особое внимание.

Оптимизация обучения

Некоторые из сильнейших результатов были достигнуты за счет тщательной настройки существующих компонентов.

РешениеУчастникМетодПочему это важно
#60@notapplicaОбъединил прошлые победные решения из #50, #42 и, вероятно, #39, после чего заставил работать более глубокую модель с использованием затухания весов Muon, спектральной инициализации эмбеддингов, планирования residual-mix и компилируемой оценки.Яркий пример дисциплинированной работы с таблицей лидеров: выявление работающих улучшений и их грамотное комбинирование.

Квантование

Ряд участников серьезно продвинулся в вопросах сжатия и экспорта моделей.

РешениеУчастникМетодПочему это важно
#414@signalrushИспользовал GPTQ-lite для квантования весов после обучения.Первое успешное применение GPTQ-lite в таблице лидеров, приведшее к улучшению оценки.
#1060@dexhunterОсновываясь на работе #634 от @raahilshah, успешно применил полноматричный GPTQ на основе гессиана (full Hessian GPTQ).Развил предыдущие наработки по квантованию в более эффективный метод сжатия.

Стратегии оценки и инференса

Некоторые работы стирали грань между улучшением модели и стратегией ее оценки. Эти подходы не нарушали правил, однако потребовали от нас как организаторов тщательного рассмотрения.

РешениеУчастникМетодПочему это важно
#77@samacquaИспользовал обучение LoRA во время оценки с предварительной оценкой каждого документа (score-first): сначала оценивать, адаптироваться только на уже оцененных фрагментах и сбрасывать состояние на границах документов.Раздвинул границы между улучшением модели и стратегией оценки, оставаясь при этом в рамках правил.
@abaybektursunИспользовал самогенерируемую калибровку GPTQ: генерировал калибровочный текст с помощью обученной модели, а затем строил гессианы GPTQ на основе этих активаций.Креативная стратегия калибровки, потребовавшая внимательного изучения организаторами.

Новые идеи в архитектуре и данных

В некоторых заявках были представлены особенно оригинальные идеи, касающиеся архитектуры или работы с данными.

РешениеУчастникМетодПочему это важно
#1729@romeerpПредставил токенизатор CaseOps: токены операторов без потерь регистра с учетом байтов в исходном виде (BPB sidecar accounting).Креативный подход к токенизации и представлению данных.
#265@unnirПредставил XSA — эффективный подход частичного эксклюзивного самовнимания (Exclusive Self Attention) с группированными представлениями с учетом GQA.Внедрил в соревнование эффективный вариант механизма внимания.
#65@aquariouseworkmanПредставил SmearGate и BigramHash: обучаемую смесь эмбеддингов предыдущих токенов плюс хэш-признаки пар соседних токенов.Добавил новые механизмы извлечения признаков с нуля.
#1204@msisovicПредставил мини-рекурсию по глубине: повторение 4-го и 5-го слоев, отложенную рекурсию до середины обучения и частичное разделение повторно используемых MLP.Первое принятое в таблицу лидеров решение, в котором рекуррентные слои заработали эффективно.

Мы решили выделить эти девять работ, потому что они отражают весь спектр результатов, на который мы рассчитывали при запуске соревнования. Одни участники добились успеха за счет кропотливой настройки, другие сделали упор на квантование и низкоранговые методы. Некоторые исследовали граничные правила оценки, а несколько авторов предложили принципиально новые архитектурные или датасетные идеи (как из научной литературы, так и созданные с нуля), которые принесли неожиданный прирост качества.

Нерекордный трек

В нерекордном треке было представлено множество творческих заявок. Мы отобрали 15 фаворитов, включая подходы от неавторегрессионного моделирования текста до динамической токенизации.

Поскольку этот трек носил более экспериментальный характер, мы меньше концентрировались на «сырой» производительности и больше внимания уделяли технической оригинальности подхода. Три работы выделялись особенно сильно:

  • комбинированная модель состояния пространства (SSM) и JEPA от Чиприана Флорима-Ифрима (CiprianFlorim-Ifrim),
  • решение с дизайн-вниманием/направленным вниманием (Designator/Guided Attention) от ddavidgao
  • побайтовая H-Net модель от Дариуса Фехера (DariusFeher)

Это были наши три любимые нерекордные работы, хотя по чистому уровню производительности они не обязательно занимали первые три места.

Тем не менее, конкуренция в нерекордном треке была серьезной. Половина участников в таблице лидеров этого трека превзошли наивный базовый показатель в 1.22 BPB, а лучшая работа достигла 1.12 BPB.

Мы нашли это обнадеживающим. Даже на фоне сильных базовых трансформеров альтернативные подходы порой способны успешно конкурировать с доминирующей архитектурой.

Мы также считаем, что этот трек особенно выиграл от доступности мощных ИИ-агентов. Агенты сделали создание прототипов для рискованных идей намного дешевле, включая подходы, которые раньше могли казаться слишком трудоемкими или сомнительными для проверки в рамках короткого соревнования.

Основные выводы

Главным отличием Parameter Golf от прошлых подобных соревнований стало массовое использование ИИ-агентов для написания кода. Подавляющее большинство участников упомянули, что применяли агентов в своей работе.

Это снизило порог входа. Участники могли быстрее настраивать эксперименты, изучать незнакомый код и тестировать идеи с меньшими усилиями. Спонсорская поддержка от Runpod в виде вычислительных мощностей на 1 000 000 долларов также сыграла огромную роль в том, чтобы сделать соревнование доступным для большего числа людей.

В то же время использование агентов породило новые проблемы при подаче и оценке решений. Многие заявки представляли собой небольшие модификации уже существующих лидеров, а не принципиально новые подходы. Часто это было полезно: сильные идеи быстро распространялись и дорабатывались другими. Но это также создавало лишний шум. Когда решения, выходившие за рамки правил соревнования, показывали необычайно высокие баллы, другие агенты иногда копировали эти идеи и продолжали двигаться по тому же неверному пути.

Объем поступающих работ также изменил наш подход к проведению конкурса. Мы не могли вручную проверять каждую заявку и при этом поддерживать актуальность таблицы лидеров. Во время турнира мы разработали внутреннего бота на базе Codex для первичной сортировки новых решений и пометки тех, что требовали внимания человека. Это стало особенно критично в периоды, когда мы получали сотни заявок в день.

ИИ-агенты также стали частью сообщества, сформировавшегося вокруг соревнования. Большую часть турнира участник @notapplica вместе со своим ИИ-агентом вел бюллетень «Живые обновления» (Live Updates), отслеживая ключевые события, объясняя подходы лидеров и помогая другим участникам следить за ходом состязания. Появились и инструменты для проверки силами сообщества, помогавшие менее опытным участникам убедиться, что их решения не нарушают правил, и избежать распространенных ошибок.

Что дальше?

Наша главная цель заключалась в том, чтобы запустить соревнование, в котором соответствующие требованиям участники смогли бы принять участие и на практике познакомиться с исследованиями в области машинного обучения. Parameter Golf привлек огромное количество сильных с технической точки зрения и креативных решений, а также дал нам более четкое понимание того, как могут измениться открытые исследовательские соревнования по мере того, как ИИ-агенты будут становиться все более способными и распространенными.

Мы планируем проводить больше подобных соревнований в будущем. Если вам это интересно, пожалуйста, заполните анкету участника соревнования.

Автор

OpenAI

Полный текст статьи читайте на OpenAI