MLE-bench

Collaborative_learning_color_v6-2_edit_1

Оценка агентов машиннного обучения в области инженерии машинного обучения

Читать статью

Мы представляем MLE-bench — бенчмарк для измерения эффективности ИИ-агентов в задачах инженерии машинного обучения. Для этого мы отобрали 75 соревнований по машинному обучению с платформы Kaggle, создав разнообразный набор сложных задач, которые проверяют реальные навыки в области ML-инженерии, такие как обучение моделей, подготовка наборов данных и проведение экспериментов. Мы установили базовые показатели эффективности людей для каждого соревнования, используя общедоступные таблица лидеров Kaggle. Используя каркасы (scaffolds) агентов с открытым исходным кодом, мы оценили несколько передовых языковых моделей на нашем бенчмарке и выяснили, что лучшая конфигурация — o1-preview от OpenAI с каркасом AIDE — достигает уровня как минимум бронзовой медали Kaggle в 16,9% соревнований. Помимо основных результатов, мы исследуем различные формы масштабирования ресурсов для ИИ-агентов и влияние утечки данных (contamination) при предварительном обучении. Мы публикуем код нашего бенчмарка в открытом доступе, чтобы способствовать дальнейшим исследованиям в области понимания возможностей ИИ-агентов в инженерии машинного обучения.

Авторы

Чан Джун Шерн, Нил Чоудхури, Оливер Джаффе, Джеймс Аунг, Дейн Шерберн, Эван Мейс, Джулио Стараче, Кевин Лю, Леон Максин, Теджал Патвардхан, Лилиан Вэнг, Александер Мадры

Полный текст статьи читайте на OpenAI