MLE-bench

Оценка агентов машиннного обучения в области инженерии машинного обучения
Мы представляем MLE-bench — бенчмарк для измерения эффективности ИИ-агентов в задачах инженерии машинного обучения. Для этого мы отобрали 75 соревнований по машинному обучению с платформы Kaggle, создав разнообразный набор сложных задач, которые проверяют реальные навыки в области ML-инженерии, такие как обучение моделей, подготовка наборов данных и проведение экспериментов. Мы установили базовые показатели эффективности людей для каждого соревнования, используя общедоступные таблица лидеров Kaggle. Используя каркасы (scaffolds) агентов с открытым исходным кодом, мы оценили несколько передовых языковых моделей на нашем бенчмарке и выяснили, что лучшая конфигурация — o1-preview от OpenAI с каркасом AIDE — достигает уровня как минимум бронзовой медали Kaggle в 16,9% соревнований. Помимо основных результатов, мы исследуем различные формы масштабирования ресурсов для ИИ-агентов и влияние утечки данных (contamination) при предварительном обучении. Мы публикуем код нашего бенчмарка в открытом доступе, чтобы способствовать дальнейшим исследованиям в области понимания возможностей ИИ-агентов в инженерии машинного обучения.
Авторы
Полный текст статьи читайте на OpenAI
