PaperBench

Оценка способности ИИ воспроизводить исследования в области искусственного интеллекта.
Мы представляем PaperBench — бенчмарк для оценки способности ИИ-агентов воспроизводить передовые исследования в области искусственного интеллекта. Агентам необходимо с нуля воспроизвести 20 докладов (Spotlight и Oral) с конференции ICML 2024, включая понимание вклада авторов, разработку кодовой базы и успешное выполнение экспериментов. Для объективной оценки мы разработали критерии (рубрики), которые иерархически декомпозируют каждую задачу репликации на более мелкие подзадачи с чёткими стандартами оценивания. В общей сложности PaperBench содержит 8316 задач, поддающихся индивидуальной оценке. Критерии разрабатывались совместно с авторами каждой статьи ICML для обеспечения точности и реалистичности. Чтобы сделать оценку масштабируемой, мы также создали судью на основе языковой модели (LLM), который автоматически оценивает попытки репликации по разработанным критериям, и оценили его производительность, создав отдельный бенчмарк для судей. Мы протестировали несколько передовых моделей на базе PaperBench и выяснили, что лучший из проверенных агентов, Claude 3.5 Sonnet (New) с открытой обвязкой (scaffolding), достигает среднего балла репликации 21,0%. Наконец, мы привлекли ведущих специалистов с докторской степенью (PhD) в области машинного обучения для выполнения подмножества задач из PaperBench и обнаружили, что модели пока не превосходят базовый уровень людей. Мы открываем исходный код, чтобы способствовать дальнейшим исследованиям в области понимания инженерных возможностей ИИ-агентов.
Авторы
Полный текст статьи читайте на OpenAI
