PaperBench

Paperbench_Hero.png?w=1600&h=900&fit=fil

Оценка способности ИИ воспроизводить исследования в области искусственного интеллекта.

Читать статьюПосмотреть код

Мы представляем PaperBench — бенчмарк для оценки способности ИИ-агентов воспроизводить передовые исследования в области искусственного интеллекта. Агентам необходимо с нуля воспроизвести 20 докладов (Spotlight и Oral) с конференции ICML 2024, включая понимание вклада авторов, разработку кодовой базы и успешное выполнение экспериментов. Для объективной оценки мы разработали критерии (рубрики), которые иерархически декомпозируют каждую задачу репликации на более мелкие подзадачи с чёткими стандартами оценивания. В общей сложности PaperBench содержит 8316 задач, поддающихся индивидуальной оценке. Критерии разрабатывались совместно с авторами каждой статьи ICML для обеспечения точности и реалистичности. Чтобы сделать оценку масштабируемой, мы также создали судью на основе языковой модели (LLM), который автоматически оценивает попытки репликации по разработанным критериям, и оценили его производительность, создав отдельный бенчмарк для судей. Мы протестировали несколько передовых моделей на базе PaperBench и выяснили, что лучший из проверенных агентов, Claude 3.5 Sonnet (New) с открытой обвязкой (scaffolding), достигает среднего балла репликации 21,0%. Наконец, мы привлекли ведущих специалистов с докторской степенью (PhD) в области машинного обучения для выполнения подмножества задач из PaperBench и обнаружили, что модели пока не превосходят базовый уровень людей. Мы открываем исходный код, чтобы способствовать дальнейшим исследованиям в области понимания инженерных возможностей ИИ-агентов.

Авторы

Джулио Стараче (Giulio Starace), Оливер Джаффе (Oliver Jaffe), Дейн Шерберн (Dane Sherburn), Джеймс Онг (James Aung), Чан Джун Шерн (Chan Jun Shern), Леон Максин (Leon Maksin), Рэйчел Диас (Rachel Dias), Эван Мейс (Evan Mays), Бенджамин Кинселла (Benjamin Kinsella), Уайатт Томпсон (Wyatt Thompson), Йоханнес Хайдеке (Johannes Heidecke), Миа Глайзе (Mia Glaese), Техал Патвардхан (Tejal Patwardhan), OpenAI

Полный текст статьи читайте на OpenAI