Представляем бенчмарк SWE-Lancer

Смогут ли передовые языковые модели заработать 1 миллион долларов на реальных задачах по фриланс-разработке?
Мы представляем SWE-Lancer — бенчмарк, состоящий из более чем 1400 задач по фриланс-разработке ПО с платформы Upwork на общую сумму 1 миллион долларов США в виде реальных выплат. SWE-Lancer включает как самостоятельные инженерные задачи (от исправления багов за 50 долларов до реализации функционала за 32 000 долларов), так и управленческие задачи, в которых модели выбирают между предложениями по технической реализации. Самостоятельные задачи оцениваются с помощью сквозных тестов, трижды проверенных опытными инженерами-программистами, в то время как управленческие решения сопоставляются с выбором реальных нанятых инженерных менеджеров. Оценивая производительность моделей, мы обнаружили, что передовые модели по-прежнему не справляются с большинством задач. Для содействия дальнейшим исследованиям мы открываем исходный код единого образа Docker и общедоступной выборки для оценки — SWE-Lancer Diamond. Сопоставляя производительность моделей с их денежной ценностью, мы надеемся, что SWE-Lancer послужит стимулом для более глубоких исследований экономического влияния разработки ИИ-моделей.
Обновление от 28 июля 2025 г.: Набор данных и результаты обновлены по состоянию на 17 июля 2025 г., они доступны по адресу: https://github.com/openai/preparedness и в наших карточках систем (system cards). В обновленном наборе данных снято требование к наличию интернет-соединения во время выполнения, что устраняет один из главных источников вариативности в производительности моделей.
Авторы
Полный текст статьи читайте на OpenAI
