Оценка больших языковых моделей, обученных на программном коде

Обновление от 16 мая 2025 г.: Мы выпустили Codex — облачного агента для разработки программного обеспечения, способного параллельно выполнять множество задач. Узнать больше.
Аннотация
Мы представляем Codex — языковую модель GPT, дообученную на общедоступном коде из GitHub, и исследуем ее возможности по написанию кода на Python. Отдельная рабочая версия Codex лежит в основе GitHub Copilot. В HumanEval, новом наборе тестов, который мы выпускаем для измерения функциональной корректности при синтезе программ по строкам документации (docstrings), наша модель успешно справляется с 28,8% задач, в то время как GPT‑3 справляется с 0%, а GPT‑J — с 11,4%. Кроме того, мы обнаружили, что многократная выборка из модели является удивительно эффективной стратегией для создания работающих решений сложных запросов. Используя этот метод, мы решаем 70,2% наших задач при 100 вариантах выборки на задачу. Тщательное исследование нашей модели выявляет ее ограничения, в том числе трудности со строками документации, описывающими длинные цепочки операций, а также с привязкой операций к переменным. Наконец, мы обсуждаем потенциальные более широкие последствия развертывания мощных технологий генерации кода, затрагивая вопросы безопасности, защиты и экономики.
Авторы
Авторы
Авторы
Авторы
Полный текст статьи читайте на OpenAI
