Оценка больших языковых моделей, обученных на программном коде

Читать статьюЧитать блог
Evaluating Large Language Models Trained On Code

Обновление от 16 мая 2025 г.: Мы выпустили Codex — облачного агента для разработки программного обеспечения, способного параллельно выполнять множество задач. Узнать больше.

Аннотация

Мы представляем Codex — языковую модель GPT, дообученную на общедоступном коде из GitHub, и исследуем ее возможности по написанию кода на Python. Отдельная рабочая версия Codex лежит в основе GitHub Copilot. В HumanEval, новом наборе тестов, который мы выпускаем для измерения функциональной корректности при синтезе программ по строкам документации (docstrings), наша модель успешно справляется с 28,8% задач, в то время как GPT‑3 справляется с 0%, а GPT‑J — с 11,4%. Кроме того, мы обнаружили, что многократная выборка из модели является удивительно эффективной стратегией для создания работающих решений сложных запросов. Используя этот метод, мы решаем 70,2% наших задач при 100 вариантах выборки на задачу. Тщательное исследование нашей модели выявляет ее ограничения, в том числе трудности со строками документации, описывающими длинные цепочки операций, а также с привязкой операций к переменным. Наконец, мы обсуждаем потенциальные более широкие последствия развертывания мощных технологий генерации кода, затрагивая вопросы безопасности, защиты и экономики.

Авторы

Mark Chen, Jerry Tworek, Heewoo Jun, Qiming Yuan, Henrique Pondé, Jared Kaplan, Harri Edwards, Yura Burda, Nicholas Joseph, Greg Brockman, Alex Ray, Raul Puri, Gretchen Krueger, Michael Petrov, Heidy Khlaaf

Авторы

Girish Sastry, Pamela Mishkin, Brooke Chan, Scott Gray, Nick Ryder, Mikhail Pavlov, Alethea Power, Lukasz Kaiser, Mohammad Bavarian, Clemens Winter, Philippe Tillet, Felipe Petroski Such, Dave Cummings, Matthias Plappert, Fotios Chantzis

Авторы

Elizabeth Barnes, Ariel Herbert-Voss, William Guss, Alex Nichol, Alex Paino, Nikolas Tezak, Jie Tang, Igor Babuschkin, Suchir Balaji, Shantanu Jain, William Saunders, Christopher Hesse, Andrew N. Carr, Jan Leike, Joshua Achiam

Авторы

Vedant Misra, Evan Morikawa, Alec Radford, Matthew Knight, Miles Brundage, Mira Murati, Katie Mayer, Peter Welinder, Bob McGrew, Dario Amodei, Sam McCandlish, Ilya Sutskever, Wojciech Zaremba

Полный текст статьи читайте на OpenAI