Векторные представления текста и кода с помощью контрастивного предварительного обучения

Читать статьюЧитать блог
Text And Code Embeddings By Contrastive Pre Training

Аннотация

Текстовые эмбеддинги являются полезными признаками во многих приложениях, таких как семантический поиск и вычисление текстового сходства. В предыдущих работах обычно обучались модели, настроенные под конкретные сценарии использования и различающиеся выбором набора данных, целью обучения и архитектурой модели. В данной работе мы показываем, что контрастивное предварительное обучение на неразмеченных данных в большом масштабе приводит к высококачественным векторным представлениям текста и кода. Те же неразмеченные текстовые эмбеддинги, которые достигают новых рекордных результатов в линейной классификации по методу зондирования (linear-probe classification), также демонстрируют впечатляющие возможности семантического поиска и иногда даже конкурируют по производительности с дообученными моделями. По точности линейной классификации в среднем по 7 задачам наша лучшая неразмеченная модель демонстрирует относительное улучшение на 4% и 1,8% по сравнению с предыдущими лучшими неразмеченными и контролируемыми моделями текстовых эмбеддингов соответственно. При оценке на крупномасштабном семантическом поиске те же текстовые эмбеддинги показывают относительное улучшение на 23,4%, 14,7% и 10,6% по сравнению с предыдущими лучшими неразмеченными методами на бенчмарках MSMARCO, Natural Questions и TriviaQA соответственно. Аналогично текстовым эмбеддингам, мы обучаем модели эмбеддингов кода на парах (текст, код), получая относительное улучшение на 20,8% по сравнению с предыдущими лучшими результатами в поиске кода.

Авторы

Arvind Neelakantan, Tao Xu, Raul Puri, Alec Radford, Jesse Michael Han, Jerry Tworek, Qiming Yuan, Nikolas Tezak, Jong Wook Kim, Chris Hallacy, Johannes Heidecke, Pranav Shyam, Boris Power, Tyna Eloundou, Girish Sastry, Gretchen Krueger, David Schnurr, Felipe Petroski Such, Kenny Hsu, Madeleine Thompson, Tabarak Khan, Toki Sherbakov, Joanne Jang, Peter Welinder, Lilian Weng

Полный текст статьи читайте на OpenAI