Векторные представления текста и кода с помощью контрастивного предварительного обучения

Аннотация
Текстовые эмбеддинги являются полезными признаками во многих приложениях, таких как семантический поиск и вычисление текстового сходства. В предыдущих работах обычно обучались модели, настроенные под конкретные сценарии использования и различающиеся выбором набора данных, целью обучения и архитектурой модели. В данной работе мы показываем, что контрастивное предварительное обучение на неразмеченных данных в большом масштабе приводит к высококачественным векторным представлениям текста и кода. Те же неразмеченные текстовые эмбеддинги, которые достигают новых рекордных результатов в линейной классификации по методу зондирования (linear-probe classification), также демонстрируют впечатляющие возможности семантического поиска и иногда даже конкурируют по производительности с дообученными моделями. По точности линейной классификации в среднем по 7 задачам наша лучшая неразмеченная модель демонстрирует относительное улучшение на 4% и 1,8% по сравнению с предыдущими лучшими неразмеченными и контролируемыми моделями текстовых эмбеддингов соответственно. При оценке на крупномасштабном семантическом поиске те же текстовые эмбеддинги показывают относительное улучшение на 23,4%, 14,7% и 10,6% по сравнению с предыдущими лучшими неразмеченными методами на бенчмарках MSMARCO, Natural Questions и TriviaQA соответственно. Аналогично текстовым эмбеддингам, мы обучаем модели эмбеддингов кода на парах (текст, код), получая относительное улучшение на 20,8% по сравнению с предыдущими лучшими результатами в поиске кода.
Авторы
Полный текст статьи читайте на OpenAI
