Новая усовершенствованная модель эмбеддингов

Новая модель, text-embedding-ada-002, заменяет пять отдельных моделей для поиска текста, поиска сходства текста и поиска кода. Она превосходит нашу предыдущую наиболее мощную модель Davinci в большинстве задач, при этом ее стоимость на 99,8% ниже.
Эмбеддинги — это числовые представления понятий, преобразованные в последовательности чисел, которые позволяют компьютерам легко понимать взаимосвязи между этими понятиями. С момента первоначального запускa эндпоинта OpenAI /embeddings многие приложения внедрили эмбеддинги для персонализации, рекомендаций и поиска контента.
Вы можете отправлять запросы к эндпоинту /embeddings для новой модели всего в две строки кода, используя нашу библиотеку OpenAI для Python, точно так же, как вы делали это с предыдущими моделями:
import openai
response = openai.Embedding.create(
input="porcine pals say",
model="text-embedding-ada-002"
)Усовершенствования модели
Более высокая производительность. text-embedding-ada-002 превосходит все старые модели эмбеддингов в задачах поиска текста, поиска кода и определения сходства предложений, а также показывает сопоставимые результаты в классификации текста. Для каждой категории задач мы оцениваем модели на наборах данных, использовавшихся в старых эмбеддингах.
Унификация возможностей. Мы значительно упростили интерфейс эндпоинта /embeddings, объединив пять упомянутых выше отдельных моделей (text-similarity, text-search-query, text-search-doc, code-search-text и code-search-code) в единую новую модель. Это единственное представление работает лучше наших предыдущих моделей эмбеддингов на различных бенчмарках поиска текста, сходства предложений и поиска кода.
Увеличенный контекст. Длина контекста новой модели увеличилась в четыре раза — с 2048 до 8192 токенов, что делает работу с длинными документами более удобной.
Меньший размер эмбеддингов. Новые эмбеддинги имеют размер всего 1536 измерений — это одна восьмая от размера эмбеддингов davinci-001, что делает их более экономичными при работе с векторными базами данных.
Сниженная цена. Мы снизили стоимость новых моделей эмбеддингов на 90% по сравнению со старыми моделями аналогичного размера. Новая модель обеспечивает лучшую или сопоставимую производительность по сравнению со старыми моделями Davinci при цене на 99,8% ниже.
В целом, новая модель эмбеддингов представляет собой гораздо более мощный инструмент для задач обработки естественного языка и работы с кодом. Мы с нетерпением ждем возможности увидеть, как наши клиенты будут использовать ее для создания еще более совершенных приложений в своих областях.
Ограничения
Новая модель text-embedding-ada-002 не превосходит text-similarity-davinci-001 на бенчмарке линейной классификации SentEval. Для задач, требующих обучения легковесного линейного слоя поверх векторов эмбеддингов для прогнозирования классификации, мы рекомендуем сравнить новую модель с text-similarity-davinci-001 и выбрать ту, которая обеспечивает оптимальную производительность.
Ознакомьтесь с разделом Ограничения и риски в документации по эмбеддингам, чтобы узнать об общих ограничениях наших моделей эмбеддингов.
Примеры использования API эмбеддингов на практике
Kalendar AI — это продукт для поиска клиентов, который использует эмбеддинги для подбора наиболее подходящего коммерческого предложения для каждого клиента из базы данных, содержащей 340 млн профилей. Эта автоматизация опирается на сходство между эмбеддингами профилей клиентов и торговых предложений для ранжирования наиболее подходящих вариантов, что позволяет сократить количество нежелательного таргетинга на 40–56% по сравнению со старым подходом.
Notion, компания-разработчик онлайн-пространств для работы, будет использовать новые эмбеддинги от OpenAI для улучшения поиска в Notion, выведя его за рамки существующих систем сопоставления ключевых слов.
- Читать документацию
Авторы
Полный текст статьи читайте на OpenAI
