Темы



Google представила EmbeddingGemma 2 — открытую мультимодальную модель эмбеддингов для устройств

Коротко сгенерировано ИИ по тексту статьи
  • Google выпустила открытую модель на 740 млн параметров: она объединяет текст, код, изображения, аудио и видео в пространстве размерностью 768.
  • На Pixel 11 Pro обработка текста требует около 191 МБ памяти, а всех пяти типов данных — примерно 567 МБ; модель обрабатывает до 8 192 токенов.
  • EmbeddingGemma 2 распространяется по лицензии Apache 2.0, поддерживает более 100 языков, но не проходила настройку безопасности; Google предупреждает о разной производительности по языкам.

Почему это важно: Локальная обработка позволяет выполнять поиск без подключения к сети и не отправлять данные за пределы устройства.

Google выпустила EmbeddingGemma 2 — открытую модель с 740 миллионами параметров, которая объединяет текст, код, изображения, аудио и видео в общем пространстве и полностью работает на телефоне или небольшой плате. Модель распространяется по лицензии Apache 2.0, не проходила настройку безопасности, а Google предупреждает, что её производительность неодинакова для всех 100 поддерживаемых языков.

Google выпустила открытую модель, которая ищет по тексту, коду, изображениям, аудио и видео и работает на телефоне. Для обработки текста на Pixel 11 Pro ей требуется около 191 МБ памяти, а для всех пяти типов данных — примерно 567 МБ. Ничего не нужно отправлять за пределы устройства.

EmbeddingGemma 2 преобразует всё это в единое пространство размерностью 768, сообщила Google в блоге. В модели 740 миллионов параметров: для работы только с текстом нужны 270 миллионов, а кодировщик изображений на 170 миллионов и аудиокодировщик на 300 миллионов загружаются лишь при необходимости. Лицензия — Apache 2.0.

Модель эмбеддингов преобразует содержимое в числа, чтобы программа могла находить материалы по смыслу, а не по совпадению слов.

Обычно этот этап происходит в чужом облаке.

В апреле мы сообщали, что вышла Gemma 4 — четыре модели с открытыми весами по той же лицензии, работающие на телефонах, платах Raspberry Pi и потребительских видеокартах. EmbeddingGemma 2 построена на этой архитектуре и использует тот же токенизатор текста и аудиокодировщик, поэтому обе модели вместе занимают меньше памяти.

На практике это позволяет выстроить конвейер поиска без подключения к сети.

В августе Google приводила тот же аргумент, создав автономный переводчик на Raspberry Pi за 80 долларов для обработки конфиденциальных разговоров без отправки аудио куда-либо. Хранение данных на устройстве исключает их передачу — именно с неё обычно начинаются вопросы о защите данных в Европе.

Компания делает это не из альтруизма. Она формирует решение по умолчанию.

По данным Google, семейство Gemma скачали более миллиарда раз, причём на первую EmbeddingGemma пришлось 20 миллионов загрузок. Новая модель обрабатывает 8 192 токена во всех модальностях — вчетверо больше первой версии. Это соответствует 29 изображениям, 58 кадрам видео или пяти с половиной минутам аудио.

Размерность векторов можно уменьшить с 768 до 128, что, по словам Google, сокращает объём хранилища до шести раз.

У модели есть ограничения, и Google их перечисляет. Она не проходила настройку безопасности и модерацию выходных данных: меры по снижению рисков применялись к обучающим данным. Модель поддерживает более 100 языков, но Google предупреждает, что её производительность может различаться.

В ЕС 24 официальных языка.

Это как раз та возможность, которую Европа, по её словам, хочет сохранить у себя: она работает на оборудовании, уже принадлежащем европейским компаниям, распространяется по лицензии, доступной всем, и при этом создана в Маунтин-Вью.

©  TheNextWeb.ru

Об этом также пишут