Яндекс поделился технологией непрерывной обработки данных: она помогает быстрее учитывать смену интересов пользователей
- Яндекс открыл YTsaurus Flow под лицензией Apache 2.0: технология обрабатывает события по мере поступления, без потерь и дублей.
- В Яндекс Рекламе она обрабатывает более 100 ГБ данных и миллионы событий в секунду; подготовка данных для некоторых моделей раньше занимала более 10 часов.
- YTsaurus Flow применяют в Маркете, антифрод-системах и Рекламе; технология также подходит для подготовки данных ML-моделей и обновления сайтов и приложений.
Почему это важно: Свежие данные помогают быстрее учитывать смену интересов и спроса, обнаруживать мошенничество и подбирать рекламу.
Яндекс выложил в опенсорс YTsaurus Flow — технологию для непрерывной обработки больших потоков данных. Она обрабатывает клики, лайки и другие события в интернете сразу же — по мере их появления. Благодаря этому алгоритмы быстрее замечают, как изменились интересы пользователей и что происходит в сети. Это позволяет мгновенно распознавать действия мошенников, точнее рекомендовать товары, книги, фильмы и так далее и подбирать рекламу, которая действительно полезна.
Интересы и потребности пользователей всё время меняются. Человек может искать билет на самолёт, а потом переключиться на новый фильм или товары для дома. Чтобы алгоритмы уловили эту смену интересов, им нужны свежие данные о действиях пользователя — что он покупал, какую музыку слушал, о чем спрашивал. Однако эти данные обычно обрабатывают не сразу, а сначала накапливают — примерно как посылки для отправки поездом. Из-за этого информация поступает в систему с задержкой, которая может составлять часы. YTsaurus Flow сводит эту задержку практически к нулю, поскольку обрабатывает данные в реальном времени — по мере поступления.
Технология будет полезна в самых разных проектах, где важна свежесть информации, — не только в рекламных и рекомендательных сервисах. Например, с её помощью можно готовить данные для обучения ML-моделей, обновлять информацию для сайтов и приложений, считать просмотры, клики и заказы. Технология рассчитана на высокую нагрузку и обрабатывает каждое событие ровно один раз, не теряя и не дублируя данные. Она продолжает работать даже в случае сбоев, перераспределяя нагрузку между доступными серверами.
YTsaurus Flow уже применяется во многих сервисах Яндекса. Например, Маркету она помогает быстрее собирать статистику, чтобы продавцы могли оперативно реагировать на изменение спроса, антифрод-системам — обнаруживать действия злоумышленников, а Рекламе — подбирать интересные людям предложения. Так, раньше на подготовку данных для дообучения некоторых моделей, отвечающих за подбор рекламы, уходило больше 10 часов. С помощью YTsaurus Flow эту задержку удалось почти полностью устранить. Каждую секунду YTsaurus Flow обрабатывает в Яндекс Рекламе более 100 ГБ данных и миллионы событий в интернете: кликов, показов, лайков, заказов и так далее.
Технология работает в рамках YTsaurus — это открытая платформа Яндекса для хранения и обработки больших объёмов данных, предназначенная для крупного бизнеса. Благодаря YTsaurus Flow компании смогут обрабатывать данные не только партиями, но и по мере поступления. Кроме того, у них будет возможность учитывать накопленную и свежую информацию в одной системе.
YTsaurus Flow — это совместная разработка команд Yandex Infrastructure и Яндекс Рекламы. Технология доступна под лицензией Apache 2.0, что позволяет использовать её в том числе в коммерческих проектах.
Пресс-служба компании «Яндекс»
Татьяна Репина
Тел.: +7 495 739–70–00
Электронная почта: pr@yandex-team.ru
Источник: Яндекс
