
Яндекс представил в открытом доступе YTsaurus Flow – технологию непрерывной обработки больших потоков данных. Решение позволяет анализировать клики, заказы, просмотры, лайки и другие события сразу после их появления, без длительного накопления информации перед обработкой.
Технология создана для задач, где критична актуальность данных. В частности, она может использоваться в рекомендательных и рекламных системах, антифрод-сервисах, аналитике продаж, а также при подготовке данных для обучения ML-моделей. За счет обработки событий в реальном времени алгоритмы могут быстрее учитывать смену пользовательских интересов и изменения спроса.
Традиционно большие массивы данных обрабатываются пакетно: события сначала накапливаются, а затем передаются в систему. Это может приводить к задержкам продолжительностью в несколько часов. YTsaurus Flow сокращает этот интервал практически до нуля, обрабатывая поток данных по мере его поступления.
Решение уже используется в сервисах Яндекса. Например, на Маркете технология помогает оперативнее формировать статистику для продавцов, антифрод-системам – выявлять действия злоумышленников, а рекламным продуктам – быстрее обновлять данные для подбора предложений. По данным компании, ранее подготовка информации для дообучения отдельных рекламных моделей занимала более 10 часов. После внедрения YTsaurus Flow эту задержку удалось практически устранить.
YTsaurus Flow входит в экосистему YTsaurus – открытой платформы Яндекса для хранения и обработки больших объемов данных. Новое решение дает компаниям возможность объединять в одной системе накопленные массивы и свежие потоковые данные, переходя от пакетной обработки к непрерывной.
Разработка создана командами Yandex Infrastructure и Яндекс Рекламы. YTsaurus Flow опубликована под лицензией Apache 2.0, поэтому ее можно использовать в том числе в коммерческих проектах.
Напомним, ранее Яндекс представил ИИ-модель Sona для персональных рекомендаций.
Источник: пресс-релиз Яндекса