«Яндекс» выложил на GitHub исходный код YTsaurus Flow — технологии для непрерывной обработки больших потоков данных. Решение доступно под лицензией Apache 2.0 и работает в рамках открытой платформы YTsaurus для хранения и обработки больших данных.
YTsaurus Flow обрабатывает клики, лайки и другие события в интернете по мере их появления. Как рассказали в компании, это помогает алгоритмам быстрее замечать изменения интересов пользователей, точнее рекомендовать товары, книги и фильмы, а также распознавать действия мошенников. Обычно такие данные накапливают и обрабатывают с задержкой до нескольких часов.
С помощью технологии можно готовить данные для обучения ML-моделей, обновлять информацию для сайтов и приложений, считать просмотры, клики и заказы. По заявлению компании, решение рассчитано на высокую нагрузку и обрабатывает каждое событие ровно один раз — без потерь и дублирования данных.
В «Яндекс Маркете» YTsaurus Flow уже помогает быстрее собирать статистику, в антифроде — выявлять злоумышленников, а в «Рекламе» — подбирать интересные пользователям предложения.
Источник: vc.ru