Как перейти от batch к streaming на примере рекламной контент-системы
25 ноября, 11:10, «h3: Яндекс трек»
Мнение Программного комитета о докладе
Рекламная система Яндекса — крупнейшая в Рунете по выручке, количеству объявлений, количеству северов; огромная по нагрузке и очень сложная. Быстрая доставка миллионов объявлений в рекламный движок — интересная инженерная задача, напрямую влияющая на деньги.
Целевая аудитория
Данный доклад будет интересен всем, кто занимается сбором и доставкой данных до рантайма рекомендательных систем, где при этом важна свежесть данных.
Тезисы
Ключевая задача рекламной контент-системы — собрать и подготовить все данные, необходимые для отбора и ранжирования баннеров на хите, в том числе про пользователя, баннер и площадку.
В своем докладе я расскажу про наш переход из batch в streaming. Предпосылками для перехода были следующие факты: * Быстрый учет изменений и событий продуктово важен. В том числе виден на экспериментах в ключевых метриках (отдельные ускорения могут давать до нескольких процентов денег/конверсий). * Дальнейшее ускорение требовало экспоненциального роста потребляемого CPU (десятки тысяч ядер), либо упиралось в ограничения MapReduce-модели. * Сложность поддержки большого количества железных машин (~1000 хостов) и самописных систем синхронизации Сегодня наша контент-система обрабатывает миллионы событий и изменений в секунду, а суммарный размер стейтов со всеми репликами занимает несколько петабайт.
В докладе я расскажу о получившейся архитектуре обработки и хранения данных, какие проблемы нам пришлось решить в процессе.
Спикеры

Яндекс
Другие доклады секции

Скала^р

Postgres Professional

STM Labs

Yandex Cloud

Yandex Cloud

VK Tech, Tarantool

ВНИИЖТ

Tarantool, VK

Yandex Cloud









