Data Meetup VK Tech #1: платформы данных
18 августа 2026 г. в Москве пройдет «Data Meetup VK Tech #1: платформы данных».
В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage. На митапе будет хороший практический кейс Авито именно про это.
Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.
Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.
Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.
Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.
После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.
После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.
Офлайн-участие — по регистрации и подтверждению организатора. Для онлайн-подключения достаточно регистрации.
Москва, Офис VK, БЦ «SkyLight», Ленинградский пр-т, 39 +онлайнДата проведения: 18.08.2026. Начало в 17:30
Место проведения: Москва, Офис VK, БЦ «SkyLight», Ленинградский пр-т, 39 +онлайн
- Анонс
- Программа
- Участники
- Спикеры
18 августа 2026 г. в Москве пройдет «Data Meetup VK Tech #1: платформы данных».
В Lakehouse можно сколько угодно ускорять compute, но если S3 не успевает отдавать данные, вся платформа упрётся в storage. На митапе будет хороший практический кейс Авито именно про это.
Их аналитическая платформа работает на Trino и Vertica поверх Hive-каталогов, данные хранятся в S3 на HDD. Один S3 кластер упёрся в предел масштабирования и 20 ГБайт/с на чтение.
Тогда команда взяла три кластера S3, стала распределять объекты каждой таблицы по хешу пути и использовала уже существующие HAProxy-сайдкары на compute-нодах как stateless-шардирующий прокси. В результате пиковую скорость чтения увеличили с 20 до 60 ГБайт/с без отдельного proxy layer.
Дмитрий Листвин из Авито расскажет, как они писали расширение HAProxy на Lua, реализовали ListObjects и DeleteObjects, какие проблемы получили при решардинге и как теперь эксплуатируют это решение.
Ещё будет доклад Павла Кутакова из VK Tech про архитектуру VK Data Platform гиперконвергентной дата-платформы на Kubernetes: управление СУБД и сервисами, отказоустойчивость, сеть, безопасность и наблюдаемость.
После докладов инженеры RWB и VK Tech разберут кейс подготовки сегментов для таргетинга на Trino и DataFusion. Затем обсудят Kubernetes, self-service-аналитику, подготовку платформ под AI-агентов и то, как AI меняет разработку дата-платформ.
После технической части — приятные напитки, пицца и можно будет обсудить всё это уже без слайдов.
Офлайн-участие — по регистрации и подтверждению организатора. Для онлайн-подключения достаточно регистрации.
Митап состоит из 3 частей.
Первая часть: спикеры расскажут 2 доклада, которые посвящены архитектуре, хранению и масштабированию аналитической инфраструктуры.
Вторая часть: круглый стол инженеров RWB и VK Tech: кейс Trino и DataFusion в RWB и дискуссия о будущем платформ данных в эпоху AI.
Третья часть: нетворкинг, приятные напитки, пицца.