Чем предстоит заниматься
- Повысить эффективность пайплайнов для расчета с daily-признаков на основе batch процессинга.
- Создать эффективный пайплайн для расчёта realtime-признаков на основе Kafka‑топиков.
- Проектировать и разрабатывать сервисы, обрабатывающие миллиарды событий пользователей.
- Решать сложные инженерные задачи: расчеты метрик, построение витрин.
- Работать с потоками данных и интеграциями между CDP и другими системами 2ГИС.
- Влиять на архитектурные решения и качество кода.
- Работать в распределенной команде, взаимодействуя с аналитиками, продактами и инженерами других направлений.
Требования
- Опыт работы с highload-системами.
- Опыт проектирования архитектуры данных или платформенного кода.
- Опыт работы с Kafka, ClickHouse или другими системами потоковой и аналитической обработки данных.
- Хорошо понимает, как работает Spark и умеет его готовить.
- Хорошо владеешь одним из языков программирования (например, Python или Scala).
- Самостоятельность и проактивность — ты не ждешь постановок, а предлагаешь решения.
- Желание разбираться в бизнес-логике и создавать продукт, а не просто писать код.
Будет плюсом:
- Опыт работы с Airflow.
- Опыт анализа данных с использованием SQL.
- Знание инструментов мониторинга и автоматического контроля качества данных (Data Quality, Data Contracts).
- Опыт построения Data Lineage и работы с Data Catalog.
- Понимание подходов к персонализации, сегментации или real-time аналитике.
- Понимание, как работает S3 хранилище.
