Чем предстоит заниматься
- разработка DWH/DataLake/LakeHouse
- построение поставки данных в Batch/NRT/RealTime
- оптимизация ETL
- повышение актуальности данных
- снижение latency доступа к данным
- разработка и валидация архитектуры данных
Требования
- отличное знание SQL (join, CTE, оконные функции, фреймы и др.)
- опыт работы с Hadoop, Spark, Iceberg/Paimon
- опыт работы с Kafka и др. Брокерами
- опыт работы с оркестраторами (например, Airflow) и CI/CD
- опыт построения архитектуры данных (например, Data Vault, Инман, Кимбалл и др.)
- опыт кратной оптимизации ETL
- практическое знание python на уровне разработки ETL будет преимуществом
- практическое знание java/scala будет преимуществом
- практический опыт создания и защиты архитектуры данных будет преимуществом
- практический опыт разработки solution-архитектуры data-продуктов будет преимуществом