Чем предстоит заниматься
- Разработка и развитие микросервисов и data процессов для online/streaming и batch обработки;
- Построение пайплайнов обработки, обогащения и репликации данных;
- Создание витрин, агрегатов и ML фичей для антифрод моделей;
- Работа с большими объемами исторических данных и тяжелыми расчетами;
- Обеспечение качества, консистентности и доступности данных;
- Оптимизация производительности и надежности сервисов и пайплайнов;
- Взаимодействие с бизнес заказчиками и Data Scientists: сбор требований, проработка решений, понимание особенностей обучения и применения ML моделей.
Требования
- Коммерческий опыт разработки на Python;
- Опыт создания backend сервисов и data пайплайнов;
- Понимание принципов микросервисной архитектуры;
- Опыт работы с большими объемами данных;
- Понимание batch и streaming обработки;
- Опыт работы с реляционными и in-memory базами данных;
- Понимание принципов работы ML пайплайнов;
- Готовность самостоятельно разбираться в предметной области и работать на стыке технических и бизнес задач;
- Big Data: Spark, Hadoop, S3, Iceberg, Airflow;
- Backend: Python, FastAPI, Flask, Aiohttp;
- СУБД: MS SQL, Oracle, PostgreSQL;
- In-memory: Redis, Apache Ignite, Tarantool DB, Tarantool Column Store;
- Streaming: Kafka;
- Инфраструктура: Linux.
Будет плюсом:
- опыт в Anti-Fraud / Risk / Scoring, low-latency системах, feature pipelines, online inference, а также практический опыт со Spark, Kafka, Tarantool или Ignite.