Чем предстоит заниматься
- Разрабатывать ETL-процедуры с использованием Python, PySpark, Hadoop, Airflow;
- Собирать данные из разных реляционных и нереляционных источников (Kafka, Redis, Hadoop);
- Создавать и наполнять витрины данных в Hive/Postgres/Greenplum;
- Писать базовые дата-процессы и поддерживать существующие пайплайны;
- Оформлять и актуализировать техническую документацию;
- Помогать в решении текущих технических задач (работа с мелкими файлами в Hadoop и др.);
- Участвовать в обсуждениях архитектуры и процессов обработки данных.
Требования
- Студенты 3 - 6 курсов бакалавриата, специалитета или магистратуры;
- Хорошее знание Python;
- Уверенное знание SQL и умение работать с реляционной СУБД;
- Понимание принципов работы с Git;
- Базовое понимание концепций ETL и работы с данными.