Чем предстоит заниматься
- Разрабатывать ETL-процедуры для сервисов datagov с использованием python, pyspark, hadoop, airflow;
- Собирать данные из разных реляционных и нереляционных источников;
- Создавать наполнять витрины в hive/postgres/clickhouse/greenplum
Требования
- Студенты 3 - 6 курсов бакалавриата, специалитета или магистратуры;
- Хорошее знание Python;
- Уверенное знание SQL и умение работать с реляционной СУБД
- Будет плюсом: опыт использования с фреймворками обработки данных типа pandas/polars/spark и подобными