Чем предстоит заниматься
- Чтобы улучшать качество наших моделей и продуктов, понимать их сильные и слабые места и приоритизировать планы разработки новой функциональности, необходима качественная и количественная аналитика. Без метрик и приборов, которые покажут, куда необходимо двигаться, жить нельзя — и вы поможете нам строить такие приборы и процессы их регулярного обновления.
- Один из ключевых факторов, влияющих на качество ML-моделей, — это данные для обучения. Вы будете разрабатывать процессы сбора и разметки данных, оценивать и улучшать качество процессов. Примеры задач: разметка данных для распознавания речи на узбекском языке; сбор обучающих данных для задач текстовой классификации.
- Мы не только разрабатываем модели, но и помогаем внедрять их в продукты. При внедрении возникает множество гипотез о том, что и как можно сделать с помощью моделей. Для проверки гипотез часто требуется разработать и проанализировать прототип, выбрать лучший вариант решения задачи. Вы поможете менеджерам продукта и разработчикам строить прототипы и изучать варианты технических решений. Пример задачи: анализ разных алгоритмов кластеризации текстов на основе GPT.
Требования
- Пишете на Python
- Хорошо знаете статистику
- Разбираетесь в современных методах ML и NLP
- Обрабатывали и анализировали большие объёмы данных с помощью pandas, SQL, статистических пакетов, библиотек для визуализации данных, Spark SQL, Spark, Hadoop
- Работали с системами контроля версий, например с Git
Будет плюсом
- Работали с DataLens
- Работали с краудсорсингом (Яндекс Толокой, Яндекс Заданиями)