Чем предстоит заниматься
- Разрабатывать и обучать модели детекции для выделения главных объектов на изображениях;
- Обучать эмбеддинговые модели для распознавания и извлечения мета-информации из изображений;
- Использовать подходы CLIP-like и metric-learning для повышения качества поиска;
- Обучать модели для генерации текстовых тегов по изображениям и для уточнения фотопоиска текстом;
- Решать задачи классификации и OCR (распознавание текста);
- Обучать классические ML-модели для ранжирования результатов поиска;
- Создавать датасеты и разрабатывать инструкции для команд разметки;
- Масштабировать решение на большой объем данных;
- Подготавливать модели к продакшену с многомиллионной аудиторией.
Требования
- Опыт работы с нейросетями для обработки изображений и мультимодальными данными - VIT, CLIP, SigLip, Gemma, Qwen, BGE, YOLO;
- Знание принципов векторных баз данных и работы с ними;
- Умение оборачивать ML-решения в продовые пайплайны (Docker, Airflow);
- Понимание базовых алгоритмов и структур данных;
- Опыт работы с classic ML, включая рекомендательные системы;
- Понимание базовых механизмов работы современных VLM / LLM;
- Понимание архитектуры поисковых систем и работы с крупными массивами изображений;
- Знание инструментов для анализa качества ML-моделей будет плюсом.