Чем предстоит заниматься:
Полный цикл внедрения ML-моделей в продакшен: от постановки задачи до мониторинга качества и ретренинга. Построение пайплайнов обработки неструктурированных данных (PDF, шумные тексты), очистка, NER, feature engineering.
Обучение классических моделей и генеративных моделей для синтетических данных с оценкой качества и privacy-проверками. Упаковка решений в API и контейнеры.
Требования:
Опыт от 3 лет в роли ML-инженера / Data Scientist.
Уверенный Python, pandas, numpy, scikit-learn.
NLP: SpaCy, Hugging Face, работа с неструктурированными данными, извлечение сущностей (NER).
Классический ML: деревья решений, ансамбли (Random Forest), интерпретация результатов, подбор гиперпараметров, оценка рисков переобучения.
Синтетические данные: CTGAN, TVAE (SDV), оценка статистической близости, сохранение распределений, privacy-проверки.
Базовый MLOps: Docker, FastAPI/Flask, MLflow/DVC, понимание CI/CD.