Кремлёвская улица 21А
Мы создаём финтех-продукты для рынков, где формируется будущее финансовых технологий. Работаем на международных проектах, совмещая скорость стартапов с надёжностью enterprise-разработки.
У нас прозрачные процессы, честные грейды и инженерная культура без бюрократии. У нас можно создавать международный финтех, влиять на продукт и расти в предсказуемой, честной и зрелой инженерной среде.
Стек технологий: Python 3.12+, asyncio, FastAPI, Uvicorn, Pydantic v2, LiteLLM, vLLM, TGI, Ollama, LangChain, LlamaIndex, Qdrant, Chroma, Pinecone, Sentence-Transformers, OpenAI Embeddings, Unstructured, Chonkie, LangChain Text Splitters, FlashRank, Cohere, Presidio, NeMo Guardrails, Detoxify, OpenLLMetry, LangFuse, LangSmith, Prometheus, Docker, Kubernetes, CUDA, GPU, A10, A100, MinIO.
Чем предстоит заниматься?
- Разрабатывать LLM routing и gateway слой;
-
Реализовывать и оптимизировать RAG-пайплайны;
-
Встраивать guardrails и AI safety механизмы;
-
Интегрировать LLM observability и трейсинг;
-
Оптимизировать inference по latency, throughput и стоимости;
-
Реализовывать evaluation-пайплайны качества ответов;
-
Работать с GPU-инфраструктурой и масштабированием.
Мы ожидаем:
- Опыт: от 5 лет коммерческой разработки на позиции ML-инженера;
- Production ML: реальный опыт вывода моделей в продуктивные среды, глубокое понимание жизненного цикла модели — от экспериментов до мониторинга;
- RAG-архитектуры: практическая работа с векторными БД (Qdrant, Milvus, Weaviate, PGVector) и фреймворками (LangChain, LlamaIndex или кастомные решения);
- Python: экспертное владение Python и async-стеком (asyncio, aiohttp, FastAPI);
- Эксперименты: умение проектировать A/B-эксперименты, работать с метриками и интерпретировать результаты;
- LLM: продуктовый опыт работы с большими языковыми моделями;
- Безопасность: понимание рисков и принципов безопасности LLM-систем (prompt injection, data leakage, jailbreak).
Будет плюсом:
-
Agentic RAG и multi-agent системы;
-
Fine-tuning (LoRA, QLoRA, PEFT);
-
Multi-modal модели (vision, audio);
-
ASR, TTS, OCR, NER;
-
Оптимизация инференса (batching, KV-cache, quantization).
Почему мы?
- График 5/2 по календарю РФ, гибкое начало рабочего дня;
-
Гибридный формат работы в Казани // удаленка для других регионов;
-
Официальное трудоустройство в аккредитованной IT-компании со всеми плюшками;
-
ДМС со стоматологией после 3 месяцев работы;
-
Корпоративные уроки английского, фитнес прямо в офисе, футбольная команда, библиотека и партнёрские бенефиты;
-
Подарки к праздникам и здоровую атмосферу, где твой вклад ценят;
-
Поддержка профессионального развития — участие в конференциях, обучение, обмен опытом;
-
Открытая культура и высокий уровень доверия;
-
Работа в команде, которая работает над передовыми технологиями;
-
Возможность напрямую влиять на продукты компании.