Python-разработчик AI-сервисов (LLM / RAG)

Дата размещения вакансии: 05.10.2026
Работодатель: QSOFT
Уровень зарплаты:
з/п не указана
Город:
Москва
Покровский бульвар 4/17с1
Требуемый опыт работы:
От 1 года до 3 лет

TEAMLY – это IT-платформа для совместной работы и управления знаниями. Она бесшовно объединяет функции командной работы, ведения базы знаний и корпоративного обучения.

Благодаря разнообразному функционалу она позволяет переводить весь накопленный опыт компании в реально работающие навыки и знания сотрудников.

Нам доверяют свои знания известные компании: ВкусВилл, Аналитический центр при Правительстве РФ, Капитал Life, 1С-Рарус, Интерлизинг. А также средний и малый бизнес.

В данный момент команда TEAMLY активно растет, в связи с чем мы будем рады видеть в нашей команде ИИ - разработчика. Востребованный продукт гарантирует быстрый рост и интересные задачи.

Чем предстоит заниматься

  • Развивать HTTP API и бизнес-логику двух асинхронных Python-сервисов на FastAPI.
  • Проектировать и реализовывать RAG-пайплайны: retrieval, query rewriting, multi-hop поиск, сбор контекста, structured output, цитирование источников и обработку частичных ответов.
  • Развивать агентные сценарии на LangChain, LangGraph и deepagents: инструменты, middleware, ограничения числа вызовов, защита от циклов и контроль контрактов ответа.
  • Улучшать качество семантического поиска: chunking, dense/sparse retrieval, фильтры Qdrant, reranking, RRF и token budget.
  • Развивать событийную индексацию статей, файлов и структурированного контента через Kafka.
  • Обеспечивать корректную мультитенантность и фильтрацию результатов по правам пользователей, групп и сообществ.
  • Интегрировать и заменять LLM-, embedding- и reranking-провайдеры, включая OpenAI-compatible API, vLLM и Ollama.
  • Работать с PostgreSQL, Redis и Qdrant, проектировать модели данных и Alembic-миграции.
  • Диагностировать проблемы качества, производительности и надежности на границах внешних сервисов.
  • Развивать автоматические тесты и quality gates, поддерживать воспроизводимые локальные и CI-окружения.
  • Улучшать наблюдаемость: структурированные логи, технические метрики, OpenTelemetry и трассировку LLM/RAG через Langfuse.
  • Участвовать в декомпозиции задач, ревью кода и принятии архитектурных решений.

Технологический стек

  • Python 3.12, async/await;
  • FastAPI, Pydantic 2;
  • SQLAlchemy 2 async, Alembic, PostgreSQL;
  • Redis, Apache Kafka, aiokafka;
  • Qdrant, dense/sparse vectors, embeddings, reranking, RRF;
  • LangChain, LangGraph, deepagents;
  • OpenAI-compatible API, vLLM, Ollama;
  • Pytest, pytest-asyncio, mypy, Black, Flake8;
  • Docker, Docker Compose, Kubernetes, GitLab CI;
  • Langfuse, OpenTelemetry.

Что для нас важно

  • Уверенное владение Python и практический опыт разработки backend-сервисов.
  • Хорошее понимание асинхронного программирования: event loop, конкурентный I/O, таймауты, отмена, управление ресурсами и graceful shutdown.
  • Опыт разработки API на FastAPI или сопоставимом Python-фреймворке.
  • Практический опыт с PostgreSQL и SQLAlchemy: транзакции, конкурентный доступ, индексы, миграции и диагностика запросов.
  • Опыт интеграции внешних сервисов и проектирования устойчивого взаимодействия: retry/backoff, timeout, idempotency, ограничение параллелизма и обработка частичных отказов.
  • Понимание событийной архитектуры и семантики Kafka consumer: consumer groups, offset commit, rebalance, повторная доставка и идемпотентная обработка.
  • Понимание устройства RAG: chunking, embeddings, retrieval, reranking, контекстное окно, ограничения LLM и способы снижения галлюцинаций.
  • Умение писать unit- и интеграционные тесты для асинхронного кода, отделяя бизнес-логику от внешней инфраструктуры.
  • Способность разбираться в существующей кодовой базе, находить причины проблем и предлагать минимальные, проверяемые изменения.​​​​​​

Будет преимуществом

  • Production-опыт с Qdrant или другой векторной базой.
  • Практический опыт hybrid search, sparse retrieval, reranker и оценки ранжирования по Precision@K, Recall@K, MRR, MAP или NDCG.
  • Опыт разработки LLM-приложений на LangChain/LangGraph или другом orchestration framework.
  • Опыт работы со structured output, function/tool calling и потоковой генерацией.
  • Понимание prompt injection, разграничения доступа к данным и других рисков безопасности RAG/agent-систем.
  • Опыт эксплуатации сервисов в Kubernetes и настройки observability.
  • Опыт работы с локальными моделями и inference-серверами: vLLM, Ollama, embedding/reranking inference.
  • Офисный формат работы с возможностью перейти на гибрид

  • Развитие – оплачиваем внешние курсы, даем корпоративную скидку на английский, поддерживаем выступления на конференциях, участие в митапах и вебинарах. Нам хочется развивать экспертность каждого сотрудника!
  • Крупный и реально интересный продукт, который меняет мир к лучшему. Мы используем инновационные технологии, создаём передовые решения и предлагаем уникальную возможность быть частью команды, где ваши идеи и навыки могут повлиять на жизни многих людей;
  • Комфорт – у нас классный офис в центре Москвы (Китай-город, Курская, Чистые пруды) с уютными рабочими местами. Предоставляем все необходимое для работы: хорошее железо, дополнительные мониторы, лицензированный софт и платные доступы;
  • Команда – в TEAMLY действительно сплочённая команда профессионалов. Мы ценим работу каждого сотрудника, поддерживаем инициативы и помогаем с решением проблем;
  • Яркая жизнь вне работы – каждый месяц устраиваем корпоративы, все вместе выезжаем на природу, ходим в бары и на квизы, участвуем в спортивных мероприятиях, играем в страйкбол, проводим вечера кино и смотрим шоу в комнате отдыха. Cтараемся, чтобы не только работать было комфортно, но и отдыхать хотелось вместе!

    Данное описание вакансии не является офертой.