MLOps для AI-агентов: как не убить продакшен первым обновлением
Архитектура18 января 2025 11 мин

MLOps для AI-агентов: как не убить продакшен первым обновлением

Мониторинг, A/B-тесты, канареечный деплой, detection drift — что нужно, чтобы AI-агент работал стабильно месяцами, а не развалился через неделю после запуска.

Запустить AI-агента — 20% работы. 80% — это поддержка в продакшене: мониторинг, дообучение, откат плохих версий, детекция дрейфа. Без MLOps-обвязки даже идеальный агент развалится через 2–4 недели. Разбираем, что необходимо.

Мониторинг — не метрики, а семантика

Стандартные метрики (latency, RPS, error rate) не достаточно для LLM. Агент может формально «отвечать» 200 OK, но при этом галлюцинировать или отвечать не по теме. Нужен семантический мониторинг: выборочно (1–5% ответов) прогонять через отдельную LLM-judge, которая оценивает релевантность и точность. Если доля плохих ответов растёт — алерт.

  • Доля ответов с fallback на оператора — растёт = модель хуже справляется
  • Доля отрицательных реакций (плохие отзывы, дизлайки) — прямой сигнал
  • Семантическая оценка LLM-judge — автоматический контроль качества
  • Топ запросов, на которых модель не уверена — кандидаты на дообучение

A/B-тестирование моделей

Никогда не выкатывайте новую версию промпта или модели на 100% трафика. Сначала на 5–10% (канарейка), сравниваем с текущей по бизнес-метрикам (CSAT, конверсия, доля авто-ответов), и только если новая лучше — раскатываем. Без этого любой апдейт — русская рулетка.

В ML нет «работает/не работает». Есть «работает на 92%» и «работает на 88%». Разницу увидит только A/B-тест, не разработчик.

Data drift и concept drift

Мир меняется. Клиенты начинают задавать новые вопросы, появляются новые продукты, меняются регламенты. Модель, обученная в январе, в июле может начать галлюцинировать просто потому, что распределение запросов сдвинулось. Это и есть drift. Детектируем через мониторинг: если доля «незнакомых» запросов растёт — пора обновлять базу знаний или дообучать.

  • Data drift — изменились входные данные (новые термины, продукты)
  • Concept drift — изменилась связь запрос→правильный ответ (регламент поменялся)
  • Детекция: мониторинг распределения запросов и доли fallback
  • Реакция: обновление RAG-индекса, реже — дообучение модели

Версионирование всего

Промпты, датасеты, модели, конфиги — всё версонируется в git + MLflow. Если продакшен сломался, мы за 5 минут откатываемся на прошлую версию и разбираемся. Без этого инцидент превращается в аврал с ночёвкой. Это скучная инфраструктура, но именно она отличает агентство, чьи агенты живут годами, от агентства, чьи агенты живут до первого релиза.

Хотите так же у себя в компании?

Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.