
MLOps для AI-агентов: как не убить продакшен первым обновлением
Мониторинг, A/B-тесты, канареечный деплой, detection drift — что нужно, чтобы AI-агент работал стабильно месяцами, а не развалился через неделю после запуска.
Запустить AI-агента — 20% работы. 80% — это поддержка в продакшене: мониторинг, дообучение, откат плохих версий, детекция дрейфа. Без MLOps-обвязки даже идеальный агент развалится через 2–4 недели. Разбираем, что необходимо.
Мониторинг — не метрики, а семантика
Стандартные метрики (latency, RPS, error rate) не достаточно для LLM. Агент может формально «отвечать» 200 OK, но при этом галлюцинировать или отвечать не по теме. Нужен семантический мониторинг: выборочно (1–5% ответов) прогонять через отдельную LLM-judge, которая оценивает релевантность и точность. Если доля плохих ответов растёт — алерт.
- Доля ответов с fallback на оператора — растёт = модель хуже справляется
- Доля отрицательных реакций (плохие отзывы, дизлайки) — прямой сигнал
- Семантическая оценка LLM-judge — автоматический контроль качества
- Топ запросов, на которых модель не уверена — кандидаты на дообучение
A/B-тестирование моделей
Никогда не выкатывайте новую версию промпта или модели на 100% трафика. Сначала на 5–10% (канарейка), сравниваем с текущей по бизнес-метрикам (CSAT, конверсия, доля авто-ответов), и только если новая лучше — раскатываем. Без этого любой апдейт — русская рулетка.
В ML нет «работает/не работает». Есть «работает на 92%» и «работает на 88%». Разницу увидит только A/B-тест, не разработчик.
Data drift и concept drift
Мир меняется. Клиенты начинают задавать новые вопросы, появляются новые продукты, меняются регламенты. Модель, обученная в январе, в июле может начать галлюцинировать просто потому, что распределение запросов сдвинулось. Это и есть drift. Детектируем через мониторинг: если доля «незнакомых» запросов растёт — пора обновлять базу знаний или дообучать.
- Data drift — изменились входные данные (новые термины, продукты)
- Concept drift — изменилась связь запрос→правильный ответ (регламент поменялся)
- Детекция: мониторинг распределения запросов и доли fallback
- Реакция: обновление RAG-индекса, реже — дообучение модели
Версионирование всего
Промпты, датасеты, модели, конфиги — всё версонируется в git + MLflow. Если продакшен сломался, мы за 5 минут откатываемся на прошлую версию и разбираемся. Без этого инцидент превращается в аврал с ночёвкой. Это скучная инфраструктура, но именно она отличает агентство, чьи агенты живут годами, от агентства, чьи агенты живут до первого релиза.
Хотите так же у себя в компании?
Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.

