
Компьютерное зрение на производстве: от PoC до edge-инференса
Как построить систему контроля качества на линии: выбор модели (YOLO, DETR), разметка, edge-деплой на NVIDIA Jetson, интеграция с PLC. Реальный кейс металлургии.
Компьютерное зрение (CV) — самая «физическая» ветка AI. Тут модель не просто генерирует текст, она смотрит на реальный мир через камеры и принимает решения, от которых зависит, пойдёт ли бракованный прокат на склад. Разбираем, как строить такие системы, чтобы они работали не на демо, а в цеху 24/7.
Задача: контроль дефектов на линии
Металлургический завод, линия проката. Камера снимает каждый метр полосы, модель должна за 200 мс сказать: есть дефект или нет, и если есть — какого типа. Ложноположительные — рекламации от клиентов. Ложноотрицательные — пропуск брака. Точность нужна 98%+, иначе экономика не сходится.
В CV 90% работы — это не модель, а данные. Плохая разметка убьёт любой YOLO, как бы вы его ни тюнили.
Выбор модели: YOLO против трансформеров
YOLO (You Only Look Once) — стандарт для real-time детекции. YOLOv8/v11 даёт 50–80 FPS на одной GPU, точность достаточна для большинства задач. Трансформеры (DETR, RT-DETR) точнее на сложных сценах, но медленнее и тяжелее. Для нашей задачи — YOLOv8 с последующим тонким тюнингом.
- YOLOv8/v11 — real-time, простая разметка, зрелая экосистема
- RT-DETR — точнее на перекрывающихся объектах, но тяжелее
- SegFormer — для сегментации (если нужна маска дефекта, не только bbox)
- ResNet/EfficientNet — для классификации (брак/не брак без локализации)
Разметка данных — главный bottleneck
Для 10 типов дефектов нужно 5000–10000 размеченных изображений. Разметку делает эксперт с завода (технолог), а не ML-инженер — только он отличает раковину от заката. Один кадр — 30–60 секунд. Итого: 100–300 часов работы эксперта. Это долго и дорого, но без этого модель не взлетит.
Хак: active learning. Сначала размечаем 1000 кадров, обучаем v1, запускаем на неразмеченных. Модель сама находит кадры, где не уверена (low confidence) — их отдаём эксперту на разметку в первую очередь. Так в 3 раза быстрее собираем качественный датасет.
Edge-инференс: почему не в облаке
В цеху нет стабильного интернета, задержка до облака — 500+ мс, а решение нужно за 200 мс. Поэтому инференс на edge-устройстве: NVIDIA Jetson Orin прямо у камеры. Модель конвертируется в TensorRT, FP16, батчинг по 4 кадра. Получаем 60 FPS на $500-устройстве, без зависимости от сети.
Интеграция с PLC (программируемый логический контроллер): модель по MQTT шлёт результат проверки, PLC принимает решение — отбраковать или пропустить. Всё это должно работать даже если центральный сервер упал — edge-устройство автономно.
Результат: точность 98,7%, минус 22% рекламаций за квартал, ROI за 5 месяцев. Но самое главное — модель нужно постоянно дообучать на новых типах дефектов, иначе через полгода точность падает. Это не разовый проект, а процесс.
Хотите так же у себя в компании?
Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.

