
Что такое RAG и почему без него LLM бесполезны для бизнеса
Почему GPT «галлюцинирует» на ваших данных и как retrieval-augmented generation заставляет модель отвечать по вашим документам — с проверяемыми ссылками.
Большие языковые модели обучены на публичном интернете и ничего не знают о вашей компании: регламентах поддержки, продуктах, договорах. Если спросить GPT «какой у нас срок возврата», он либо откажется, либо выдумает правдоподобный, но ложный ответ. Это и есть галлюцинация — главная причина, почему «голая» LLM в бизнесе не работает.
RAG (Retrieval-Augmented Generation) решает проблему: перед тем как модель ответит, система находит в вашей базе знаний релевантные фрагменты документов и подкладывает их в контекст. Модель отвечает уже не из «памяти», а по предоставленному тексту — с цитатой-источником, который можно проверить.
Архитектура RAG-системы
Классический RAG-пайплайн состоит из пяти этапов. Каждый из них критичен — пропуск любого приводит к падению точности:
- Документы режутся на чанки и превращаются в эмбеддинги (векторные представления)
- Эмбеддинги лежат в векторной базе (Qdrant, pgvector, OpenSearch)
- При запросе пользователя ищем топ-k похожих чанков
- Собираем промпт «контекст + вопрос» и отправляем в LLM
- Ответ возвращаем со ссылкой на источник — для верификации
RAG — это не про «умную модель», а про правильный поиск. Качество ответа на 80% зависит от того, какие чанки вы подсунули в контекст, и только на 20% — от самой LLM.
Ловушки, на которых сыпятся самописные RAG
На рынке много компаний, которые «за weekend собрали RAG» и потом жалуются, что агент несёт чушь. Вот типичные ошибки:
- Плохой чанкинг — документ разрезан посередине мысли, релевантный фрагмент разорван на два чанка
- Отсутствие reranking — в контекст попадают топ-k по косинусной близости, но они не самые релевантные по смыслу
- Устаревший индекс — документы обновились, а эмбеддинги не пересчитали
- Нет проверки релевантности — агент отвечает даже когда в контексте нет ничего подходящего
- Только векторный поиск — точные термины (номера договоров, артикулы) находятся плохо без keyword-поиска
Поэтому мы всегда добавляем гибридный поиск (BM25 + dense), реранкинг через Cohere Rerank v3 и оценку релевантности: если ни один чанк не набрал порог — агент честно говорит «не знаю» или переводит на оператора.
Результаты в продакшене
В продакшене RAG даёт точность ответов 85–94% по внутренним документам и снижает галлюцинации в 4–6 раз относительно «голой» LLM. Для поддержки, HR-ботов и внутренних ассистентов это стандарт де-факто — без RAG запускать AI-агента в компанию просто нельзя.
Хотите так же у себя в компании?
Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.

