Что такое RAG и почему без него LLM бесполезны для бизнеса
Технологии12 марта 2025 9 мин

Что такое RAG и почему без него LLM бесполезны для бизнеса

Почему GPT «галлюцинирует» на ваших данных и как retrieval-augmented generation заставляет модель отвечать по вашим документам — с проверяемыми ссылками.

Большие языковые модели обучены на публичном интернете и ничего не знают о вашей компании: регламентах поддержки, продуктах, договорах. Если спросить GPT «какой у нас срок возврата», он либо откажется, либо выдумает правдоподобный, но ложный ответ. Это и есть галлюцинация — главная причина, почему «голая» LLM в бизнесе не работает.

RAG (Retrieval-Augmented Generation) решает проблему: перед тем как модель ответит, система находит в вашей базе знаний релевантные фрагменты документов и подкладывает их в контекст. Модель отвечает уже не из «памяти», а по предоставленному тексту — с цитатой-источником, который можно проверить.

Архитектура RAG-системы

Классический RAG-пайплайн состоит из пяти этапов. Каждый из них критичен — пропуск любого приводит к падению точности:

  • Документы режутся на чанки и превращаются в эмбеддинги (векторные представления)
  • Эмбеддинги лежат в векторной базе (Qdrant, pgvector, OpenSearch)
  • При запросе пользователя ищем топ-k похожих чанков
  • Собираем промпт «контекст + вопрос» и отправляем в LLM
  • Ответ возвращаем со ссылкой на источник — для верификации
RAG — это не про «умную модель», а про правильный поиск. Качество ответа на 80% зависит от того, какие чанки вы подсунули в контекст, и только на 20% — от самой LLM.

Ловушки, на которых сыпятся самописные RAG

На рынке много компаний, которые «за weekend собрали RAG» и потом жалуются, что агент несёт чушь. Вот типичные ошибки:

  • Плохой чанкинг — документ разрезан посередине мысли, релевантный фрагмент разорван на два чанка
  • Отсутствие reranking — в контекст попадают топ-k по косинусной близости, но они не самые релевантные по смыслу
  • Устаревший индекс — документы обновились, а эмбеддинги не пересчитали
  • Нет проверки релевантности — агент отвечает даже когда в контексте нет ничего подходящего
  • Только векторный поиск — точные термины (номера договоров, артикулы) находятся плохо без keyword-поиска

Поэтому мы всегда добавляем гибридный поиск (BM25 + dense), реранкинг через Cohere Rerank v3 и оценку релевантности: если ни один чанк не набрал порог — агент честно говорит «не знаю» или переводит на оператора.

Результаты в продакшене

В продакшене RAG даёт точность ответов 85–94% по внутренним документам и снижает галлюцинации в 4–6 раз относительно «голой» LLM. Для поддержки, HR-ботов и внутренних ассистентов это стандарт де-факто — без RAG запускать AI-агента в компанию просто нельзя.

Хотите так же у себя в компании?

Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.