
Как выбрать LLM для бизнеса: GPT-5, Claude, YandexGPT или GigaChat
Сравниваем модели по качеству, цене, скорости, языку и режиму работы. Когда нужен on-premise, а когда хватит API. Чек-лист выбора под задачу.
На рынке нет «лучшей» LLM — есть подходящая под конкретную задачу, режим работы и бюджет. Выбор определяют пять факторов: качество на русском, цена за токен, задержка, режим данных (cloud/on-prem) и требования к юридической чистоте.
Зарубежные модели: GPT-5 и Claude
GPT-5 и Claude лидируют по качеству рассуждений и работе с кодом, отлично пишут на русском. Подходят для аналитики, копирайтинга, сложных агентов с многошаговыми рассуждениями. Минус — данные уходят за рубеж, что не всегда допустимо для персональных данных и гостайны.
Задержка у зарубежных моделей через API — 1–3 секунды на ответ, что приемлемо для чата, но критично для голосовых ботов (там нужен латенси <800 мс). Цена: GPT-5 ~$15/млн входных токенов, Claude сопоставим. Для высоконагруженных агентов это существенная статья расходов.
Российские модели: YandexGPT и GigaChat
YandexGPT и GigaChat — российские модели, развёрнутые в РФ. Прохождение по 152-ФЗ, есть реестр отечественного ПО. Качество чуть ниже топовых зарубежных, но для поддержки и типовых задач достаточно. Идеальны как основа для ПДн-агентов и как fallback при недоступности зарубежных API.
Российская LLM — это не «хуже», это «другая задача». Для обработки персональных данных граждан РФ зарубежная модель просто не подходит юридически, какой бы умной она ни была.
Гибридная архитектура — наш стандарт
Оптимальная архитектура — гибрид: зарубежная модель для сложных задач без ПДн, российская — для работы с персональными данными. Переключение по типу данных и черный список полей в промпте. Так мы одновременно получаем качество и compliance.
Для критичных агентов добавляем третий слой — on-premise модель (например, Llama через vLLM на своём железе). Это страховка на случай, если API зарубежного провайдера отключат. Да, качество ниже, но агент не упадёт.
Чек-лист выбора модели
- Есть ли ПДн или гостайна — нужен on-prem или российский API
- Какой язык доминирует — для русского российские модели ближе по идиомам
- Нужна ли vision (работа с картинками) — не все модели её поддерживают
- Какой бюджет на токены — для high-load кэширование обязательно
- Какая допустимая задержка — для голоса нужен латенси <800 мс
- Нужен ли fallback — зависимость от одного провайдера рискованна
После ответов на эти вопросы — бенчмарк на ваших данных и выбор по цифрам, а не по хайпу. Мы всегда делаем A/B-тест на 200–500 реальных запросах перед окончательным выбором.
Хотите так же у себя в компании?
Расскажите задачу — проведём бесплатный AI-аудит и предложим решение с расчётом окупаемости.

