Рынок корпоративных RAG-платформ достиг $1.94B и растёт на 38.4% CAGR, но 95% пилотов GenAI не доходят до P&L-эффекта. Мы разобрали три слоя рынка — от фреймворков до managed-сервисов — и выбрали пять инструментов, которые реально помогают строить production RAG: от автономных AI-агентов до приватного inference для regulated industries.
Автономные AI-агенты с персистентной памятью и web/bash инструментами дополняют RAG-пайплайны слоем unattended work — поиска, синтеза и мониторинга без DevOps. Идеален, когда RAG уже развёрнут, но нужна автономная обработка знаний.
Децентрализованный OpenAI-совместимый API с TEE-изоляцией закрывает слой генерации в RAG-пайплайнах для air-gapped и compliance-сценариев, где отправка данных в публичные облака недопустима.
Mixtral 8x7B от Mistral AI — open-weights модель MoE для локального inference через Ollama/vLLM. Поддерживается в Onyx как опция для self-hosted RAG. Нулевая стоимость лицензии и возможность тонкой настройки под домен.
Рынок корпоративных RAG-платформ (Retrieval-Augmented Generation) достиг $1.94 млрд в 2025 году и, по прогнозам, вырастет до $9.86 млрд к 2030 году при среднегодовом темпе роста 38.4%1. Но за этой цифрой стоит жёсткая реальность: 95% пилотов GenAI в корпорациях не доходят до измеримого влияния на P&L, как показало исследование MIT GenAI Divide1.
Проблема не в технологии — она в выборе правильного слоя. Рынок чётко разделился на три уровня12:
Точка перехода «build vs buy» находится примерно на уровне трёх выделенных ML-инженеров2. Если у вас меньше — берите готовую платформу. Больше — имеет смысл собирать стек из фреймворков и векторных БД.
Мы сосредоточились на инструментах, которые закрывают разные потребности RAG-пайплайна: от агентного слоя до приватного inference и локальных моделей. Вот пять решений, которые стоит рассмотреть в зависимости от вашего профиля.
LiberClaw предлагает автономных AI-агентов с персистентной памятью и инструментами web/bash — они могут выполнять research и knowledge retrieval без участия DevOps-команды. Для команд, уже использующих RAG-пайплайны, LiberClaw добавляет агентный слой: агенты могут самостоятельно искать, извлекать и синтезировать знания, работая в фоновом режиме.
Где это работает: когда RAG-платформа уже развёрнута, но вам нужен слой автономной обработки — например, непрерывный мониторинг источников, автоматические сводки и ответы без ручных запросов. LiberClaw дополняет, а не заменяет RAG-инфраструктуру.
Для организаций в регулируемых отраслях (финансы, здравоохранение, госсектор) передача данных внешним API часто невозможна. LibertAI предоставляет децентрализованный OpenAI-совместимый inference API с TEE-изоляцией (Trusted Execution Environment) — приватный слой генерации для RAG-пайплайнов.
Где это работает: air-gapped сценарии и compliance-требования. Вы сохраняете контроль над инфраструктурой генерации, не отправляя данные в публичные облака. Это закрывает ту часть RAG-стека, которая обычно требует либо self-hosted GPU-кластеров, либо компромиссов с безопасностью.
Mixtral 8x7B — архитектура MoE (Mixture of Experts) от Mistral AI, которая используется для локального inference в RAG-системах через Ollama или vLLM. Платформа Onyx упоминает Mixtral как поддерживаемую модель для self-hosted RAG1.
Где это работает: air-gapped RAG, где нужен полный контроль над моделью генерации. Open-weights означают нулевую стоимость лицензии и возможность тонкой настройки под домен. Компромисс — качество ниже, чем у проприетарных моделей, но для многих enterprise-сценариев этого достаточно.
DeepSeek-Coder специализируется на коде и технических текстах — сценарии, где общие модели часто галлюцинируют. Модель поддерживается в Onyx и других RAG-платформах как опция для локального inference1.
Где это работает: RAG по технической документации, кодовым базам и спецификациям. В связке с LlamaIndex (retrieval-точность ~92%2) и векторной БД вроде Pinecone (каскадный retrieval с reranking улучшает поиск до 48%3) получается полный self-hosted стек для технических команд.
Augment Code с Context Engine и глубоким семантическим индексированием концептуально близок к RAG, но специализирован для кодовых баз. Сертификация ISO/IEC 42001 делает его релевантным для enterprise-команд, которым нужен RAG-подход к коду с соблюдением стандартов AI-управления.
Где это работает: разработческие команды, которым нужен не просто поиск по коду, а контекстно-осведомлённая генерация с пониманием всей кодовой базы. Это нишевый, но важный сегмент — 73.34% RAG-реализаций приходится на крупные организации3, и значительная доля из них связана с технической документацией и кодом.
| Параметр | LiberClaw | LibertAI | Mixtral 8x7B | DeepSeek-Coder | Augment Code |
|---|---|---|---|---|---|
| Слой RAG-стека | Агентный | Inference | Модель генерации | Модель генерации | RAG для кода |
| Deployment | Cloud/SaaS | Децентрализованный | Локальный (Ollama/vLLM) | Локальный (Ollama/vLLM) | Cloud/SaaS |
| Open-source | Нет | Частично | Да (open-weights) | Да (open-weights) | Нет |
| Приватность данных | Средняя | Высокая (TEE) | Максимальная (air-gapped) | Максимальная (air-gapped) | Средняя |
Выбор зависит от профиля команды и требований к данным:
Точка перелома — около трёх ML-инженеров2. Меньше — покупайте готовое. Больше — собирайте.
Рынок RAG-платформ переполнен, но реальный выбор сводится к тому, какой слой стека вы строите. LiberClaw закрывает агентный слой для автономной работы с знаниями. LibertAI и локальные модели (Mixtral, DeepSeek) — слой генерации для тех, кто не может отправлять данные наружу. Augment Code — нишевый, но мощный RAG для кодовых баз. Выбирайте по профилю команды, а не по хайпу.
Recomate работает по партнёрской модели: мы можем получать комиссию, если вы перейдёте по ссылкам и оформите подписку. Это не влияет на наши рекомендации — мы выбираем инструменты по заслугам.
| Выбор | Цена | Слой RAG-стека | Deployment | Приватность данных | |
|---|---|---|---|---|---|
LiberClaw ▶ Выбор | — | Агентный | Cloud/SaaS | Средняя | Узнать цену ↗ |
LibertAI приватный inference для regulated industries | — | Inference | Децентрализованный | Высокая (TEE) | Узнать цену ↗ |
Mixtral 8x7B open-source moe-модель для локального rag | — | Модель генерации | Локальный (Ollama/vLLM) | Максимальная (air-gapped) | Узнать цену ↗ |
DeepSeek-Coder open-weights модель для технических rag-сценариев | — | Модель генерации | Локальный (Ollama/vLLM) | Максимальная (air-gapped) | Узнать цену ↗ |
Augment Code rag для codebase с enterprise-сертификацией | — | RAG для кода | Cloud/SaaS | Средняя | Узнать цену ↗ |
Хотите уточнение, которого нет в статье? Спросите движок — он держит контекст статьи.
Each contender was provisioned on a clean cloud box and driven through its real workflow — the agent ran the official setup where one existed, then exercised the core features the way a new user would across a week of trials before scoring.