Перейти к содержимому
AI / ML~3 мин чтения

RAG

Retrieval-Augmented Generation — архитектура AI-бота, которая ищет ответ в твоей базе документов перед тем, как сгенерировать ответ. Снижает галлюцинации.

Развёрнутое объяснение

RAG (Retrieval-Augmented Generation) — это архитектура, в которой LLM перед ответом ищет релевантные куски в твоей базе знаний и использует их как контекст. Без RAG модель отвечает «по памяти» (которая может быть устаревшей или ошибочной). С RAG — отвечает по твоим актуальным документам.

Pipeline RAG: 1) пользовательский вопрос → 2) embedding запроса → 3) поиск в vector DB → 4) топ-N кусков как контекст → 5) LLM генерирует ответ с этим контекстом → 6) опционально цитирует источники.

RAG решает три проблемы LLM: устаревшие данные (модель обучена 2 года назад), галлюцинации (модель «выдумывает» если не знает), узкая специфика (модель не знает деталей твоего бизнеса).

Где это в услугах WRAW

  • Услуга ai-automation/chatbot-rag — RAG-боты для B2B и поддержки
  • Дана на wraw.kz отвечает по базе знаний — это тот же принцип

Частые вопросы

Чем RAG отличается от обычного чат-бота?

Обычный — отвечает по сценариям (если-то). RAG — ищет ответ в базе документов. RAG может отвечать на нетиповые вопросы, обычный — нет.

Сколько стоит RAG?

От 400 000 ₸ за разработку + 30-100 000 ₸/мес на токены и поддержку. Зависит от объёма базы и трафика.

Какие vector DB используете?

Supabase Vector (для проектов на Supabase), Pinecone (стандарт), Weaviate (для больших баз).

Связанные термины

Покажем, где RAG даст результат

Опишите задачу своими словами — за 1 рабочий день пришлём понятное предложение с шагами и стоимостью.