Что такое RAG?
Retrieval-Augmented Generation (RAG) — это архитектура, объединяющая два этапа: retrieval (поиск релевантных документов в базе знаний) и generation (генерация ответа на основе найденных материалов). Модель не полагается на память из обучающего набора, а опирается на предоставленные, актуальные данные.
Как работает pipeline RAG?
1. Пользователь задаёт вопрос. 2. Система ищет релевантные фрагменты документов в векторной базе (embedding + similarity search). 3. Найденные фрагменты попадают в промпт как контекст. 4. Модель генерирует ответ, ссылаясь на источники. Качество RAG зависит от: качества эмбеддингов, стратегии chunking документов и переранжирования результатов.
RAG vs fine-tuning
RAG применяем, когда данные меняются (база знаний, документация, регламенты). Fine-tuning применяем, когда хотим изменить поведение модели (стиль ответа, формат, доменную специализацию). На практике в enterprise чаще всего сочетают оба подхода.