Що таке RAG?
Retrieval-Augmented Generation (RAG) - це архітектура, що поєднує два етапи: ретриваль (пошук відповідних документів з бази знань) і генерація (генерування відповіді на основі знайдених матеріалів). Модель не спирається на пам'ять з навчальної вибірки, а на надані, актуальні дані.
Як працює pipeline RAG?
1. Користувач задає питання. 2. Система шукає відповідні фрагменти документів у векторній базі (embedding + пошук за подібністю). 3. Знайдені фрагменти надходять до промпту як контекст. 4. Модель генерує відповідь, цитуючи джерела. Ключова якість RAG залежить від: якості ембеддінгів, стратегії розділення документів і повторного ранжування результатів.
RAG проти fine-tuning
RAG застосовується, коли дані змінюються (база знань, документація, регламенти). Fine-tuning застосовується, коли хочемо змінити поведінку моделі (стиль відповіді, формат, спеціалізацію домену). На практиці підприємства найчастіше об'єднують обидва підходи.