Čo je multimodálne RAG?
Multimodálne RAG rozširuje základnú RAG architektúru za hranice textových dokumentov. Klasické RAG systémy retrievujú textové pasáže, ale reálny svet obsahuje informácie v rôznych formátoch – obrázky, tabuľky, grafy, prezentácie a diagramy – ktoré jednoduché textové RAG systémy ignorujú alebo spracúvajú len nedostatočne.
Pre enterprise scenáre, kde dokumentácia obsahuje technické schémy, grafy z reportov alebo tabuľky s dátami, je multimodalita kľúčová pre plné informačné pokrytie.
Architektúra a prístupy
Existujú tri hlavné prístupy. Prvým je late fusion – modality sa spracúvajú oddelene a ich reprezentácie sa spájajú až pred generovaním. Druhým je early fusion – rôzne modality sa zakódujú do spoločného priestoru embeddingov už pri indexovaní.
Tretím prístupom je image captioning pipeline: obrázky sa automaticky popisujú textom (napr. GPT-4V), ktorý je potom indexovaný a retrievovaný rovnako ako ostatný text. Tento prístup je jednoduchý na implementáciu, ale stráca vizuálne detaily.
Praktické použitie
Multimodálne RAG je užitočné pri systémoch na analýzu technickej dokumentácie s diagramami, finančných reportoch s grafmi, medicínskom zobrazovaní alebo vzdelávacom obsahu. Modely ako GPT-4o a Claude 3 podporujú multimodálne vstupy, čo tento prístup sprístupňuje širšiemu počtu organizácií.