Prečo záleží na chunkingu
Chunking dokumentov je proces delenia dokumentov na menšie, sémanticky zmysluplné segmenty pre ukladanie vo vektorových databázach a vyhľadávanie AI systémami. Je to kritický, ale často podceňovaný krok pri budovaní RAG pipeline. Kvalita chunkingu priamo ovplyvňuje presnosť vyhľadávania: príliš veľké chunky znižujú relevanciu, zatiaľ čo príliš malé chunky strácajú dôležitý kontext.
Stratégie chunkingu
Chunking pevnej veľkosti rozdelí text v pravidelných intervaloch znakov alebo tokenov. Rekurzívne delenie znakov rozdelí text na prirodzených hraniciach (odseky, vety). Sémantický chunking využíva podobnosť embeddingov na zoskupovanie súvisiaceho obsahu. Chunking s povedomím o štruktúre dokumentu rešpektuje nadpisy, sekcie a formátovanie na zachovanie organizačnej logiky autora.
Optimalizačné techniky
Prekrytie po sebe nasledujúcich chunkov zabezpečuje, že koncepty presahujúce hranice chunkov nie sú stratené — typicky funguje dobre 10–20 % prekrytie. Obohatenie metadát pripája názvy sekcií, zdroj dokumentu a čísla strán ku každému chunku pre lepšie filtrovanie.