Чому чанкинг є ключовим?
Чанкинг (сегментація документів) є фундаментальним кроком у pipeline RAG та семантичного пошуку. Моделі AI мають обмежене вікно контексту та працюють найкраще, коли отримують точні, лаконічні фрагменти інформації — не цілі документи. Спосіб поділу документу на чанки безпосередньо впливає на якість пошуку та генерованих відповідей. Занадто великі чанки містять шум, занадто малі втрачають контекст.
Стратегії чанкингу
Чанкинг за сталою довжиною — найпростіший, але ігнорує структуру тексту. Семантичний чанкинг — ділить текст на основі зміни теми (ембеддингової подібності сусідніх абзаців). Структурний чанкинг — використовує заголовки, абзаци та списки як природні межі. Рекурсивний чанкинг — намагається ділити по абзацах, потім реченнях, потім словах. Чанкинг з перекриттям — перекриваються фрагменти запобігають втраті контексту на межах. Оптимальний розмір — типово 256–1024 токенів з 20–50% перекриттям.
Чанкинг у практиці
Для бізнес-документів (звіти, угоди, процедури) найкраще працює структурний чанкинг з збереженням метаданих (назва документу, номер розділу, дата). Для таблиць — спеціалізоване парсинг, яке зберігає структуру рядків та стовпців. Для вихового коду — чанкинг за функціями та класами. Ключовим є: тестування різних стратегій на власних даних, оцінка якості пошуку (hit rate, MRR) та ітеративна оптимізація. Добрий чанкинг може покращити якість RAG на 20–40% без зміни моделі.