Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Технологія

Чанкинг (сегментація документів)

Chunking - це процес розподілу документів на менші фрагменти (чанки) оптимальні для обробки моделями AI та векторним пошуком.

Чому чанкинг є ключовим?

Чанкинг (сегментація документів) є фундаментальним кроком у pipeline RAG та семантичного пошуку. Моделі AI мають обмежене вікно контексту та працюють найкраще, коли отримують точні, лаконічні фрагменти інформації — не цілі документи. Спосіб поділу документу на чанки безпосередньо впливає на якість пошуку та генерованих відповідей. Занадто великі чанки містять шум, занадто малі втрачають контекст.

Стратегії чанкингу

Чанкинг за сталою довжиною — найпростіший, але ігнорує структуру тексту. Семантичний чанкинг — ділить текст на основі зміни теми (ембеддингової подібності сусідніх абзаців). Структурний чанкинг — використовує заголовки, абзаци та списки як природні межі. Рекурсивний чанкинг — намагається ділити по абзацах, потім реченнях, потім словах. Чанкинг з перекриттям — перекриваються фрагменти запобігають втраті контексту на межах. Оптимальний розмір — типово 256–1024 токенів з 20–50% перекриттям.

Чанкинг у практиці

Для бізнес-документів (звіти, угоди, процедури) найкраще працює структурний чанкинг з збереженням метаданих (назва документу, номер розділу, дата). Для таблиць — спеціалізоване парсинг, яке зберігає структуру рядків та стовпців. Для вихового коду — чанкинг за функціями та класами. Ключовим є: тестування різних стратегій на власних даних, оцінка якості пошуку (hit rate, MRR) та ітеративна оптимізація. Добрий чанкинг може покращити якість RAG на 20–40% без зміни моделі.