Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника MLOps та життєвий цикл

Анотація даних (Data Labeling)

Процес позначення тренувальних даних мітками, необхідний для тренування моделей наглядового навчання.

Що таке анотація даних?

Анотація даних (data labeling) — це процес присвоєння міток, категорій або маркерів суровим даним — тексту, зображенням, аудіо чи відео — щоб вони могли служити тренувальними даними для моделей навчання з учителем. Це фундаментальна основа більшості систем штучного інтелекту: якість анотації безпосередньо визначає якість моделі. Процес включає визначення схеми анотації, маркування даних анотаторами та контроль якості міток.

Методи та інструменти

Анотація може здійснюватися вручну (експерти домену), напівавтоматично (AI-допоміжне маркування — модель пропонує, людина верифікує) або програмно (слабкий нагляд, функції маркування). Типи анотації включають: класифікацію тексту (настрій, наміри), розпізнавання сутностей (NER), сегментування зображень, обмежувальні рамки, транскрипцію аудіо та анотацію відносин. Підприємницькі інструменти (Label Studio, Prodigy, Scale AI) підтримують робочий процес із контролем якості та управлінням анотаторами.

Підприємницькі виклики

Ключові виклики включають: забезпечення узгодженості між анотаторами (узгодженість анотаторів), масштабування процесу при великих наборах даних, управління якістю (золоті набори, аудит вибірки), захист чутливих даних під час анотації, а також вартість — експертна анотація дорога, але дешева анотація генерує шум. Стратегія активного навчання оптимізує вартість, спрямовуючи на анотацію найбільш цінні зразки для моделі.