Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю MLOps и жизненный цикл

Data drift (дрейф данных)

Явление изменения распределения входных данных со временем, вызывающее деградацию качества предсказаний модели AI.

Что такое data drift?

Data drift (дрейф данных) — это явление постепенного изменения статистического распределения входных данных модели AI по сравнению с данными, на которых модель обучалась. Это естественное следствие изменений в реальном мире — меняется поведение клиентов, рыночные условия, сезонные тренды и даже формат исходных данных. Data drift приводит к деградации качества предсказаний, даже если сама модель не изменилась.

Виды дрейфа

Выделяют несколько типов: covariate shift (изменение распределения входных признаков), concept drift (изменение отношения между признаками и целевой переменной), prior probability shift (изменение пропорций классов) и feature drift (изменение отдельных переменных). Дрейф может быть внезапным (например, пандемия), постепенным (сезонные тренды), циклическим (выходные паттерны) или инкрементальным. Каждый тип требует своей стратегии обнаружения и реагирования.

Обнаружение и реагирование

Мониторинг data drift в производстве включает: статистические тесты (KS test, chi-square, PSI — Population Stability Index), визуализацию распределений, оповещение при превышении порогов и автоматическое переобучение. В корпоративной среде критично важно встроить мониторинг дрейфа в pipeline MLOps — каждое производственное предсказание должно оцениваться на предмет отклонения от обучающего распределения, а существенный дрейф должен запускать процесс переобучения или эскалацию.