Что такое data drift?
Data drift (дрейф данных) — это явление постепенного изменения статистического распределения входных данных модели AI по сравнению с данными, на которых модель обучалась. Это естественное следствие изменений в реальном мире — меняется поведение клиентов, рыночные условия, сезонные тренды и даже формат исходных данных. Data drift приводит к деградации качества предсказаний, даже если сама модель не изменилась.
Виды дрейфа
Выделяют несколько типов: covariate shift (изменение распределения входных признаков), concept drift (изменение отношения между признаками и целевой переменной), prior probability shift (изменение пропорций классов) и feature drift (изменение отдельных переменных). Дрейф может быть внезапным (например, пандемия), постепенным (сезонные тренды), циклическим (выходные паттерны) или инкрементальным. Каждый тип требует своей стратегии обнаружения и реагирования.
Обнаружение и реагирование
Мониторинг data drift в производстве включает: статистические тесты (KS test, chi-square, PSI — Population Stability Index), визуализацию распределений, оповещение при превышении порогов и автоматическое переобучение. В корпоративной среде критично важно встроить мониторинг дрейфа в pipeline MLOps — каждое производственное предсказание должно оцениваться на предмет отклонения от обучающего распределения, а существенный дрейф должен запускать процесс переобучения или эскалацию.