Prečo je verziovanie modelov dôležité?
Verziovanie ML modelov rieši kritický problém reprodukovateľnosti a spravovateľnosti. Bez systematického verziovania čelia tímy nasledujúcim scenárom: model v produkcii funguje inak ako pri testovaní, nie je jasné, na akom datasete bol model natrénovaný, rollback na predchádzajúcu verziu je ťažký alebo nemožný.
ML verziovanie je náročnejšie ako verziovanie kódu, pretože obsahuje viac komponentov: kód, hyperparametre, trénovacie dáta A váhy modelu.
Čo verziovať?
Kód a konfigurácia: Git pre trénovací kód a hyperparametre. Dáta: DVC (Data Version Control), LakeFS alebo cloudové riešenia pre verziovanie datasetov. Artefakty: model váhy, preprocessing transformácie, feature schemas – uložené v Model Registry (MLflow, W&B Artifacts).
Experiment tracking nástroje (MLflow, Weights & Biases, Comet) automaticky zaznamenávajú hyperparametre, metriky a artefakty pre každý beh trénovania, čím vytvárajú audit trail experimentov.
Semantic versioning pre modely
Adaptácia sémantického verziovania pre ML: major verzia pri zmene architektúry alebo trénovacích dát (nekompatibilná zmena), minor pri retrainingu s novými dátami na rovnakej architektúre, patch pri finetuningu a malých zmenách. Verziovacie tagy umožňujú okamžitý rollback v produkcii.