Čo je model serving?
Model serving je infraštruktúrna vrstva, ktorá premosťuje natrénovaný ML model a koncových používateľov alebo aplikácie. Zahŕňa vystavenie modelu ako služby, ktorá dokáže efektívne spracovávať požiadavky – či už v reálnom čase (online serving) alebo dávkovo (batch serving).
Kvalita servingu priamo ovplyvňuje používateľský zážitok: vysoká latencia alebo nespoľahlivosť predikcií môže zrušiť prínosy vynikajúceho modelu.
Architektúry servingu
REST API serving je najjednoduchší prístup – model je zabalený do HTTP endpointu. Pokročilejšie systémy používajú model serving frameworky ako TensorFlow Serving, Triton Inference Server alebo TorchServe, ktoré poskytujú optimalizovanú inferenciu, batching, model versioning a A/B testovanie.
Serverless inference (napr. AWS Lambda, Google Cloud Functions) znižuje operačné náklady pre sporadické použitie, zatiaľ čo dedicated GPU instances sú vhodnejšie pre vysoko vyťažené produkcie.
Výzvy a optimalizácie
Kľúčové metriky sú latencia (p50, p95, p99), priepustnosť (requests/s) a dostupnosť. Optimalizačné techniky zahŕňajú model quantization, caching predikcií, dynamický batching a hardware acceleration. Pri rozsiahlom nasadení sa používajú kontajnery (Docker) a Kubernetes pre škálovanie a rezilienciu.