Časť obsahu tejto stránky bola vytvorená s pomocou AI
Späť na slovník MLOps & Zivotny cyklus

Nasadzovanie modelov (Model Serving)

Model serving je proces sprístupnenia natrénovaných ML modelov pre reálne použitie prostredníctvom API alebo iných rozhraní, ktoré umožňujú reálny čas alebo dávkové predikcie.

Čo je model serving?

Model serving je infraštruktúrna vrstva, ktorá premosťuje natrénovaný ML model a koncových používateľov alebo aplikácie. Zahŕňa vystavenie modelu ako služby, ktorá dokáže efektívne spracovávať požiadavky – či už v reálnom čase (online serving) alebo dávkovo (batch serving).

Kvalita servingu priamo ovplyvňuje používateľský zážitok: vysoká latencia alebo nespoľahlivosť predikcií môže zrušiť prínosy vynikajúceho modelu.

Architektúry servingu

REST API serving je najjednoduchší prístup – model je zabalený do HTTP endpointu. Pokročilejšie systémy používajú model serving frameworky ako TensorFlow Serving, Triton Inference Server alebo TorchServe, ktoré poskytujú optimalizovanú inferenciu, batching, model versioning a A/B testovanie.

Serverless inference (napr. AWS Lambda, Google Cloud Functions) znižuje operačné náklady pre sporadické použitie, zatiaľ čo dedicated GPU instances sú vhodnejšie pre vysoko vyťažené produkcie.

Výzvy a optimalizácie

Kľúčové metriky sú latencia (p50, p95, p99), priepustnosť (requests/s) a dostupnosť. Optimalizačné techniky zahŕňajú model quantization, caching predikcií, dynamický batching a hardware acceleration. Pri rozsiahlom nasadení sa používajú kontajnery (Docker) a Kubernetes pre škálovanie a rezilienciu.