Zer da modeloen zerbitzua?
Modeloen zerbitzua (Model Serving) azpiegitura, arkitektura eta prozesu beharrezkoak dira entrenatutako ML modeloak ekoizpeneko zerbitzu fidagarri gisa desplegatzeko. Modelo bat kargatzea baino askoz harago doa eta eskalaketa, latentzia optimizazioa, monitoreoa eta operatiboa fidagarritasuna barne hartzen ditu.
Zerbitzu arkitekturak
Ohikoak diren ikuspegiak API REST zerbitzuak, gRPC endpointak errendimendu handirako, offline inferentziarako batch zerbitzua eta datuak prozesatzeko jarraian zerbitzua dira. TensorFlow Serving, TorchServe, Triton Inference Server eta KServe bezalako framework-ek espezializatutako zerbitzu azpiegitura eskaintzen dute. Autoeskala, A/B probak eta kanari despliegua oso garrantzitsuak dira.
Ekoizpen kontsiderazioak
Modeloen zerbitzu korporatibo baterako SLA (latentzia, erabilgarritasun) eskakizunak, kostuak optimizatzea inteligentez eskalatzea, cache gordetzea eta modeloen batch-ak, baita monitoreo eta alertak robustoak ere, oso garrantzitsuak dira. GPU-rekin zerbitzatzeak bereziki arreta berezia eskatzen du baliabideen erabilpen eta kostuen aldetan.