Què és el servei de models?
El servei de models (Model Serving) es refereix a la infraestructura, l'arquitectura i els processos necessaris per desplegar models ML entrenats com a serveis de producció fiables. Va molt més enllà de simplement carregar un model i inclou escalada, optimització de latència, monitoratge i confiabilitat operativa.
Arquitectures de servei
Les aproximacions comunes inclouen serveis API REST, punts finals gRPC per a alt rendiment, servei per lots per a inferència offline i servei en streaming per a processament continu de dades. Estructures com TensorFlow Serving, TorchServe, Triton Inference Server i KServe ofereixen infraestructura de servei especialitzada. Són especialment importants l'autoescalada, les proves A/B i els desplegaments canari.
Consideracions de producció
Per a un servei de models empresarial són crucials els requisits de SLA (latència, disponibilitat), l'optimització de costos mitjançant escalada intel·ligent, l'emmagatzematge en caché i el batch de models, així com un monitoratge i alertes robustos. El servei amb GPU requereix especial atenció quant a utilització de recursos i costos.