Parte do contido deste sitio creouse con asistencia de IA
Volver ao glosario mlops

Servizo de Modelos

A infraestrutura e os procesos para despregar modelos ML como servizos de produción para inferencia en tempo real.

¿O que é o servizo de modelos?

O servizo de modelos (Model Serving) refírese á infraestrutura, a arquitectura e os procesos necesarios para despregar modelos ML entrenados como servizos de produción confiables. Va moito máis alá de simplemente cargar un modelo e inclúe escalado, optimización de latencia, monitoreo e confiabilidade operativa.

Arquitecturas de servizo

Os enfoques comúns inclúen servizos API REST, endpoints gRPC para alto rendemento, serving por lotes para inferencia offline e serving en streaming para procesamento continuo de datos. Frameworks como TensorFlow Serving, TorchServe, Triton Inference Server e KServe ofrecen infraestrutura de serving especializada. Son especialmente importantes o autoescalado, as probas A/B e os despregamentos canary.

Consideracións de produción

Para un servizo de modelos empresarial son cruciais os requisitos de SLA (latencia, dispoñibilidade), a optimización de custos mediante escalado intelixente, o almacenamento en caché e o batching de modelos, así como un monitoreo e alertas robustos. O serving con GPU requiere especial atención en canto a utilización de recursos e custos.