Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю MLOps и жизненный цикл

Model serving

Процесс развёртывания и предоставления обученных моделей AI в качестве промышленных сервисов, включающий инфраструктуру, масштабирование и мониторинг.

Что такое model serving?

Model serving — это процесс предоставления обученной модели AI в виде сервиса, готового обрабатывать запросы в производственной среде. Включает не только запуск самой модели, но и инфраструктуру вокруг неё: балансировку нагрузки, автомасштабирование, версионирование моделей, мониторинг производительности и качества ответов, а также управление жизненным циклом.

Архитектура и инструменты

Современные подходы к model serving включают: REST/gRPC API — модель выставлена как HTTP-эндпоинт, batch inference — обработку больших наборов данных офлайн, и streaming — генерацию ответа токен за токеном в реальном времени. Популярные решения: vLLM, TGI (Text Generation Inference), Triton Inference Server и Ollama для локальных моделей. Ключевые метрики — задержка (p50/p95/p99), пропускная способность (токены в секунду) и доступность.

Корпоративные вызовы

В корпоративной среде model serving требует многоуровневого подхода. Система многоуровневой маршрутизации автоматически направляет запросы к подходящей модели — локальные, лёгкие модели обрабатывают простые задачи, а продвинутые облачные модели обрабатывают сложные запросы. Такая архитектура оптимизирует затраты, сокращает время ответа и обеспечивает непрерывность работы даже при сбое отдельного поставщика.