Что такое model serving?
Model serving — это процесс предоставления обученной модели AI в виде сервиса, готового обрабатывать запросы в производственной среде. Включает не только запуск самой модели, но и инфраструктуру вокруг неё: балансировку нагрузки, автомасштабирование, версионирование моделей, мониторинг производительности и качества ответов, а также управление жизненным циклом.
Архитектура и инструменты
Современные подходы к model serving включают: REST/gRPC API — модель выставлена как HTTP-эндпоинт, batch inference — обработку больших наборов данных офлайн, и streaming — генерацию ответа токен за токеном в реальном времени. Популярные решения: vLLM, TGI (Text Generation Inference), Triton Inference Server и Ollama для локальных моделей. Ключевые метрики — задержка (p50/p95/p99), пропускная способность (токены в секунду) и доступность.
Корпоративные вызовы
В корпоративной среде model serving требует многоуровневого подхода. Система многоуровневой маршрутизации автоматически направляет запросы к подходящей модели — локальные, лёгкие модели обрабатывают простые задачи, а продвинутые облачные модели обрабатывают сложные запросы. Такая архитектура оптимизирует затраты, сокращает время ответа и обеспечивает непрерывность работы даже при сбое отдельного поставщика.