Что такое инференс?
Инференс (англ. inference, вывод) — это процесс, при котором обученная модель AI обрабатывает входные данные и генерирует результат (ответ, классификацию, предсказание). Это этап «использования» модели — в отличие от обучения, которое её создаёт.
Затраты и производительность инференса
В производственной среде инференс — доминирующая статья затрат на AI: каждый запрос = токены = плата за API. Оптимизация включает: квантование (снижение точности модели, например с fp16 до int8 — в 2 раза быстрее, в 2 раза дешевле), батчинг (группировку запросов), speculative decoding (быстрая модель «угадывает», крупная проверяет) и KV cache (кэш ключей/значений для повторяющихся контекстов).
Локальный vs облачный инференс
Локальный инференс (на корпоративных серверах) устраняет затраты на API и проблемы с конфиденциальностью, но требует оборудования GPU. Облачный инференс гибок, но создаёт затраты и риски комплаенса. Многоуровневая маршрутизация сочетает оба подхода: простые запросы локально, сложные — в облаке.