Некоторый контент на этом сайте был создан с помощью AI
Вернуться к словарю Технологии

Инференс AI

Процесс генерации ответа обученной моделью AI — производственный этап, на котором модель обрабатывает входные данные и возвращает результат.

Что такое инференс?

Инференс (англ. inference, вывод) — это процесс, при котором обученная модель AI обрабатывает входные данные и генерирует результат (ответ, классификацию, предсказание). Это этап «использования» модели — в отличие от обучения, которое её создаёт.

Затраты и производительность инференса

В производственной среде инференс — доминирующая статья затрат на AI: каждый запрос = токены = плата за API. Оптимизация включает: квантование (снижение точности модели, например с fp16 до int8 — в 2 раза быстрее, в 2 раза дешевле), батчинг (группировку запросов), speculative decoding (быстрая модель «угадывает», крупная проверяет) и KV cache (кэш ключей/значений для повторяющихся контекстов).

Локальный vs облачный инференс

Локальный инференс (на корпоративных серверах) устраняет затраты на API и проблемы с конфиденциальностью, но требует оборудования GPU. Облачный инференс гибок, но создаёт затраты и риски комплаенса. Многоуровневая маршрутизация сочетает оба подхода: простые запросы локально, сложные — в облаке.

Связанные услуги и продукты