Деякий контент на цьому сайті був створений з допомогою штучного інтелекту
Повернутися до словника Технологія

Інференція AI

Процес генерації відповідей тренованим моделєм AI — етап виробництва, під час якого модель обробляє вхідні дані та повертає результат.

Що таке інференція?

Інференція (англ. inference, висновування) - це процес, під час якого навчена модель AI обробляє вхідні дані та генерує результат (відповідь, класифікацію, передбачення). Це етап "використання" моделі - на відміну від навчання, яке її створює.

Вартість та ефективність інференції

У виробничому середовищі інференція - це домінуюча вартість AI: кожне запитування = токени = плата API. Оптимізація включає: квантування (зменшення точності моделі, наприклад, з fp16 до int8 - 2 рази швидше, 2 рази дешевше), batching (групування запитувань), спекулятивне декодування (швидка модель "вгадує", велика перевіряє) і KV cache (кеширование ключів/значень для повторюваних контекстів).

Місцева інференція проти хмарної

Місцева інференція (на фірмових серверах) усуває витрати на API та проблеми з конфіденційністю, але вимагає апаратного забезпечення GPU. Хмарна інференція є гнучкою, але генерує витрати та ризики відповідності. Маршрутизація багаторівнева поєднує обидва підходи: прості запитування локально, складні в хмарі.