Що таке інференція?
Інференція (англ. inference, висновування) - це процес, під час якого навчена модель AI обробляє вхідні дані та генерує результат (відповідь, класифікацію, передбачення). Це етап "використання" моделі - на відміну від навчання, яке її створює.
Вартість та ефективність інференції
У виробничому середовищі інференція - це домінуюча вартість AI: кожне запитування = токени = плата API. Оптимізація включає: квантування (зменшення точності моделі, наприклад, з fp16 до int8 - 2 рази швидше, 2 рази дешевше), batching (групування запитувань), спекулятивне декодування (швидка модель "вгадує", велика перевіряє) і KV cache (кеширование ключів/значень для повторюваних контекстів).
Місцева інференція проти хмарної
Місцева інференція (на фірмових серверах) усуває витрати на API та проблеми з конфіденційністю, але вимагає апаратного забезпечення GPU. Хмарна інференція є гнучкою, але генерує витрати та ризики відповідності. Маршрутизація багаторівнева поєднує обидва підходи: прості запитування локально, складні в хмарі.