Проблема витрат на підприємстві AI
Коли десятки агентів AI обробляють тисячі запитів щодня, витрати API зростають блискавично. Одне викликання моделі преміум-класу може коштувати в 10-50 разів більше, ніж легка локальна модель. Тим не менше, більшість підприємств або направляють все через дорогий модель (спалюючи бюджет), або використовують дешеву модель для всього (жертвуючи якістю). Жоден підхід не справляється на великому масштабі.
У ESKOM AI ми вирішили цю проблему за допомогою 8-рівневого рутингу LLM, системи, яка автоматично підбирає кожен запит до найбільш оптимальної моделі, здатної його обробити. Ефект: 70% зниження витрат у порівнянні з направленням всього через модель вищого класу, без вимірного спаду якості результатів для продуктивних завдань.
Як працює 8-рівневий рутинг
Кожен вхідний запит аналізується з точки зору складності, вимог до домену та очікуваної якості відповіді, перш ніж потрапити до будь-якого LLM. Двигун рутингу враховує такі фактори, як кількість токенів, глибина розуміння, вимоги до використання інструментів та поріг якості агента, який видає завдання. Ось спрощений вигляд наших рівнів:
- Рівень 1 (Безкоштовний): легкі відкриті моделі, запущені локально. Підтримує прості класифікації, видобуток ключових слів та форматування даних. Нульові витрати API.
- Рівні 2–3 (Низька вартість): більші відкриті моделі (8B–70B параметрів) на локальному GPU. Добре підходять для резюмірів, перекладів та видобутку структурованих даних.
- Рівні 4–5 (Середній): хмарні моделі, подібні до середніх хмарних моделей. Збалансоване співвідношення вартості до продуктивності для більшості бізнес-завдань.
- Рівні 6–7 (Високий): розширені хмарні моделі. Складне мислення, багатокроковий аналіз, генерація коду.
- Рівень 8 (Преміум): преміум-моделі вищого класу. Зарезервовані для критичних рішень: правовий аналіз, фінансове моделювання, проектування архітектури, матеріали, представлені CEO.
Інтелект, що стоїть за маршрутизацією
Рішення щодо маршрутизації — це не просте пошуку ключових слів. Наш класифікатор оцінює кожне запит у багатьох вимірах: складність мислення (чи вимагає chain-of-thought?), фактична точність (чи може безпечно галюцинувати, чи мусить бути точним?), формат виводу (будь-який текст проти структурованого JSON) та бізнес-критичність (внутрішній нарис проти документа для клієнта). Сам класифікатор працює на легкій моделі, додаючи незначну затримку.
Що важливо, агенти можуть перевизначати рішення маршрутизатора. Коли наш агент CFO обробляє квартальний фінансовий звіт, завжди ескалує до рівня 7–8, незалежно від очевидної складності. Перевизначення, специфічні для домену, забезпечують, що бізнес-контекст має першочергову важливість перед алгоритмічною класифікацією.
Вимірювання того, що має значення
Ефективність маршрутизації ми відстежуємо за допомогою трьох метрик: вартість на вирішене завдання (не на виклик API), оцінка якості (людська оцінка вибірки результатів) та коефіцієнт ескалації (як часто відповідь з нижчого рівня відхиляється та перенаправляється вище). Через шість місяців у виробництві наш коефіцієнт ескалації становить менше 3%, що означає, що роутер правильно ідентифікує відповідний рівень у 97% випадків. Для підприємств, що розглядають багатомодельні стратегії, урок ясний: інтелектуальна маршрутизація не є опцією, а різницею між сталими операціями AI та витратами, що вихлюпуються з-під контролю.