Некоторый контент на этом сайте был создан с помощью AI
Вернуться в блог Технологии

8-уровневый роутинг LLM: как мы снизили затраты на AI на 70%

Zespół ESKOM.AI 2026-03-05 Время чтения: 6 min

Проблема затрат в enterprise AI

Когда десятки AI-агентов обрабатывают тысячи запросов ежедневно, затраты на API растут стремительно. Один вызов премиальной модели высшего класса может стоить в 10–50 раз больше, чем лёгкая локальная модель. Тем не менее большинство предприятий либо направляет всё через дорогую модель (сжигая бюджет), либо использует дешёвую модель для всего (жертвуя качеством). Ни один из подходов не работает в большом масштабе.

В ESKOM AI мы решили эту проблему с помощью 8-уровневого роутинга LLM — системы, которая автоматически сопоставляет каждый запрос с наиболее выгодной моделью, способной его обработать. Результат: снижение затрат на 70% по сравнению с направлением всего через модель высшего класса, без измеримого снижения качества результатов для продакшен-задач.

Как работает 8-уровневый роутинг

Каждый входящий запрос анализируется на предмет сложности, доменных требований и ожидаемого качества ответа, прежде чем попасть к какому-либо LLM. Движок роутинга учитывает такие факторы, как количество токенов, глубина рассуждений, требования к использованию инструментов и порог качества запрашивающего агента. Вот упрощённый вид наших уровней:

  • Уровень 1 (Бесплатный): лёгкие модели с открытым исходным кодом, запущенные локально. Обрабатывает простые классификации, извлечение ключевых слов и форматирование данных. Нулевая стоимость API.
  • Уровни 2–3 (Низкая стоимость): более крупные модели с открытым исходным кодом (8B–70B параметров) на локальном GPU. Хороши для резюмирования, перевода и извлечения структурированных данных.
  • Уровни 4–5 (Средний): облачные модели, такие как облачные модели среднего класса. Сбалансированное соотношение затрат и производительности для большинства бизнес-задач.
  • Уровни 6–7 (Высокий): продвинутые облачные модели. Сложные рассуждения, многоэтапный анализ, генерация кода.
  • Уровень 8 (Премиум): премиальные модели высшего класса. Зарезервированы для критических решений: юридический анализ, финансовое моделирование, проектирование архитектуры, материалы, представляемые CEO.

Интеллект за роутингом

Решение о роутинге – это не простой поиск по ключевым словам. Наш классификатор оценивает каждый запрос по нескольким измерениям: сложность рассуждений (требует ли chain-of-thought?), фактическая точность (может ли безопасно галлюцинировать или должен быть точным?), формат вывода (произвольный текст vs. структурированный JSON) и бизнес-критичность (внутренний черновик vs. документ для клиента). Сам классификатор работает на лёгкой модели, добавляя пренебрежимо малую задержку.

Важно, что агенты могут переопределять решения роутера. Когда наш агент CFO обрабатывает квартальный финансовый отчёт, он всегда эскалирует до уровня 7–8, независимо от кажущейся сложности. Специфичные для домена переопределения обеспечивают, что бизнес-контекст имеет приоритет перед алгоритмической классификацией.

Измерение того, что важно

Эффективность роутинга мы отслеживаем с помощью трёх метрик: стоимость на решённую задачу (а не на вызов API), оценка качества (человеческая оценка выборки результатов) и коэффициент эскалации (как часто ответ с более низкого уровня отклоняется и направляется выше). После шести месяцев в продакшене наш коэффициент эскалации составляет менее 3%, что означает, что роутер правильно определяет нужный уровень в 97% случаев. Для предприятий, рассматривающих мультимодельные стратегии, урок ясен: интеллектуальный роутинг – это не опция, а разница между сбалансированными операциями AI и выходящими из-под контроля затратами.

#LLM #cost optimization #routing

У вас похожая проблема с приложением?

Запишитесь на бесплатную 30-минутную консультацию — без обязательств. Покажем, как сделать это быстрее и дешевле с AI.

Записаться на бесплатную консультацию

Каждый месяц: как компании модернизируют софт с AI

Конкретика, без жаргона. Ноль спама — отписаться можно в один клик.

Free checklist: Is your legacy application a good candidate for AI modernization?