Сократите расходы на ИИ с помощью Auto Router от AI Gateway
- Cloudflare выпустила Auto Router в открытой бета-версии через AI Gateway; сервис автоматически выбирает подходящую модель, а во время бета-тестирования бесплатен.
- В испытаниях OpenCode расходы снизились на 30% по сравнению с использованием только передовых моделей.
- В тесте 291 задачи Auto Router выполнил успешно 86,6% испытаний при общих расходах $2,10; Claude Opus — 96,6% при $5,91.
Почему это важно: Маршрутизация должна сокращать расходы на задачи, которым не нужны передовые модели, сохраняя доступ к ним для более сложной работы.
В беседах с компаниями на разных этапах внедрения ИИ мы заметили несколько типичных закономерностей. Сначала наступает период экспериментов: вы подключаете каждый новый инструмент, свободно раздаёте ключи API и позволяете токенам расходоваться. Затем выбираете основные инструменты для своей организации: для агентного программирования, нетехнических рабочих процессов, запуска и развертывания агентов. По мере того как компании систематизируют внедрение ИИ, они хотят контролировать расходы пользователей на токены и управлять ими, но одних бюджетов и правил недостаточно. Самая эффективная экономия — та, которую пользователи даже не замечают.
Сегодня мы выпускаем Auto Router от Cloudflare в открытой бета-версии — он доступен через AI Gateway. Укажите модель cloudflare/auto, и Auto Router будет автоматически направлять каждый запрос модели, возможностей которой достаточно для выполнения задачи. Пользователю при этом не придётся выбирать модель. По результатам первых внутренних испытаний Auto Router в нашей среде OpenCode, расходы снизились на 30% по сравнению с использованием только передовых моделей, таких как OpenAI Sol и Anthropic Claude Opus.
Зачем мы это создали
Опираясь на собственный опыт отслеживания расходов на ИИ в Cloudflare, мы поняли, что для управления затратами нужен комплексный подход. Ранее мы рассказывали как устанавливать бюджеты и лимиты расходов на ИИ, а также как видеть, кто именно тратит средства в вашей организации, связывая сотрудников с использованием ими ИИ.
Во многих средах, включая OpenCode, Claude Code и Codex, пользователи по-прежнему выбирают модели вручную. Разумеется, задачи бывают разными, и нередко пользователи выбирают модели с избыточными для работы возможностями. Например, чтобы обобщить электронное письмо или переписку в чате, не нужен интеллект уровня Opus. Но вы вряд ли захотите полностью закрыть доступ к этой модели для команды, занимающейся разработкой систем безопасности.
Наша цель — сделать AI Gateway центром управления для организаций, которые внедряют ИИ внутри компании. Поскольку через него уже проходят все запросы пользователей, агентов и инструментов, AI Gateway может не только наблюдать за происходящим и обеспечивать соблюдение правил. Бюджеты, лимиты расходов и аналитика с учетом идентификационных данных обеспечивают организациям прозрачность и защитные механизмы, но по-прежнему требуют, чтобы пользователи принимали взвешенные с точки зрения затрат решения по каждому запросу. Следующий шаг — поручить самому шлюзу принимать разумные решения от имени пользователя: направлять каждый запрос модели, возможностей которой достаточно для выполнения задачи. Так организации смогут автоматически сокращать расходы, а пользователи сохранят доступ к самым мощным моделям, когда их работа действительно этого потребует.
Результаты
Мы используем Auto Router внутри Cloudflare в развертывании OpenCode и в Cloudflare OS — нашей собственной среде для запуска агентов. Внутренние испытания показали, что при выполнении задач по программированию результаты сопоставимы с результатами передовых моделей.
Лучше всего Auto Router проявляет себя при работе с широким кругом задач интеллектуального труда — например, таких, какие обычно встречаются в крупных организациях, где взаимодействуют технические и нетехнические команды. Мы сравнили cloudflare/auto с GPT-6 Sol от OpenAI и Claude Opus 5.5 от Anthropic на нашем внутреннем тесте общих знаний и рабочих задач. Для тестирования используются имитации инструментов рабочей среды, охватывающие повседневные задачи с электронной почтой, календарями, Slack, файлами, поездками и финансами. Для выполнения каждой задачи модель должна воспользоваться этими инструментами, чтобы выдать результат, который можно проверить, или совершить действие.
Модель | Успешные испытания | Доля успешных испытаний | Общие расходы | Стоимость успешного испытания |
cloudflare/auto | 252/291 | 86,6% (+6,2/−6,9 п. п.) | 2,10 доллара | 0,0084 доллара |
Anthropic Claude Opus 5.5 | 281/291 | 96,6% (+2,7/−3,8 п. п.) | 5,91 доллара | 0,0210 доллара |
OpenAI GPT-6 Sol | 245/291 | 84,2% (+6,5/−6,9 п. п.) | 2,64 доллара | 0,0108 доллара |
97 задач, по три образца для каждой модели на каждую задачу. Значения в скобках — 95%-ные доверительные интервалы, рассчитанные на основе 10 000 повторных выборок задач методом бутстрепа с сохранением всех трёх повторений для каждой задачи. «п. п.» означает «процентных пункта».
По результатам работы Auto Router оказался сопоставим с другими передовыми моделями для повседневных задач: его стоимость составила 80% от стоимости Sol и 35% от стоимости Opus. На первый взгляд это может показаться неожиданным, но проблему, которую решает маршрутизатор моделей, можно объяснить через «зубчатую границу» возможностей разных моделей. Способность решить ту или иную задачу часто обнаруживается где-то в этом наборе моделей; задача маршрутизатора — выбрать подходящую модель для каждой задачи, учитывая баланс качества и цены. Экономия достигается за счет того, что за задачи, не требующие передовых моделей, не приходится платить по максимальным тарифам. Чем больше у вас таких задач, тем заметнее экономия.
Еще один вывод: низкая цена токенов не всегда означает меньшие расходы в итоге. Модель, которая на бумаге кажется дешевле, может использовать непропорционально больше токенов для решения задачи. Маршрутизатор должен минимизировать прогнозируемую стоимость выполнения задачи, а не просто распределять нагрузку, ориентируясь на цену за миллион токенов.
Уже сейчас это полезно, но это лишь начало того, чему Auto Router может научиться благодаря положению Cloudflare в цепочке обработки запросов к моделям.
Как это работает

Когда вы отправляете запрос в cloudflare/auto, AI Gateway сначала формирует список моделей, которые могут его обработать. Он исключает модели, не поддерживающие формат запроса или режим выполнения, а также учитывает учетные данные, настройки оплаты, политики контроля доступа и лимиты расходов, заданные для шлюза. Во время сбоев он также исключает неисправных поставщиков услуг и модели, а после устранения сбоя автоматически возвращает их в список.
Для оставшихся кандидатов маршрутизатор анализирует сжатое представление разговора. Он рассматривает последние сообщения, отдавая приоритет самым свежим репликам. Затем разговор передается модели классификации с несколькими головами, работающей на Workers AI и развернутой на графических процессорах в нашей периферийной сети. Классификатор выдает два набора сигналов. Сначала он оценивает вероятность принадлежности задачи к одной из 14 категорий (например, программирование, планирование, исследование или анализ данных). Затем оценивает запрос по четырем параметрам по шкале от одного до пяти: сложность, неоднозначность, значимость последствий и зависимость от предыдущего контекста.
Отдельная матрица оценок объединяет эти сигналы с результатами тестирования моделей, чтобы определить, насколько каждая модель подходит для запроса. Для настройки матрицы мы задали предпочтительную модель для набора примеров задач и уровней сложности, а затем скорректировали веса так, чтобы получить нужный выбор.
Наконец, маршрутизатор сопоставляет ожидаемое качество с ценами на входные и выходные токены каждой модели. Для простых запросов цена имеет больший вес, поэтому может выиграть менее крупная модель, если ее возможностей достаточно. По мере роста сложности штраф за стоимость снижается, и у более мощных моделей появляется больше шансов на победу. В упрощенном виде cloudflare/auto выбирает модель с наибольшей полезностью, определяемой следующим образом:
utility = expected quality - adaptive cost penaltyВ длительных агентных сессиях, например при отладке или программировании, на расходы влияет не столько базовая цена модели, сколько стоимость чтения кэша, которая растет вместе с продолжительностью сессии. При переключении модели кэш теряется, и новой модели приходится заново записывать весь контекст. Это может быть оправданно: модель с более низкой стоимостью чтения и записи кэша может быстро компенсировать затраты на повторную запись.
Auto Router не избегает переключения моделей полностью, а учитывает стоимость чтения и записи кэша. В пределах одного шага (цикла пользовательского ввода) кэш остается активным, и переключение редко оказывается выгодным, поэтому лучше продолжать использовать ту же модель. Между шагами Auto Router применяет штраф за переключение, который растет вместе с количеством токенов в контексте. Модель, у которой для сессии еще хранится активный кэш, оценивается по более низкой ставке за его чтение. Для любого другого кандидата учитывается полная стоимость повторной записи контекста. Поэтому чем длиннее разговор, тем больше выгоды должно принести переключение — за счет более качественных результатов при меньшем общем числе токенов или более дешевого повторного чтения кэша. Переключение моделей влечет и другие затраты: большинство моделей не умеют читать токены рассуждений другой модели, поэтому после переключения и потери этих токенов новой модели, возможно, придется заново выполнить рассуждения, оплачивая их по тарифу на выходные токены. В будущем мы хотим учесть это и при переключении отдавать предпочтение моделям из того же семейства.
После этого маршрутизатор возвращает ранжированный список. AI Gateway сначала пробует модель, занявшую первое место, а если поставщик не может обработать запрос — переключается на другую подходящую модель.
Такая архитектура имеет несколько преимуществ. Двухэтапная схема (классификатор задач и параметров, за которым следует матрица оценок) делает решения маршрутизатора прозрачными: можно проверить прогнозируемую категорию и сложность каждой задачи и понять, как они повлияли на выбор модели. Кроме того, при выпуске новой модели перенастраивать маршрутизатор не требуется — достаточно добавить в матрицу оценок веса, рассчитанные по результатам ее тестирования. Тот же классификатор может поддерживать разные профили маршрутизации. Например, помимо cloudflare/auto, в будущем мы планируем выпустить и другие маршрутизаторы, в том числе cloudflare/auto-best. Он использует тот же классификатор и тот же набор моделей, но выбирает модель с наивысшим ожидаемым качеством, не учитывая компромисс между качеством и стоимостью.
Что дальше
Сегодняшний выпуск — лишь отправная точка. Мы продолжим инвестировать в исследования и разработку новых стратегий маршрутизации. В ближайшее время мы планируем:
- Расширить список моделей, доступных через cloudflare/auto
- Учитывать требования к нулевому хранению данных при фильтрации моделей
- Учитывать возможности поставщиков услуг при выборе моделей
- Выбирать подходящий уровень рассуждений или обдумывания для каждого запроса
- Добавить полную поддержку Responses API и WebSockets
- Изучить структурированные модели принятия решений для первичной классификации
В период бета-тестирования Auto Router предоставляется бесплатно. Подробнее — в нашей документации для разработчиков.
Благодарности: этот проект стал возможен также благодаря усилиям Mats Dodd, Sam Scott, Oliver Yu и Jeff Rafter.
Cloudflare Blog прочитано 747 раз
