Опубликовано: 26 июля 2026 г.3 мин

World Model Optimizer: снижение стоимости AI-агентов на 40% без потери качества

Experientiallabs представила инструмент с открытым исходным кодом World Model Optimizer для оптимизации работы AI-агентов, позволяющий снизить затраты на инференс LLM до 40%.

World Model Optimizer: снижение стоимости AI-агентов на 40% без потери качества

Experientiallabs представила инструмент с открытым исходным кодом World Model Optimizer (WMO), предназначенный для оптимизации работы AI-агентов. Главная цель проекта — дать командам возможность радикально сократить расходы на инференс LLM, сохранив качество ответов на уровне лучших фронтирных моделей. WMO решает эту задачу за счет умной маршрутизации запросов, дистилляции знаний в более легкие модели и симуляции окружения для тестирования.

Как работает умная маршрутизация запросов

WMO использует уже собранные трейсы OpenTelemetry (OTel) для анализа того, какие задачи решает агент. На основе этих данных инструмент строит политику маршрутизации: простые запросы направляются быстрым и дешевым моделям, а сложные — фронтирным, но только когда это действительно оправдано.

Базовый цикл работы:

  • Импорт логов: wmo build --file traces.jsonl --name my-endpoint
  • Прогон моделей и замер качества: wmo optimize route sweep my-endpoint --traces traces.otel.jsonl
  • Построение политики маршрутизации: wmo optimize route fit matrix.json --kind knn
  • Запуск эндпоинта: wmo serve --name my-endpoint

Это позволяет получить экономию «из коробки»: по заявлениям команды, снижение затрат достигает 40% и более. Для отчетности доступна команда сравнения с выбранным бейзлайном.

Мир-модели как безопасная песочница для тестов

Одна из ключевых возможностей WMO — встроенные мир-модели. Это симуляции среды, в которой работает агент. Разработчик может тестировать изменения промптов, тулов и политик без необходимости совершать реальные вызовы API и тратить реальные деньги.

Мир-модель работает как сессия, в которую можно направлять действия агента и получать наблюдения. Она доступна как через Python API (классы Action, сессии), так и по HTTP. Это позволяет быстро развернуть песочницу для десятков параллельных тестов.

Оптимизация харнеса агента через E2B

WMO выходит за рамки простой маршрутизации. Он способен оптимизировать сам код запуска агента (харнес), включая промпты, инструменты и логику принятия решений. Для этого используется бэкенд E2B, запускающий изолированные песочницы.

Команда wmo optimize harness my-agent my-environment --backend e2b запускает цикл, в котором сотни кандидатов параллельно выполняют задачи в симулированном мире. Оптимизатор автоматически отбирает изменения, проходящие оценку, и сохраняет их как новую версию champion-харнеса. Долгие задачи можно запускать в фоне с возможностью переподключения.

Практические шаги, конфиденциальность и планы

Инструмент написан на Python (почти 98% кодовой базы) и устанавливается через pip: pip install world-model-optimizer. В разработке участвуют четыре контрибьютора, а у репозитория на GitHub уже 114 звезд. На данный момент выпущена версия v0.2.0.

WMO собирает анонимную телеметрию об использовании (без промптов, данных или имен моделей). Ее можно отключить в настройках проекта командой wmo config telemetry disable или переменной окружения DO_NOT_TRACK=1. Также доступна хостинговая версия на платформе разработчика, которая управляет учетными данными моделей и песочницами E2B, упрощая корпоративное внедрение.

Источник: https://github.com/experientiallabs/world-model-optimizer

Поделиться

Обсудить с ИИ

Комментарии(0)

Оставьте комментарий

Войдите, чтобы присоединиться к обсуждению

Читайте также