4 min de lectura

World Model Optimizer busca calidad de vanguardia a menor costo

World Model Optimizer convierte trazas de agentes en endpoints enrutados más económicos, entornos simulados, modelos destilados y arneses optimizados.

Imagen: Hacker News

World Model Optimizer (WMO) es una herramienta de código abierto para convertir trazas de agentes existentes en endpoints de modelo que mejoran de forma continua. El proyecto afirma que su enfoque de enrutamiento puede ofrecer un rendimiento de calidad de vanguardia a un costo un 40% o más inferior, y que luego puede mejorar aún más mediante simulaciones del modelo de mundo, optimización del arnés y destilación de modelos.

Enrutamiento y destilación de modelos

Después de registrar proveedores de modelos, los desarrolladores pueden crear un endpoint a partir de trazas de OpenTelemetry:

''bash pip install world-model-optimizer wmo providers set wmo build --file traces.jsonl --name my-endpoint ''

WMO evalúa los modelos registrados frente a tareas retenidas de esas trazas y luego ajusta los resultados en una política de enrutamiento. El kit de herramientas admite varias estrategias de enrutamiento, incluida una política de k-vecinos más cercanos (KNN):

Recomendado

Wattage coloca los costes de tokens de agentes de IA tras una puerta de CI

''bash wmo optimize route sweep my-endpoint --traces traces.otel.jsonl wmo optimize route fit matrix.json --kind knn \\ --out .wmo/models/my-endpoint/policy.json wmo serve --name my-endpoint ''

Un comando de informes compara el endpoint optimizado con una línea base existente, como gpt-5.5:

''bash wmo optimize route report matrix.json .wmo/models/my-endpoint/policy.json \\ --baseline gpt-5.5 ''

Los usuarios también pueden destilar un modelo más pequeño en el grupo de proveedores con wmo optimize model, anclar (pin) un único modelo sin enrutamiento mediante wmo optimize route pin, u optimizar el arnés de un agente con wmo optimize harness.

Modelos de mundo y agentes alojados

El paquete incluye modelos de mundo que simulan entornos de agentes para pruebas y optimización. Una integración en Python puede crear una sesión, enviar una llamada a una herramienta e inspeccionar la observación resultante:

'''python from wmo import Action, ActionKind from wmo.config.store import WorldModelStore from wmo.engine.loader import load_world_model

model_dir = WorldModelStore(“.wmo”).resolve(“airline”) wm, _provider = load_world_model(model_dir) session = wm.new_session(task=“check out the cart”) obs = wm.step(session.id, Action( kind=ActionKind.TOOL_CALL, name=“add_to_cart”, arguments={“sku”: “A1”}, )) print(obs.content) '''

La misma funcionalidad está disponible por HTTP a través de /world_models, /world_models/{name}/sessions y /world_models/{name}/sessions/{id}/step.

WMO también ofrece una plataforma alojada en platform.experientiallabs.ai. Tras ejecutar wmo login, los desarrolladores pueden lanzar un modelo de mundo alojado o el arnés campeón actual de un agente con wmo run. Los agentes alojados se ejecutan en sandboxes E2B gestionadas por la plataforma, por lo que no se requieren claves de API de modelos locales para las ejecuciones alojadas.

La subida del espacio de trabajo es optativa con -u. WMO sincroniza cambios en vivo mientras preserva las ediciones locales concurrentes, y los agentes de larga ejecución pueden desacoplarse, recibir mensajes, volverse a adjuntar o finalizarse:

''bash wmo run <agent-id> -u . --detach wmo run --send “Now run the full test suite” wmo run --attach wmo run --end ''

Evaluación y telemetría

Para la optimización local en E2B, los usuarios instalan la dependencia opcional y proporcionan una clave E2B:

''bash pip install “world-model-optimizer[e2b]” export E2B_API_KEY=… wmo optimize harness my-agent my-environment --tasks tasks.jsonl --backend e2b ''

WMO puede ejecutar el worker pi real dentro de sandboxes E2B aisladas mientras el modelo de mundo suministra el entorno. Las ejecuciones de optimización y evaluación se ejecutan en paralelo, y el optimizador puede modificar indicaciones, herramientas, políticas, habilidades y código en tiempo de ejecución. Las candidaturas se evalúan frente a las mismas tareas simuladas; solo aquellas que superan las puertas de evaluación se convierten en el nuevo arnés campeón versionado.

El proyecto habilita la telemetría de uso anónima por defecto, limitada a metadatos sobre el volumen de uso. Indica que la telemetría no incluye indicaciones, trazas, acciones, observaciones, rutas de archivo, nombres de modelos, credenciales de proveedores ni contenido bruto de usuario. Los usuarios pueden desactivarla por proyecto con:

''bash uv run wmo config telemetry disable ''

La configuración puede volver a habilitarse o comprobarse con los comandos enable y status correspondientes, mientras que DO_NOT_TRACK=1 o WMO_TELEMETRY=0 deshabilitan la telemetría para un proceso.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

/ Sigue leyendo