• 6 min de lectura
Walsh coloca un gestor de riesgo con capacidad de veto sobre cuatro agentes de trading
Walsh combina cuatro agentes de análisis de acciones con un gestor de riesgo con capacidad de veto, pero su backtest de 2023 devolvió 75,52% frente al 119,75% de comprar y mantener.

Imagen: Hacker News
Walsh enruta cada ticker a través de cuatro agentes de investigación en paralelo —Fundamental, Técnico, Sentimiento y Macro— antes de que un Gestor de Cartera, ponderado por confianza, sintetice sus señales. Un Gestor de Riesgo separado y basado en reglas tiene la última palabra: puede aprobar la decisión, degradarla o vetar la operación por completo.
El proyecto está disponible en GitHub, con un panel en vivo en walsh-demo.vercel.app y una segunda demo en demo-cyan-delta.vercel.app. El panel contiene cinco ejecuciones pre-generadas: AAPL fue aprobado como COMPRA tras el acuerdo de los cuatro agentes; MSFT fue vetado porque Fundamental devolvió VENTA mientras Técnico devolvió COMPRA FUERTE; NVDA produjo una COMPRA FUERTE aprobada; TSLA fue vetado tras posiciones opuestas de Fundamental y Técnico; y META fue vetado porque la volatilidad anualizada alcanzó 76%, por encima del tope de riesgo del 40%.
Cómo Walsh toma y filtra decisiones
El orquestador usa asyncio.gather para ejecutar los agentes concurrentemente. Cada uno produce un AgentThesis, que el Gestor de Cartera convierte en una PortfolioDecision usando puntuaciones numéricas de señal ponderadas por confianza.

Recomendado
Empresa emergente apunta a Nvidia con servidor de IA de 128TB
Los cuatro agentes usan entradas diferentes:
- Analista Fundamental: ratio PER, crecimiento de ingresos, margen de beneficio y deuda sobre patrimonio. Un PER por debajo de 15 añade un voto alcista, mientras que un PER por encima de 30 añade uno bajista. El crecimiento de ingresos por encima del 15% y márgenes de beneficio por encima del 20% añaden cada uno votos alcistas.
- Analista Técnico: cruces de medias móviles simples (SMA) de 20 y 50 días, dirección del histograma MACD y una bandera opcional de golden-cross. La versión de backtest, en cambio, usa momentum realizado de 20 y 50 días a partir de datos de yfinance.
- Analista de Sentimiento: puntuaciones de sentimiento de noticias y redes sociales que varían de −1 a +1, combinadas con un bonus por compras de insider. La confianza se reduce cuando el sentimiento está cerca de neutral.
- Analista Macro: crecimiento del PIB, la tasa de los fondos federales, inflación y perspectiva sectorial. Crecimiento por encima del 2,5%, tasas por debajo del 4%, inflación por debajo del 3% y un sector alcista cuentan como condiciones favorables.
El Gestor de Cartera reduce la confianza cuando los agentes discrepan. Su fórmula es confianza × max(0,5, 1 − spread × 0,1), donde spread es la diferencia entre la señal más alta y la más baja de los agentes. Una brecha de cuatro puntos —desde COMPRA FUERTE hasta VENTA FUERTE— por tanto reduce la confianza a la mitad.
El Gestor de Riesgo aplica dos vetos duros: confianza por debajo del 45% fuerza un MANTENER, y un spread de agente de 4 o más veta la decisión por desacuerdo extremo. Una regla más suave degrada COMPRA FUERTE a COMPRA, o VENTA FUERTE a VENTA, cuando la confianza cae entre el 45% y el 65%. Las decisiones que no activan ninguna regla pasan con “Sin alertas de riesgo.”
Resultados del backtest de 2023
El backtest determinista de Walsh cubrió AAPL, MSFT y NVDA desde enero de 2023 hasta diciembre de 2023, usando 100.000$ de capital inicial y aplicación estricta de no-lookahead. Rindió menos que comprar y mantener con igual ponderación durante el período alcista:
| Métrica | Pipeline de Walsh | Comprar y mantener (ponderación igual) | |---|---:|---:| | Rentabilidad total | +75,52% | +119,75% | | Ratio de Sharpe | 2,36 | 2,86 | | Máxima caída | −13,50% | −13,22% | | Tasa de aciertos | 76,2% | — | | Valor final | $175.518 | $219.749 |
La pipeline salió de todas las posiciones en octubre de 2023 después de que las señales de momentum se debilitaran, permaneció en efectivo durante el resto del mes y perdió un posterior rally de recuperación de NVDA. El repositorio describe eso como el comportamiento de puerta de riesgo intencionado en un periodo de alta incertidumbre, pero el resultado expone el coste de umbrales conservadores en un mercado con tendencia.
Los números del backtest no provienen de los agentes con LLM mostrados en el panel. Usan agentes deterministas basados en reglas, incluidos cruces de SMA, momentum y señales de reversión a la media. Un atenuador de volatilidad (vol_cap=40% en backtest/engine.py) también redujo la asignación de NVDA durante gran parte del año porque su volatilidad realizada fue aproximadamente del 70–90%. El MeanReversionSignalAgent emitió señales de VENTA cuando las acciones alcanzaron máximos de 52 semanas, lo que dañó aún más el rendimiento. La estimación documentada de Walsh es que la estrategia quedó por detrás del passive buy-and-hold por unos 44 puntos porcentuales.
Modos de fallo conocidos y evaluación incompleta
La suite adversarial del repositorio contiene 18 casos de prueba en tres tipos de agentes, con cinco señalados por exceso de confianza. Los ejemplos incluyen:
- Señales técnicas reportando 0,80 de confianza en precios zigzag donde SMA20 y SMA50 deberían cancelarse en gran medida.
- Una señal alcista obsoleta tras un crash pronunciado porque las medias móviles quedan rezagadas respecto al mercado.
- Un salto diario del 50% que produce una COMPRA FUERTE con 0,80 de confianza.
- Precios negativos que generan una señal de momentum confiada porque la validación de entradas no rechaza datos corruptos.
- Un agente de reversión a la media reportando 0,76 de confianza para un precio situado en el medio de su rango de 52 semanas.
Varias métricas siguen sin estar disponibles. La exactitud por agente y la calibración de confianza requieren al menos 50 ejecuciones completadas de la pipeline con datos de precios de seguimiento. Las cifras de coste y latencia se rellenarán solo después de que los agentes soportados por LLM sustituyan a los stubs basados en reglas actuales. Walsh tampoco tiene integración con datos de mercado en vivo: el orquestador actualmente apunta al endpoint simulado api.finance.example.com.
El proyecto requiere Python 3.11+ y una clave de API de Anthropic para sus agentes con LLM, aunque el backtest y la evaluación adversarial no llaman a la API de Anthropic. Los comandos principales incluyen python -m backtest.engine --tickers AAPL,MSFT,NVDA --start 2023-01-01 --end 2024-01-01, python -m eval.adversarial, y python -m orchestrator.main AAPL.
AI Editor
Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.
vía Hacker News


