Ensemble Exploration
Lanza varios agentes sobre el mismo problema con instrucciones diferentes, compara su salida y elige un ganador.
A veces no sabes qué enfoque es mejor — LRU vs LFU vs ARC para una caché, tres estrategias de refactor distintas, dos opciones de librería competidoras. Ensemble Exploration lanza varios agentes nuevos sobre el mismo problema, cada uno con una instrucción diferente de cómo atacarlo, y te deja comparar los resultados lado a lado.
Se dispara a través de MadoAgent — le pides a MadoAgent que explore enfoques, y él decide cuándo una forma de bifurcar y comparar encaja mejor que una única tarea. Cada fork se lanza como un tile totalmente nuevo con su propio contexto independiente, así los enfoques divergentes no se contaminan entre sí.
Qué puedes hacer con esto
- Ejecutar hasta 5 forks sobre el mismo problema — cada fork recibe el prompt compartido más su propia instrucción variante.
- Mezclar tipos de agente por fork — Claude, Codex o Amp, así puedes enfrentar modelos distintos a la misma tarea.
- Comparar forks lado a lado — la vista Compare del panel de Exploration muestra la última respuesta de cada fork en un carril horizontal.
- Puntuar forks con el auto-crítico — un clic pide al crítico que puntúe cada fork de 0–10 en corrección, completitud, claridad y accionabilidad, y que nombre un fork recomendado.
- Elegir un ganador manualmente — el crítico solo asesora; seleccionar un ganador es siempre tu clic.
- Conservar ejecuciones entre relanzamientos — las ejecuciones recientes se restauran al reiniciar, así el panel sobrevive a un relanzamiento de la app.
Cómo usarlo
- Abre MadoAgent con Cmd+Shift+M (⌘⇧M).
- Pide una exploración, por ejemplo "prueba tres estrategias distintas de caché para este bug y dime cuál gana".
- MadoAgent lanza un tile por fork, cada uno con el prompt compartido más su propia instrucción variante. El cajón derecho cambia automáticamente a la pestaña Exploration para que veas la ejecución en cuanto empieza.
- Observa el punto de estado de cada fork en el panel de Exploration —
running,done,cancelledotimeout. - Cuando los forks tienen salida, haz clic en Compare para expandir un carril lado a lado con la última respuesta de cada fork.
- Opcionalmente, haz clic en Score forks para ejecutar el crítico. El crítico puntúa cada fork y destaca uno recomendado.
- Haz clic en Pick winner en el fork que quieras. La ejecución se cierra como completada y cualquier otro fork aún corriendo en esa ejecución se marca como done.
Casos de uso comunes
- "Prueba LRU, LFU y ARC para esta caché y dime cuál usar." — tres forks, un ganador, elegido tras leer la vista Compare o las puntuaciones del crítico.
- "Refactoriza este módulo de dos formas — extraer una clase vs dividir en módulos — y compara." — dos forks con estrategias de refactor distintas.
- "Enfrenta a Claude y Codex en la misma tarea." — dos forks, uno por tipo de agente, para ver qué modelo maneja mejor la tarea.
Consejos y buenas prácticas
- Limita los forks a lo que realmente puedas comparar. Tres a cinco es el punto óptimo; con más de cinco la vista Compare se vuelve difícil de recorrer.
- Usa el crítico como desempate, no como decisor. Lee la vista Compare tú mismo antes de hacer clic en Pick winner — el crítico puede equivocarse.
- Los forks sin salida todavía son saltados por el crítico, así que espera a que los forks produzcan algo antes de puntuar.
- Descartar una ejecución cancela los forks que sigan corriendo en lugar de dejarlos marcados como
runningpara siempre.
Funciones relacionadas
- MadoAgent — el panel donde lanzas ejecuciones ensemble.
- Cajón derecho — la pestaña de Exploration donde se muestran las ejecuciones y los forks.
- Orchestrator Mode — para un único worker headless en lugar de varios forks.
- Configuración — el proveedor de IA que usa el crítico.
Limitaciones
- Los forks están limitados a 5 por ejecución. Pedir más rechaza toda la llamada en lugar de truncarla silenciosamente.
- El crítico solo asesora — nunca fija un ganador. MadoHub no elige un ganador automáticamente.
- El crítico usa el nivel de modelo más barato/rápido de tu proveedor de IA configurado, así que su juicio es tan bueno como ese modelo.
- Las ejecuciones ensemble persisten durante los últimos 7 días (limitadas a 20 ejecuciones) — las más antiguas van caducando.