Los benchmarks de frameworks de agentes engañan porque miden lo equivocado — throughput en una tarea sintética que no matchea la tuya. Los benchmarks que importan son los de tu workflow.
Los benchmarks públicos de agentes miden lo que es fácil medir: throughput, latencia en una tarea estándar, conteo de estrellas. Rara vez miden lo que decide tu decisión: cómo se comporta el framework en la forma, estado y modos de fallo de tu workflow.
Medición del proceso: qué benchmarkear
Benchmarkea en tu workflow, no en la tarea estándar:
- Latencia en tu workflow. No una tarea sintética.
- Fit de representación de estado. ¿El framework representa tu estado limpio?
- Manejo de fallos. Qué pasa cuando una llamada falla, en cada framework.
- Costo de mantenimiento. Cuánto del framework tienes que aprender y ownear.
El ROI del benchmark correcto
El benchmark correcto es una pregunta de ROI: ¿qué framework produce más valor por unidad de tu tiempo de ingeniería? Un framework más rápido en un benchmark sintético pero más difícil de mantener es una pérdida neta. El benchmark que captura esto es el que compara tu workflow, tu estado, tus modos de fallo — en dos frameworks, en un prototype.
- Prototypea tu workflow en dos frameworks.
- Mide latencia, fit de estado, manejo de fallos y tu tiempo.
- Elige por el prototype, no por la tabla comparativa.
Qué hacen mal los benchmarks públicos
- Miden tareas sintéticas, no tu workflow.
- Miden throughput, no el costo de tu tiempo.
- Ignoran el manejo de fallos, que es donde los frameworks divergen en producción.
- Ignoran el mantenimiento, que es donde vive el costo real.
Qué rechazar
- Elegir por un benchmark público.
- Elegir por conteo de estrellas o actividad en GitHub.
- Elegir sin un prototype en dos frameworks.
- Elegir sin medir tu propio tiempo.
Conclusión
Los benchmarks de frameworks de agentes engañan cuando miden tareas sintéticas. El benchmark que importa es un prototype de tu workflow en dos frameworks, medido en latencia, fit de estado, manejo de fallos y tu tiempo. Elige por eso.
Sobre FACTA
FACTA ayuda a startups y equipos en etapa de crecimiento a convertir la IA en sistemas de producción que siguen funcionando — no demos que impresionan una vez.
Diseñamos la arquitectura alrededor de las partes que realmente fallan bajo uso real: herramientas que tú controlas, credenciales que tú gestionas, failover, controles de costo, observabilidad. La infraestructura aburrida que mantiene vivo un sistema después del lanzamiento.
Liderado por Matías Baglieri y Carolina Fogliato, nos enfocamos en una sola cosa:
Liderazgo de IA que construye. No solo asesora.
Cuéntanos tu workflow y te decimos los dos frameworks a prototypear.
Ve gestión de estado para la dimensión que más importa.
Explora la automatización de IA
