Un agente lento es un agente que nadie usa. El fix no es un modelo más rápido — es hacer profiling del workflow para encontrar el único stage que de verdad vale la pena arreglar.
La latencia de un agente rara vez es uniforme. Un workflow es una cadena — llamadas al modelo, retrievals, tool calls, handoffs — y un stage usualmente domina. El profiling es cómo encuentras ese stage en vez de adivinar.
Uso del tiempo: perfila antes de optimizar
La disciplina: mide adónde va el tiempo antes de cambiar nada. Un perfil del workflow — cada stage, su duración, su share del total — es lo que convierte "es lento" en "el stage X es el 60% de la latencia." Sin el perfil, cada optimización es una adivinanza.
- Mide la duración de cada stage.
- Calcula el share de cada stage del total.
- Arregla el stage dominante primero.
El árbol de problemas: dónde vive la latencia
- Llamadas al modelo. Frecuentemente el share más grande — y el más optimizable (caching, batching, modelo más pequeño).
- Retrieval. Usualmente barato, hasta que no lo es (corpus grande, filtros complejos).
- Tool calls. Latencia externa que no controlas, frecuentemente el stage dominante oculto.
- Handoffs. Usualmente barato, pero serialización y red pueden dominar a escala.
Qué arreglar primero
Arregla el stage dominante, no el fácil. Una optimización del 5% en el stage dominante le gana a una del 50% en uno menor. El perfil es lo que te dice cuál es cuál — y la mayoría de equipos optimizan el stage con el que se sienten cómodos, no el que importa.
Qué rechazar
- Optimizar sin un perfil.
- Optimizar la llamada al modelo cuando un tool call es el stage dominante.
- Optimizar para latencia promedio cuando el problema es la cola.
Conclusión
La latencia de un agente es una cadena, y un stage usualmente domina. Perfila antes de optimizar, arregla el stage dominante primero, y rechaza optimizar sin medición. La ganancia más rápida es casi siempre la que el perfil señala.
Sobre FACTA
FACTA ayuda a startups y equipos en etapa de crecimiento a convertir la IA en sistemas de producción que siguen funcionando — no demos que impresionan una vez.
Diseñamos la arquitectura alrededor de las partes que realmente fallan bajo uso real: herramientas que tú controlas, credenciales que tú gestionas, failover, controles de costo, observabilidad. La infraestructura aburrida que mantiene vivo un sistema después del lanzamiento.
Liderado por Matías Baglieri y Carolina Fogliato, nos enfocamos en una sola cosa:
Liderazgo de IA que construye. No solo asesora.
Cuéntanos la latencia percibida de tu agente.
Te decimos cómo hacerle profiling y qué stage arreglar. Ve batching de llamadas de agentes para una ganancia común.
Explora la automatización de IA
