BlogPerformance
Performance4 min de lectura· 18 de junio de 2026

Profiling de latencia para workflows de agentes

Carolina Fogliato

Publicado 18 de junio de 2026

Un agente lento es un agente que nadie usa. Así se hace profiling de latencia de agentes y se encuentra lo que de verdad vale la pena arreglar.

Un agente lento es un agente que nadie usa. El fix no es un modelo más rápido — es hacer profiling del workflow para encontrar el único stage que de verdad vale la pena arreglar.

La latencia de un agente rara vez es uniforme. Un workflow es una cadena — llamadas al modelo, retrievals, tool calls, handoffs — y un stage usualmente domina. El profiling es cómo encuentras ese stage en vez de adivinar.

Uso del tiempo: perfila antes de optimizar

La disciplina: mide adónde va el tiempo antes de cambiar nada. Un perfil del workflow — cada stage, su duración, su share del total — es lo que convierte "es lento" en "el stage X es el 60% de la latencia." Sin el perfil, cada optimización es una adivinanza.

  • Mide la duración de cada stage.
  • Calcula el share de cada stage del total.
  • Arregla el stage dominante primero.

El árbol de problemas: dónde vive la latencia

  • Llamadas al modelo. Frecuentemente el share más grande — y el más optimizable (caching, batching, modelo más pequeño).
  • Retrieval. Usualmente barato, hasta que no lo es (corpus grande, filtros complejos).
  • Tool calls. Latencia externa que no controlas, frecuentemente el stage dominante oculto.
  • Handoffs. Usualmente barato, pero serialización y red pueden dominar a escala.

Qué arreglar primero

Arregla el stage dominante, no el fácil. Una optimización del 5% en el stage dominante le gana a una del 50% en uno menor. El perfil es lo que te dice cuál es cuál — y la mayoría de equipos optimizan el stage con el que se sienten cómodos, no el que importa.

Qué rechazar

  • Optimizar sin un perfil.
  • Optimizar la llamada al modelo cuando un tool call es el stage dominante.
  • Optimizar para latencia promedio cuando el problema es la cola.

Conclusión

La latencia de un agente es una cadena, y un stage usualmente domina. Perfila antes de optimizar, arregla el stage dominante primero, y rechaza optimizar sin medición. La ganancia más rápida es casi siempre la que el perfil señala.

Sobre FACTA

FACTA ayuda a startups y equipos en etapa de crecimiento a convertir la IA en sistemas de producción que siguen funcionando — no demos que impresionan una vez.

Diseñamos la arquitectura alrededor de las partes que realmente fallan bajo uso real: herramientas que tú controlas, credenciales que tú gestionas, failover, controles de costo, observabilidad. La infraestructura aburrida que mantiene vivo un sistema después del lanzamiento.

Liderado por Matías Baglieri y Carolina Fogliato, nos enfocamos en una sola cosa:

Liderazgo de IA que construye. No solo asesora.

Cuéntanos la latencia percibida de tu agente.

Te decimos cómo hacerle profiling y qué stage arreglar. Ve batching de llamadas de agentes para una ganancia común.

Explora la automatización de IA
Agenda una llamada de 30 minutos →

Sin pitch. Sin presión. Solo un vistazo a dónde frágil es tu stack de IA — y qué arreglar primero.

Mantente al tanto

Recibe insights de IA en producción en tu inbox

Insights semanales. Nada de spam. Cancela cuando quieras.

Tu Privacidad Importa

Usamos cookies para mejorar tu experiencia, analizar el tráfico y mostrar anuncios personalizados.

Al hacer clic en "Aceptar Todo", consientes el uso de todas las cookies. Política de Cookies