1 puntos por qlcla123 3 시간 전 | Aún no hay comentarios. | Compartir por WhatsApp

Medí la ejecución duplicada de agentes en trazas de benchmarks públicos. La forma de contarlo fue considerar los casos en que se llama dos veces a la misma herramienta con los mismos argumentos y además el resultado también es el mismo.

En 6,780 trazas aparecieron 8,042 casos, y si excluimos casi la mitad por cosas como repetir la declaración de tarea completada, quedaron 4,249 casos. Entre ellos, comparé los ID de entidad incluidos en la respuesta en 3,432 llamadas duplicadas a herramientas que cambian el estado, y se confirmó que en 159 casos realmente se crearon dos elementos. Por ejemplo, se crearon dos documentos con el mismo título o cuatro hojas de cálculo iguales.

Aquí hay una limitación clara. Todas estas cifras provienen de trazas de benchmarks. Son registros de 22 modelos resolviendo tareas, no de servicios reales en producción. Revisé ocho datasets públicos y este fue el único donde se pudo observar este fenómeno. La mayoría de los benchmarks están diseñados para calificar exactitud, así que si ocurre una duplicación, la estructura hace que cuente como respuesta incorrecta.

Por eso quiero preguntarles a quienes lo operan en la práctica.

  1. ¿Cuántas herramientas MCP (o servidores) tienen conectadas?

En los dos datasets que vimos, la tasa de duplicación difería por un factor de 3 (0.80% vs 2.41%). La cantidad de herramientas también era muy distinta, 20 frente a 523, pero como también cambiaban la naturaleza de las tareas y la composición de los modelos, no pudimos aislar si la causa era el número de herramientas.

De hecho, al dividir dentro del benchmark por la cantidad de servidores conectados a la tarea, el valor más alto apareció con 4~5 (aprox. 2.5%), y por encima de eso más bien bajaba, mostrando un patrón no monótono. No observamos una relación simple de "mientras más herramientas, más duplicación". Me interesa saber cómo es en producción real.

  1. ¿Les ha pasado una ejecución duplicada? ¿Cómo la descubrieron?

En la mayoría de los casos que vimos no hubo error. Ambas veces devolvieron 200 y los logs estaban limpios, así que no se veía al revisar solo los logs después. Da la impresión de que en la práctica muchas veces uno se entera porque lo reporta el cliente; ¿cómo ha sido en su caso?

  1. ¿Las herramientas que usan devuelven ID de entidad en la respuesta?

Ese fue el punto que separó "se llamó dos veces" de "se crearon dos cosas". La mayoría de las API de creación de documentos devuelven un ID, pero en envío de correos muchas veces solo regresan una cadena de "éxito". De los 3,197 casos donde no fue posible determinarlo, 2,011 eran de este tipo, y había 24 clases de herramientas que nunca devolvían un ID en la respuesta.

No busco una respuesta correcta, sino hacerme una idea de qué tan distintos son los benchmarks frente a la operación real. Incluso compartir su experiencia ya sería de gran ayuda.

Aún no hay comentarios.

Aún no hay comentarios.