AgentScore
AgentScore de Latitude evalúa agentes de IA en producción en función de resultado, fiabilidad, coste, velocidad y seguridad mediante trazas ingeridas.
AgentScore de Latitude evalúa agentes de IA en producción en función de resultado, fiabilidad, coste, velocidad y seguridad mediante trazas ingeridas.
Qué hace el producto y cómo se presenta oficialmente
AgentScore es una función de evaluación integrada en la plataforma Latitude que convierte trazas de producción en una puntuación de evaluación unificada. Evalúa agentes de IA en cinco dimensiones clave: resultado, fiabilidad, coste, velocidad y seguridad.
En lugar de depender de pruebas sintéticas, la herramienta requiere evidencia real de producción enviada mediante OpenTelemetry o fuentes de trazas existentes. Para mostrar una puntuación, el agente debe superar umbrales predefinidos de cobertura, tráfico y confianza en un mínimo de 1000 sesiones elegibles.
Casos de uso respaldados por fuentes oficiales
Los equipos ingieren trazas de sesiones en vivo mediante OpenTelemetry para medir el éxito del agente en cinco dimensiones operativas diferenciadas.
Los ingenieros inspeccionan sesiones de producción fallidas para identificar patrones de comportamiento negativos y convertirlos en bancos de pruebas continuos.
Los desarrolladores suministran evidencia de fallos de producción a agentes de programación a través de MCP para aplicar correcciones de código dirigidas y verificar su impacto tras el despliegue.
El proceso documentado, cuando está disponible
Envíe trazas de ejecución de agentes en vivo a Latitude de forma manual mediante OpenTelemetry o a través de una configuración de rastreo existente.
Deje que la plataforma recopile al menos 1000 sesiones elegibles durante un período de 7, 14, 21 o 28 días hasta que se superen los filtros de tráfico, cobertura y confianza.
Revise la puntuación resultante, determine qué dimensiones están limitando el rendimiento del agente y profundice en las sesiones individuales fallidas.
Configure evaluaciones a partir de los casos de fallo identificados en producción para supervisar el comportamiento del agente en sesiones posteriores.
Proporcione la evidencia de las trazas a agentes de programación mediante MCP, despliegue el código actualizado del agente y supervise su impacto en sesiones posteriores de producción.
AgentScore se basa en criterios estadísticos rigurosos antes de proporcionar una puntuación. Un agente debe acumular un mínimo de 1000 sesiones de producción elegibles para que se pueda calcular una puntuación. La evidencia recabada debe superar filtros de tráfico, cobertura y confianza en las cinco dimensiones de evaluación.
La puntuación se calcula sobre el período más corto de semanas completas (7, 14, 21 o 28 días) que satisfaga los requisitos de elegibilidad. Cada puntuación calculada va acompañada de un intervalo de confianza del 95 %, lo que garantiza que la incertidumbre quede reflejada con claridad al evaluar el rendimiento.
Comprobaciones con tus propios materiales y flujo de trabajo
Qué fuentes se revisaron y cuándo
Respuestas basadas en el registro de producto con fuentes verificadas
AgentScore evalúa las sesiones de producción a través de cinco dimensiones fundamentales: resultado, fiabilidad, coste, velocidad y seguridad.
Las trazas pueden conectarse mediante OpenTelemetry, importarse desde configuraciones de rastreo existentes o configurarse con el prompt de habilidades de Latitude AI.
Un agente debe acumular al menos 1000 sesiones de producción elegibles y satisfacer los filtros de tráfico, cobertura y confianza en las cinco dimensiones.
AgentScore evalúa las sesiones a lo largo del período elegible más corto compuesto por semanas completas de 7, 14, 21 o 28 días que cumpla con los requisitos.
Los desarrolladores pueden inspeccionar sesiones fallidas, convertirlas en evaluaciones y transmitir la evidencia directamente a agentes de programación mediante MCP.