AgentScore  favicon

AgentScore

AgentScore de Latitude evalúa agentes de IA en producción en función de resultado, fiabilidad, coste, velocidad y seguridad mediante trazas ingeridas.

Código e ITCalcula una puntuación agregada basada…Inspecciona tramos específicos de…Detecta patrones de fallos recurrentes…Convierte fallos observados en…
AgentScore  product interface screenshot
Visitas mensuales estimadas
101 mil
Periodo de datos:
Publicado en AIToolly

¿Qué es AgentScore ? Descripción del producto

Qué hace el producto y cómo se presenta oficialmente

AgentScore es una función de evaluación integrada en la plataforma Latitude que convierte trazas de producción en una puntuación de evaluación unificada. Evalúa agentes de IA en cinco dimensiones clave: resultado, fiabilidad, coste, velocidad y seguridad.

En lugar de depender de pruebas sintéticas, la herramienta requiere evidencia real de producción enviada mediante OpenTelemetry o fuentes de trazas existentes. Para mostrar una puntuación, el agente debe superar umbrales predefinidos de cobertura, tráfico y confianza en un mínimo de 1000 sesiones elegibles.

¿Para qué se puede usar AgentScore ?

Casos de uso respaldados por fuentes oficiales

Evaluación de la calidad de agentes en producción

Los equipos ingieren trazas de sesiones en vivo mediante OpenTelemetry para medir el éxito del agente en cinco dimensiones operativas diferenciadas.

Análisis de fallos y creación de evaluaciones

Los ingenieros inspeccionan sesiones de producción fallidas para identificar patrones de comportamiento negativos y convertirlos en bancos de pruebas continuos.

Orientación de correcciones con agentes de programación

Los desarrolladores suministran evidencia de fallos de producción a agentes de programación a través de MCP para aplicar correcciones de código dirigidas y verificar su impacto tras el despliegue.

Cómo usar AgentScore

El proceso documentado, cuando está disponible

  1. 1

    Conectar trazas de producción

    Envíe trazas de ejecución de agentes en vivo a Latitude de forma manual mediante OpenTelemetry o a través de una configuración de rastreo existente.

  2. 2

    Acumular evidencia y cumplir los filtros

    Deje que la plataforma recopile al menos 1000 sesiones elegibles durante un período de 7, 14, 21 o 28 días hasta que se superen los filtros de tráfico, cobertura y confianza.

  3. 3

    Inspeccionar patrones de fallos

    Revise la puntuación resultante, determine qué dimensiones están limitando el rendimiento del agente y profundice en las sesiones individuales fallidas.

  4. 4

    Transformar fallos en evaluaciones

    Configure evaluaciones a partir de los casos de fallo identificados en producción para supervisar el comportamiento del agente en sesiones posteriores.

  5. 5

    Publicar correcciones y verificar

    Proporcione la evidencia de las trazas a agentes de programación mediante MCP, despliegue el código actualizado del agente y supervise su impacto en sesiones posteriores de producción.

Metodología de puntuación y filtros de elegibilidad

AgentScore se basa en criterios estadísticos rigurosos antes de proporcionar una puntuación. Un agente debe acumular un mínimo de 1000 sesiones de producción elegibles para que se pueda calcular una puntuación. La evidencia recabada debe superar filtros de tráfico, cobertura y confianza en las cinco dimensiones de evaluación.

La puntuación se calcula sobre el período más corto de semanas completas (7, 14, 21 o 28 días) que satisfaga los requisitos de elegibilidad. Cada puntuación calculada va acompañada de un intervalo de confianza del 95 %, lo que garantiza que la incertidumbre quede reflejada con claridad al evaluar el rendimiento.

  • Abarca cinco dimensiones diferenciadas: resultado, fiabilidad, coste, velocidad y seguridad.
  • Requiere al menos 1000 sesiones de producción elegibles para cumplir con los filtros de datos.
  • Calcula métricas a lo largo de ventanas de semanas completas de 7, 14, 21 o 28 días.
  • Proporciona un intervalo de confianza del 95 % junto con la puntuación calculada.
  • Inhabilita la generación de puntuaciones cuando la evidencia recibida no satisface los requisitos de los filtros.

Qué probar antes de elegir AgentScore

Comprobaciones con tus propios materiales y flujo de trabajo

  • Confirme que la arquitectura de su aplicación admita el envío de trazas de OpenTelemetry o la integración con datos de trazas existentes.
  • Verifique que su agente genere el volumen suficiente en producción para alcanzar el umbral mínimo de elegibilidad de 1000 sesiones.
  • Compruebe si su flujo de trabajo de desarrollo puede aprovechar Model Context Protocol (MCP) para transferir evidencia de trazas a agentes de programación.
  • Revise los requisitos de los filtros de cobertura y confianza en las cinco dimensiones de evaluación antes de esperar una puntuación.

Fuentes y fecha de revisión de AgentScore

Qué fuentes se revisaron y cuándo

Última comprobación
Categoría
Código e IT

Preguntas frecuentes sobre AgentScore

Respuestas basadas en el registro de producto con fuentes verificadas

¿Qué dimensiones mide AgentScore?

AgentScore evalúa las sesiones de producción a través de cinco dimensiones fundamentales: resultado, fiabilidad, coste, velocidad y seguridad.

¿Cómo se ingieren las trazas de producción en la plataforma?

Las trazas pueden conectarse mediante OpenTelemetry, importarse desde configuraciones de rastreo existentes o configurarse con el prompt de habilidades de Latitude AI.

¿Cuáles son los requisitos mínimos de elegibilidad para recibir una puntuación?

Un agente debe acumular al menos 1000 sesiones de producción elegibles y satisfacer los filtros de tráfico, cobertura y confianza en las cinco dimensiones.

¿Qué períodos de tiempo utiliza AgentScore para la evaluación?

AgentScore evalúa las sesiones a lo largo del período elegible más corto compuesto por semanas completas de 7, 14, 21 o 28 días que cumpla con los requisitos.

¿Cómo pueden los desarrolladores utilizar la evidencia de AgentScore para resolver problemas?

Los desarrolladores pueden inspeccionar sesiones fallidas, convertirlas en evaluaciones y transmitir la evidencia directamente a agentes de programación mediante MCP.

Explora otras herramientas añadidas recientemente en la misma categoría.