AgentScore
AgentScore de Latitude évalue les agents IA en production selon le résultat, la fiabilité, le coût, la vitesse et la sécurité à partir des traces ingérées.
AgentScore de Latitude évalue les agents IA en production selon le résultat, la fiabilité, le coût, la vitesse et la sécurité à partir des traces ingérées.
Fonction du produit et positionnement officiel
AgentScore est une fonctionnalité d'évaluation au sein de la plateforme Latitude qui convertit les traces de production en un score d'évaluation unifié. Elle évalue les agents IA selon cinq dimensions clés : résultat, fiabilité, coût, vitesse et sécurité.
Plutôt que de s'appuyer sur des benchmarks synthétiques, l'outil nécessite de véritables preuves de production transmises via OpenTelemetry ou des sources de traces existantes. Pour afficher un score, un agent doit franchir des seuils prédéfinis de couverture, de trafic et de confiance sur un minimum de 1 000 sessions éligibles.
Cas d’usage étayés par les sources officielles
Les équipes ingèrent les traces de sessions en direct via OpenTelemetry pour mesurer le succès de l'agent sur cinq dimensions opérationnelles distinctes.
Les ingénieurs inspectent les sessions de production ayant échoué afin d'identifier les comportements indésirables récurrents et de les convertir en benchmarks d'évaluation continus.
Les développeurs transmettent les preuves de défaillance en production aux agents de code via MCP pour implémenter des correctifs ciblés et vérifier leur impact après déploiement.
Le parcours documenté, lorsqu’il est disponible
Envoyez les traces d'exécution en direct de l'agent dans Latitude manuellement via OpenTelemetry ou au moyen d'une configuration de traçage existante.
Laissez la plateforme collecter au moins 1 000 sessions éligibles sur une fenêtre de 7, 14, 21 ou 28 jours jusqu'à la validation des seuils de trafic, de couverture et de confiance.
Examinez le score obtenu, identifiez les dimensions qui freinent les performances de l'agent et analysez en détail chaque session en échec.
Configurez des évaluations fondées sur les cas d'échec identifiés en production afin de surveiller le comportement de l'agent lors des sessions ultérieures.
Fournissez les traces aux agents de code via MCP, déployez le code mis à jour de l'agent et mesurez l'impact sur les sessions de production suivantes.
AgentScore s'appuie sur des critères statistiques stricts avant de publier un score. Un agent doit accumuler au minimum 1 000 sessions de production éligibles pour qu'une note puisse être calculée. Les données doivent franchir avec succès les seuils de trafic, de couverture et de confiance sur l'ensemble des cinq dimensions d'évaluation.
La notation s'effectue sur la durée en semaines complètes la plus courte (7, 14, 21 ou 28 jours) qui remplit les conditions d'éligibilité. Chaque score calculé est assorti d'un intervalle de confiance à 95 %, garantissant ainsi que l'incertitude est clairement indiquée lors de l'évaluation des performances.
Vérifications à effectuer avec vos contenus et votre flux de travail
Sources vérifiées et date de la vérification
Réponses fondées sur la fiche produit dont les sources ont été vérifiées
AgentScore évalue les sessions de production selon cinq dimensions fondamentales : le résultat, la fiabilité, le coût, la vitesse et la sécurité.
Les traces peuvent être connectées via OpenTelemetry, importées depuis des configurations de traçage existantes ou paramétrées à l'aide de l'instruction de compétence Latitude AI.
Un agent doit accumuler au moins 1 000 sessions de production éligibles et satisfaire aux seuils de trafic, de couverture et de confiance sur l'ensemble des cinq dimensions.
AgentScore évalue les sessions sur la fenêtre en semaines complètes éligible la plus courte de 7, 14, 21 ou 28 jours répondant aux critères requis.
Les développeurs peuvent inspecter les sessions en échec, les convertir en évaluations et transmettre directement les données probantes aux agents de code via MCP.