AgentScore  favicon

AgentScore

AgentScore de Latitude évalue les agents IA en production selon le résultat, la fiabilité, le coût, la vitesse et la sécurité à partir des traces ingérées.

Code et ITCalcule un score agrégé basé sur les…Inspecte des segments spécifiques de…Met en évidence les schémas récurrents…Convertit les défaillances observées en…
AgentScore  product interface screenshot
Visites mensuelles estimées
101 k
Période des données:
Référencé sur AIToolly

Qu’est-ce que AgentScore ? Présentation du produit

Fonction du produit et positionnement officiel

AgentScore est une fonctionnalité d'évaluation au sein de la plateforme Latitude qui convertit les traces de production en un score d'évaluation unifié. Elle évalue les agents IA selon cinq dimensions clés : résultat, fiabilité, coût, vitesse et sécurité.

Plutôt que de s'appuyer sur des benchmarks synthétiques, l'outil nécessite de véritables preuves de production transmises via OpenTelemetry ou des sources de traces existantes. Pour afficher un score, un agent doit franchir des seuils prédéfinis de couverture, de trafic et de confiance sur un minimum de 1 000 sessions éligibles.

À quoi peut servir AgentScore ?

Cas d’usage étayés par les sources officielles

Évaluation de la qualité des agents en production

Les équipes ingèrent les traces de sessions en direct via OpenTelemetry pour mesurer le succès de l'agent sur cinq dimensions opérationnelles distinctes.

Analyse des défaillances et création d'évaluations

Les ingénieurs inspectent les sessions de production ayant échoué afin d'identifier les comportements indésirables récurrents et de les convertir en benchmarks d'évaluation continus.

Orientation des correctifs avec des agents de code

Les développeurs transmettent les preuves de défaillance en production aux agents de code via MCP pour implémenter des correctifs ciblés et vérifier leur impact après déploiement.

Comment utiliser AgentScore

Le parcours documenté, lorsqu’il est disponible

  1. 1

    Connecter les traces de production

    Envoyez les traces d'exécution en direct de l'agent dans Latitude manuellement via OpenTelemetry ou au moyen d'une configuration de traçage existante.

  2. 2

    Accumuler les preuves et franchir les seuils

    Laissez la plateforme collecter au moins 1 000 sessions éligibles sur une fenêtre de 7, 14, 21 ou 28 jours jusqu'à la validation des seuils de trafic, de couverture et de confiance.

  3. 3

    Inspecter les schémas de défaillance

    Examinez le score obtenu, identifiez les dimensions qui freinent les performances de l'agent et analysez en détail chaque session en échec.

  4. 4

    Transformer les échecs en évaluations

    Configurez des évaluations fondées sur les cas d'échec identifiés en production afin de surveiller le comportement de l'agent lors des sessions ultérieures.

  5. 5

    Déployer les correctifs et vérifier

    Fournissez les traces aux agents de code via MCP, déployez le code mis à jour de l'agent et mesurez l'impact sur les sessions de production suivantes.

Méthodologie de notation et seuils d'éligibilité

AgentScore s'appuie sur des critères statistiques stricts avant de publier un score. Un agent doit accumuler au minimum 1 000 sessions de production éligibles pour qu'une note puisse être calculée. Les données doivent franchir avec succès les seuils de trafic, de couverture et de confiance sur l'ensemble des cinq dimensions d'évaluation.

La notation s'effectue sur la durée en semaines complètes la plus courte (7, 14, 21 ou 28 jours) qui remplit les conditions d'éligibilité. Chaque score calculé est assorti d'un intervalle de confiance à 95 %, garantissant ainsi que l'incertitude est clairement indiquée lors de l'évaluation des performances.

  • Couvre cinq dimensions distinctes : résultat, fiabilité, coût, vitesse et sécurité.
  • Exige au moins 1 000 sessions de production éligibles pour satisfaire aux critères de données.
  • Calcule les métriques sur des fenêtres en semaines complètes de 7, 14, 21 ou 28 jours.
  • Fournit un intervalle de confiance à 95 % aux côtés du score calculé.
  • Suspend l'affichage du score lorsque les données reçues ne satisfont pas aux exigences des seuils.

Points à tester avant de choisir AgentScore

Vérifications à effectuer avec vos contenus et votre flux de travail

  • Vérifiez que l'architecture de votre application prend en charge l'envoi de traces OpenTelemetry ou l'intégration avec des données de traçage existantes.
  • Assurez-vous que votre agent génère un volume de production suffisant pour atteindre le seuil minimal d'éligibilité fixé à 1 000 sessions.
  • Vérifiez si votre flux de développement peut exploiter le protocole MCP (Model Context Protocol) pour transmettre les traces aux agents de code.
  • Examinez les exigences relatives aux seuils de couverture et de confiance sur l'ensemble des cinq dimensions avant d'escompter l'obtention d'un score.

Sources et date de vérification de AgentScore

Sources vérifiées et date de la vérification

Dernière vérification
Catégorie
Code et IT

Questions fréquentes sur AgentScore

Réponses fondées sur la fiche produit dont les sources ont été vérifiées

Quelles dimensions sont mesurées par AgentScore ?

AgentScore évalue les sessions de production selon cinq dimensions fondamentales : le résultat, la fiabilité, le coût, la vitesse et la sécurité.

Comment les traces de production sont-elles ingérées dans la plateforme ?

Les traces peuvent être connectées via OpenTelemetry, importées depuis des configurations de traçage existantes ou paramétrées à l'aide de l'instruction de compétence Latitude AI.

Quelles sont les exigences minimales d'éligibilité pour obtenir un score ?

Un agent doit accumuler au moins 1 000 sessions de production éligibles et satisfaire aux seuils de trafic, de couverture et de confiance sur l'ensemble des cinq dimensions.

Quelles fenêtres temporelles AgentScore utilise-t-il pour l'évaluation ?

AgentScore évalue les sessions sur la fenêtre en semaines complètes éligible la plus courte de 7, 14, 21 ou 28 jours répondant aux critères requis.

Comment les développeurs peuvent-ils utiliser les données d'AgentScore pour résoudre les problèmes ?

Les développeurs peuvent inspecter les sessions en échec, les convertir en évaluations et transmettre directement les données probantes aux agents de code via MCP.

Découvrez d’autres outils récemment ajoutés dans la même catégorie.