AgentScore
AgentScore von Latitude bewertet produktive KI-Agenten anhand erfasster Traces in den Bereichen Ergebnis, Zuverlässigkeit, Kosten, Geschwindigkeit und Sicherheit.
AgentScore von Latitude bewertet produktive KI-Agenten anhand erfasster Traces in den Bereichen Ergebnis, Zuverlässigkeit, Kosten, Geschwindigkeit und Sicherheit.
Funktion und offizielle Positionierung des Produkts
AgentScore ist eine Evaluierungsfunktion innerhalb der Latitude-Plattform, die produktive Traces in einen einheitlichen Evaluierungswert umwandelt. Sie bewertet KI-Agenten anhand von fünf zentralen Dimensionen: Ergebnis, Zuverlässigkeit, Kosten, Geschwindigkeit und Sicherheit.
Statt sich auf synthetische Benchmarks zu stützen, setzt das Tool reale Nachweise aus der Produktion voraus, die über OpenTelemetry oder bestehende Trace-Quellen übermittelt werden. Um einen Score anzuzeigen, muss ein Agent vordefinierte Schwellenwerte für Abdeckung, Traffic und Konfidenz bei mindestens 1.000 zulässigen Sitzungen erreichen.
Durch offizielle Quellen belegte Anwendungsfälle
Teams erfassen Live-Sitzungs-Traces über OpenTelemetry, um den Erfolg von Agenten über fünf verschiedene operative Dimensionen hinweg zu messen.
Ingenieure untersuchen fehlgeschlagene Produktionssitzungen, um negative Verhaltensmuster zu identifizieren und in fortlaufende Evaluierungs-Benchmarks umzuwandeln.
Entwickler übergeben Nachweise über Produktionsfehler via MCP an Coding-Agenten, um gezielte Code-Korrekturen vorzunehmen und deren Wirkung nach dem Release zu überprüfen.
Der dokumentierte Ablauf, sofern verfügbar
Übertragen Sie Live-Ausführungs-Traces von Agenten manuell über OpenTelemetry oder über ein bestehendes Tracing-Setup an Latitude.
Lassen Sie die Plattform mindestens 1.000 zulässige Sitzungen über ein Zeitfenster von 7, 14, 21 oder 28 Tagen erfassen, bis die Traffic-, Abdeckungs- und Konfidenz-Gates bestanden sind.
Prüfen Sie den resultierenden Score, identifizieren Sie Dimensionen, welche die Leistung des Agenten beeinträchtigen, und analysieren Sie einzelne fehlgeschlagene Sitzungen im Detail.
Konfigurieren Sie Evaluierungen auf Grundlage identifizierter Produktionsfehler, um das Agentenverhalten in nachfolgenden Sitzungen zu überwachen.
Stellen Sie Coding-Agenten via MCP Trace-Nachweise bereit, rollen Sie den aktualisierten Agenten-Code aus und verfolgen Sie die Auswirkungen auf künftige Produktionssitzungen.
AgentScore setzt auf strikte statistische Kriterien, bevor ein Score ausgegeben wird. Ein Agent muss mindestens 1.000 zulässige Produktionssitzungen ansammeln, bevor eine Berechnung erfolgen kann. Die Nachweise müssen zudem Traffic-, Abdeckungs- und Konfidenz-Gates über alle fünf Evaluierungsdimensionen hinweg bestehen.
Die Bewertung erfolgt über den kürzesten ganzwöchigen Zeitraum (7, 14, 21 oder 28 Tage), der die Zulassungskriterien erfüllt. Jeder ermittelte Score wird von einem 95%-Konfidenzintervall begleitet, sodass bestehende Unsicherheiten bei der Beurteilung der Leistung transparent ausgewiesen werden.
Prüfungen mit eigenen Inhalten und Arbeitsabläufen
Welche Quellen wann geprüft wurden
Antworten auf Basis des quellengeprüften Produkteintrags
AgentScore bewertet produktive Sitzungen anhand von fünf Kernbereichen: Ergebnis, Zuverlässigkeit, Kosten, Geschwindigkeit und Sicherheit.
Traces können über OpenTelemetry angebunden, aus vorhandenen Tracing-Setups übernommen oder über den Prompt für Latitude-AI-Skills konfiguriert werden.
Ein Agent muss mindestens 1.000 zulässige Produktionssitzungen erreichen und die Traffic-, Abdeckungs- sowie Konfidenz-Gates für alle fünf Dimensionen erfüllen.
AgentScore bewertet Sitzungen über das kürzeste zulässige ganzwöchige Zeitfenster von 7, 14, 21 oder 28 Tagen, das die Voraussetzungen erfüllt.
Entwickler können fehlerhafte Sitzungen untersuchen, in Evaluierungen überführen und die Nachweise über MCP direkt an Coding-Agenten weiterleiten.