AgentScore
Latitude 的 AgentScore 能够利用摄取的链路追踪数据,从成果、可靠性、成本、速度和安全性五个核心维度,对生产环境中的 AI 智能体展开全面评估并生成量化指标。
Latitude 的 AgentScore 能够利用摄取的链路追踪数据,从成果、可靠性、成本、速度和安全性五个核心维度,对生产环境中的 AI 智能体展开全面评估并生成量化指标。
产品用途与官方定位
AgentScore 是 Latitude 平台中的一项评估功能,能够将生产环境的链路追踪数据转化为统一的评估评分。它从成果、可靠性、成本、速度和安全性这五个关键维度对人工智能智能体展开综合评估。
该工具并不依赖合成评测基准,而是要求通过 OpenTelemetry 或现有链路追踪源提供真实的生产实证。为了显示评分,智能体必须在至少 1,000 个合格会话中达到预定义的覆盖率、流量与置信度门限阈值。
有官方来源支持的使用场景
团队可以通过 OpenTelemetry 摄取线上实时会话追踪,跨五个不同的运行维度衡量智能体的实际成效与表现。
工程师能够审查失败的生产会话以识别负面行为模式,并将其转化为持续运行的评测基准套件。
开发者可通过 MCP 将生产失败实证提供给编程智能体,从而实现针对性代码修复并验证发布后的改善效果。
官网提供的使用流程
通过 OpenTelemetry 或现有的链路追踪配置,将实时智能体执行追踪数据手动发送至 Latitude。
让平台在 7、14、21 或 28 天的窗口期内收集至少 1,000 个合格会话,直至通过流量、覆盖率及置信度门限。
查看生成的评分结果,识别拖累智能体表现的具体维度,并进一步深入探查单个失败的会话详情。
基于已识别的生产失败案例配置评测集,以便在后续会话中持续监控智能体的运行行为。
利用 MCP 向编程智能体提供追踪实证,部署更新后的智能体代码,并追踪其对后续生产会话的实际影响。
AgentScore 在发布评分前依赖于严格的统计学标准。智能体必须累积至少 1,000 个合格的生产会话后方可计算评分。此外,相关实证数据必须在所有五个评估维度上同时通过流量、覆盖率与置信度门限。
评分会在满足资格要求的最短整周周期(7 天、14 天、21 天或 28 天)内进行计算。每个计算出的评分都会附带一个 95% 置信区间,确保在评估智能体性能时能够清晰展示其统计不确定性。
用自己的素材和工作流完成验证
核对了哪些信息以及核对时间
基于已核对产品资料的回答
AgentScore 从五个核心维度全面评估生产会话,具体包括成果、可靠性、成本、速度以及安全性,从而构建综合的量化表现视图。
链路追踪数据可以通过 OpenTelemetry 标准进行连接,也可以从现有的追踪架构中接入,或者通过配置 Latitude AI 技能提示来完成集成。
智能体必须累积至少 1,000 个合格的生产会话,并且在全部五个维度上均必须完全满足流量、覆盖率以及置信度门限的统计验证要求。
AgentScore 会在满足准入资格要求的最短整周周期内评估会话,支持可选的评估时间窗口包括 7 天、14 天、21 天或 28 天。
开发者可以审查失败的生产会话,将其转化为持续的评测基准,并通过模型上下文协议(MCP)将实证直接传递给编程智能体以支持排查和修复。