AgentScore
AgentScore от Latitude оценивает ИИ-агентов в продакшне по результативности, надежности, стоимости, скорости и безопасности на основе собранных трейсов.
AgentScore от Latitude оценивает ИИ-агентов в продакшне по результативности, надежности, стоимости, скорости и безопасности на основе собранных трейсов.
Назначение продукта и его официальное позиционирование
AgentScore — это инструмент оценки на платформе Latitude, преобразующий трейсы из продакшна в единый итоговый балл. Он оценивает ИИ-агентов по пяти ключевым аспектам: результативности, надежности, стоимости, скорости и безопасности.
Вместо использования синтетических тестов решение требует реальных данных продакшна, передаваемых через OpenTelemetry или существующие источники трейсинга. Чтобы отобразить оценку, агент должен преодолеть заданные пороги покрытия, трафика и статистической значимости минимум на 1 000 подходящих сессий.
Сценарии, подтверждённые официальными источниками
Команды собирают трейсы реальных сессий через OpenTelemetry для измерения эффективности агента по пяти операционным направлениям.
Инженеры исследуют неудачные продакшн-сессии, чтобы выявить негативные паттерны поведения и преобразовать их в постоянные тесты оценки.
Разработчики передают данные об ошибках в кодинг-агенты через MCP для внесения точечных правок в код и проверки их влияния после релиза.
Описанный в документации процесс, если он доступен
Передавайте трейсы выполнения агентов в Latitude вручную через OpenTelemetry или с помощью уже настроенной системы трейсинга.
Система собирает не менее 1 000 подходящих сессий за окно в 7, 14, 21 или 28 дней, пока не будут пройдены проверки по трафику, покрытию и достоверности.
Изучите полученную оценку, определите параметры, снижающие эффективность агента, и детально разберите отдельные проблемные сессии.
Настройте наборы оценочных тестов на базе выявленных в продакшне сбоев для контроля за поведением агента в будущих сессиях.
Передайте данные трейсов кодинг-агентам через MCP, разверните обновленный код агента и отслеживайте результаты в последующих сессиях.
AgentScore опирается на строгие статистические критерии перед публикацией итоговой оценки. Агент должен накопить как минимум 1 000 подходящих продакшн-сессий, прежде чем начнется расчет. Данные должны пройти проверки по трафику, охвату и статистической надежности по всем пяти направлениям оценки.
Расчет оценки выполняется за минимальный недельный период (7, 14, 21 или 28 дней), удовлетворяющий всем требованиям пригодности. Каждая полученная оценка сопровождается 95-процентным доверительным интервалом, что позволяет наглядно учитывать степень неопределенности при анализе эффективности.
Проверки на собственных материалах и рабочих процессах
Какие источники и когда были проверены
Ответы на основе карточки продукта с проверенными источниками
AgentScore оценивает продакшн-сессии по пяти ключевым направлениям: результат выполнения, надежность, стоимость, скорость и безопасность.
Трейсы можно подключить через OpenTelemetry, импортировать из существующих систем трейсинга или настроить с помощью промпта навыка Latitude AI.
Агент должен накопить не менее 1 000 подходящих сессий в продакшне и успешно пройти проверки по трафику, охвату и доверительным интервалам по всем пяти направлениям.
AgentScore оценивает сессии за кратчайший подходящий интервал, кратный полным неделям: 7, 14, 21 или 28 дней, который удовлетворяет всем требованиям.
Разработчики могут анализировать сессии со сбоями, превращать их в регулярные тесты оценки и передавать собранные данные напрямую кодинг-агентам через MCP.