AgentScore  favicon

AgentScore

Latitude의 AgentScore는 수집된 트레이스를 활용하여 결과, 신뢰성, 비용, 속도, 안전성의 다섯 가지 차원에서 프로덕션 AI 에이전트를 평가합니다.

코드 및 IT결과, 신뢰성, 비용 전반의 프로덕션 트레이스 증거를 바탕으로 종합…에이전트 실행, LLM 완성, 도구 검색을 포함한 특정 프로덕션…반복적인 실패 패턴을 포착하고 이를 개별 세션으로 역추적관측된 프로덕션 실패 사례를 반복 가능한 평가 벤치마크로 변환
AgentScore  product interface screenshot
예상 월간 방문 수
10.1만
데이터 기준:
AIToolly 등록일

AgentScore 란? 제품 개요

제품의 기능과 공식 포지셔닝

AgentScore는 프로덕션 트레이스를 통합 평가 점수로 변환하는 Latitude 플랫폼 내의 평가 기능입니다. 이 기능은 결과, 신뢰성, 비용, 속도, 안전성이라는 다섯 가지 주요 차원에서 AI 에이전트를 평가합니다.

이 도구는 합성 벤치마크에 의존하는 대신 OpenTelemetry나 기존 트레이스 소스를 통해 전송된 실제 프로덕션 증거를 요구합니다. 점수를 표시하려면 에이전트가 최소 1,000개의 적격 세션 전반에서 사전 정의된 커버리지, 트래픽 및 신뢰도 기준을 통과해야 합니다.

AgentScore 으로 무엇을 할 수 있나요?

공식 출처로 확인된 활용 사례

프로덕션 에이전트 품질 평가

팀은 OpenTelemetry를 통해 실시간 세션 트레이스를 수집하여 5가지 개별 운영 차원에서 에이전트의 성공 여부를 측정합니다.

실패 분석 및 평가 생성

엔지니어는 실패한 프로덕션 세션을 검사하여 부정적인 행동 패턴을 식별하고 이를 지속적인 평가 벤치마크로 변환합니다.

코딩 에이전트를 통한 수정 가이드

개발자는 MCP를 통해 코딩 에이전트에 프로덕션 실패 증거를 입력하여 맞춤형 코드 수정을 구현하고 릴리스 후 영향을 검증합니다.

AgentScore 사용 방법

공식 문서에 안내된 사용 절차

  1. 1

    프로덕션 트레이스 연결

    OpenTelemetry를 통해 수동으로 또는 기존 트레이싱 설정을 통해 실시간 에이전트 실행 트레이스를 Latitude로 전송합니다.

  2. 2

    증거 축적 및 게이트 충족

    트래픽, 커버리지, 신뢰도 게이트를 통과할 때까지 플랫폼이 7일, 14일, 21일 또는 28일 기간 동안 최소 1,000개의 적격 세션을 수집하도록 합니다.

  3. 3

    실패 패턴 검사

    도출된 점수를 검토하고, 에이전트 성능을 저하시키는 차원을 파악하며, 실패한 개별 세부 세션을 면밀히 조사합니다.

  4. 4

    실패 사례를 평가로 전환

    식별된 프로덕션 실패 사례를 바탕으로 평가를 구성하여 이후 세션 전반에서 에이전트의 동작을 모니터링합니다.

  5. 5

    수정 사항 배포 및 검증

    MCP를 사용하여 코딩 에이전트에 트레이스 증거를 제공하고, 업데이트된 에이전트 코드를 배포한 뒤 후속 프로덕션 세션에 미치는 영향을 추적합니다.

점수 산정 방법론 및 적격성 게이트

AgentScore는 점수를 보고하기 전에 엄격한 통계적 기준을 적용합니다. 점수가 계산되기 위해서는 에이전트가 최소 1,000개의 적격 프로덕션 세션을 축적해야 합니다. 또한 수집된 증거는 5가지 평가 차원 모두에서 트래픽, 커버리지, 신뢰도 게이트를 통과해야 합니다.

점수 산정은 적격성 요건을 충족하는 가장 짧은 주 단위 기간(7일, 14일, 21일 또는 28일) 동안 진행됩니다. 계산된 각 점수에는 95% 신뢰구간이 함께 제공되므로 성능을 평가할 때 불확실성을 명확하게 파악할 수 있도록 지원합니다.

  • 결과, 신뢰성, 비용, 속도, 안전성의 5가지 고유한 차원을 다룹니다.
  • 데이터 게이트를 충족하기 위해 최소 1,000개의 적격 프로덕션 세션이 필요합니다.
  • 7일, 14일, 21일 또는 28일의 주 단위 기간에 걸쳐 지표를 계산합니다.
  • 계산된 점수와 함께 95% 신뢰구간을 제공합니다.
  • 유입된 증거가 게이트 요구사항을 충족하지 못하면 점수 출력을 억제합니다.

AgentScore 선택 전에 확인할 사항

본인의 자료와 작업 흐름으로 직접 확인할 항목

  • 애플리케이션 아키텍처가 OpenTelemetry 트레이스 전송 또는 기존 트레이스 데이터와의 연동을 지원하는지 확인하십시오.
  • 에이전트가 최소 적격성 기준인 1,000개 세션을 충족할 수 있을 만큼 충분한 프로덕션 볼륨을 생성하는지 검증하십시오.
  • 개발 워크플로가 모델 컨텍스트 프로토콜(MCP)을 활용하여 코딩 에이전트에 트레이스 증거를 전달할 수 있는지 확인하십시오.
  • 점수 생성을 기대하기 전에 5개 채점 차원 전체에 걸친 커버리지 및 신뢰도 게이트 요건을 검토하십시오.

AgentScore 출처 및 확인일

확인한 출처와 확인 시점

마지막 확인
카테고리
코드 및 IT

AgentScore 자주 묻는 질문

출처를 확인한 제품 정보를 바탕으로 한 답변

AgentScore는 어떤 차원을 측정하나요?

AgentScore는 결과, 신뢰성, 비용, 속도, 안전성이라는 다섯 가지 핵심 차원에서 프로덕션 세션을 평가합니다.

프로덕션 트레이스는 플랫폼에 어떻게 수집되나요?

트레이스는 OpenTelemetry를 통해 연결하거나 기존 트레이스 설정에서 가져올 수 있으며, Latitude AI 스킬 프롬프트를 사용하여 구성할 수도 있습니다.

점수를 받기 위한 최소 적격성 요건은 무엇인가요?

에이전트는 최소 1,000개의 적격 프로덕션 세션을 누적해야 하며, 다섯 가지 모든 차원에서 트래픽, 커버리지 및 신뢰도 게이트를 충족해야 합니다.

AgentScore는 평가에 어떤 기간을 사용하나요?

AgentScore는 요구사항을 충족하는 가장 짧은 적격 주 단위 기간인 7일, 14일, 21일 또는 28일 동안 세션을 평가합니다.

개발자는 문제 해결을 위해 AgentScore 증거를 어떻게 활용할 수 있나요?

개발자는 실패 세션을 검사하고 이를 평가 항목으로 변환할 수 있으며, MCP를 사용하여 코딩 에이전트에 직접 증거를 전달할 수 있습니다.

같은 카테고리에 최근 등록된 다른 도구를 살펴보세요.