AI Observability by OpenObserve
AI Observability by OpenObserveは、統合オブザーバビリティスタック内でAIエージェントおよびLLM向けにOpenTelemetryネイティブのトレーシング、セッションリプレイ、自動評価機能を提供します。
AI Observability by OpenObserveは、統合オブザーバビリティスタック内でAIエージェントおよびLLM向けにOpenTelemetryネイティブのトレーシング、セッションリプレイ、自動評価機能を提供します。
製品の機能と公式な位置づけ
AI Observability by OpenObserveは、OpenTelemetryネイティブのテレメトリを取り込んでモデル呼び出し、ツール実行、サブエージェントワークフローを追跡するLLMおよびエージェント監視ソリューションです。
このプラットフォームは、AIアプリケーショントレースを基盤となるシステムメトリクス、ログ、データストアと関連付け、SQLやPromQLを活用して応答品質の評価やエージェント障害のトラブルシューティングを可能にします。
公式情報で確認できる活用例
エンジニアリングチームはエージェント呼び出しツリーやセッションリプレイを可視化し、実行ループ、ツール障害、レイテンシのボトルネックを特定できます。
チームはLLM-as-judgeまたはリモート評価機能を用いて、関連性、ハルシネーション、バイアス、毒性のベンチマークに照らしてライブLLMリクエストを評価できます。
OpenObserveは、サブエージェント、基盤モデル、外部ツール、データストア間のやり取りを可視化するエージェントグラフを描画することで、エージェント型アプリケーションを追跡します。色分けされた境界線により、依存関係全体の障害発生率や劣化している実行経路が示されます。
セッションデバッグインターフェースにより、エンジニアはマルチターンでのやり取りを再現できます。ユーザーはトークン配分、ツール呼び出しの出力、レイテンシのホットスポットを検査し、基盤となる分散トレースへ直接ドリルダウンできます。
自分の素材とワークフローで確認したい項目
確認した情報源とその日時
情報源を確認した製品情報に基づく回答
アプリケーションがすでに標準のOpenTelemetry gen_aiスパンを出力しているか、OpenInference規約に準拠している場合、再計装は不要です。LangChain、CrewAI、LlamaIndexなどのフレームワークをサポートしています。
オンライン評価ジョブは、リモートHTTP評価機能または選択したモデルプロバイダーによるLLM-as-judgeを使用して、着信スパン、トレース、またはセッション全体をスコアリングし、設定可能な閾値と出力を比較します。
OpenObserveは、4つのリージョンにわたるフルマネージドクラウドサービスとしての導入、単一のRustバイナリによるセルフホスト、または顧客が所有するオブジェクトストレージバケットにデータを保存する構成が可能です。
LLMトレース、インフラストラクチャメトリクス、ログを含むOpenObserve内のテレメトリは、統合相関エンジンを通じてSQLおよびPromQLを使用してクエリできます。
本番環境のトレースをアノテーションキューにルーティングして自動評価機能と並行して手動スコアリングを実施できるほか、レビュー済みトレースを将来のテスト用評価データセットに変換できます。