Cekura Bench favicon

Cekura Bench

Cekura Benchは、診療所の予約やメディケア受付にわたる82件の模擬通話シナリオを通じて、リアルタイム音声対音声AIモデルを評価するオープンベンチマークです。

研究アシスタント順位付けのないカスケード型リファレンスベースラインとネイティブ音声対音声モデルの比…完全な会話の文字起こし、ツール呼び出し記録、スコアを含む公開通話レポートの確認応答レイテンシ、10秒間の無音、構造化フィールドの抽出などの運用指標の測定標準化された音声評価スイート
Cekura Bench product interface screenshot
推定月間訪問数
6.6万
データ期間:
AIToolly 掲載日

Cekura Benchとは?製品概要

製品の機能と公式な位置づけ

Cekura Benchは、標準化された通話シナリオを用いてリアルタイム音声対音声モデルを評価し、会話の信頼性、レイテンシ、データ精度を測定するベンチマークです。

このプラットフォームは、オープンソースのPipecatエージェントフレームワークを用いて82の異なるシナリオでモデルを各3回テストし、通話の全文文字起こし、ツール実行記録、パフォーマンス指標を公開しています。

Cekura Benchで何ができますか?

公式情報で確認できる活用例

音声モデルの評価

チームは音声エージェントの実装前に、一貫性、応答時間、データ精度に関してリアルタイム音声モデルを比較できます。

アーキテクチャのベンチマーク

開発者は、ネイティブ音声対音声モデルを、音声認識・言語モデル・音声合成で構成される標準的なカスケード型パイプラインと比較評価できます。

ベンチマークの手法と評価指標

本ベンチマークは、各音声対音声モデルを同一のオープンソースPipecat音声エージェントフレームワーク上で実行することにより、テスト条件を標準化しています。プロンプト、連携ツール、接続設定はすべての実行で共通に保たれ、モデルの性能のみをテスト対象の単一変数として分離します。また、Flux、GPT-4.1、ElevenLabs Flashを組み合わせた順位付けのないカスケードベースラインが、アーキテクチャ上のリファレンスとして機能します。

評価は診療所の予約対応およびメディケア資格確認を対象とした3回のライブ実行にわたる82のテストシナリオで構成され、通話数は合計2,952件に及びます。エージェントが必要な成果を達成し、期待されるすべてのデータフィールドを正確に保存した場合にのみ通話は合格と判定され、一貫性はすべての実行で成功したシナリオの割合によって測定されます。

  • 診療所受付向けのショートフォームスイートは59のシナリオを網羅し、患者検索、空き枠確認、予約変更をテストします。
  • メディケア受付向けのロングフォームスイートは42のフィールドを持つ23のシナリオを評価し、発信者の同意、資格判定、引き継ぎルーティングを対象とします。
  • 信頼性の順位付けには、3回連続の実行すべてで完了が求められるPass-Cubed基準が採用されています。
  • 個々の通話の文字起こし、ツール呼び出し、レイテンシの数値、結果スコアを検証用に確認可能です。

Cekura Benchを選ぶ前に確認すること

自分の素材とワークフローで確認したい項目

  • 診療所の予約受付およびメディケア受付のベンチマークシナリオが、開発する音声アプリケーションに必要な会話パターンを反映しているか確認してください。
  • 背景雑音、パケット損失、割り込み、発信者による訂正など、特定の課題カテゴリにおけるモデルの信頼性を確認してください。
  • 公開通話レポートとツールログを確認し、モデルが複雑な複数フィールドのデータ入力や引き継ぎメモをどのように処理しているかを把握してください。

Cekura Benchの情報源と確認日

確認した情報源とその日時

最終確認日

Cekura Benchのよくある質問

情報源を確認した製品情報に基づく回答

Cekura Benchの音声対音声評価ではどのようなシナリオがテストされますか?

このベンチマークでは2つのスイートにわたる82のシナリオを評価します。予約受付を扱う59シナリオの診療所受付スイートと、同意、資格判定、ルーティングを網羅する23シナリオのメディケア受付スイートです。

Cekura Benchは信頼性をどのように算出しますか?

信頼性はPass-Cubed指標を用いて測定され、3回連続のライブ通話実行すべてに成功したシナリオの割合を計算することで算出されます。

評価されるモデル間で統一されている条件は何ですか?

モデル本来の性能を分離して評価するため、すべてのモデルは同一のプロンプト、ツール定義、接続設定を備えた同じオープンソースのPipecatエージェント構成で動作します。

Cekura Benchはネイティブ音声モデルをカスケード型アーキテクチャと比較していますか?

はい。音声認識にFlux、推論にGPT-4.1、音声合成にElevenLabs Flashを組み合わせた順位付けのないリファレンスカスケードが含まれており、比較の参考として利用できます。

テストログや会話の文字起こしはどこで確認できますか?

各モデルのエントリからCekuraのレポートへ直接リンクされており、検証のために完全な文字起こし、ツールの実行ログ、結果スコアを確認することができます。

同じカテゴリーに最近追加されたツールをチェックできます。