返回列表
产品发布语音AI基准评测智能体

Cekura Bench发布:首个真实电话端到端语音AI基准测试

Cekura在Product Hunt推出Cekura Bench,针对真实电话通话环境对9款主流实时语音端到端模型展开系统化基准评测。测试涵盖82个复杂业务场景及多次验证,综合考察可靠性、延迟与成本。结果显示GPT Realtime 2.1在稳定性上领先,Phonic响应最快,为语音智能体的落地选型提供了公开透明的实测依据。

Product Hunt

核心要点

  • 真实电话环境测试:区别于传统的实验室或模拟环境,Cekura Bench 在真实网络电话线路上对 9 款实时端到端(Speech-to-Speech)语音模型进行实测。
  • 严格的多轮验证标准:评测覆盖门诊预约与医保登记等 82 个具体业务场景,每个场景独立运行 3 次(共 246 次通话),只有所有运行均成功且数据字段完全正确才算通过。
  • 性能指标全方位公开:全量通话记录与转录文本均向公众开放,涵盖可靠性、数据准确性、响应延迟、停滞挂断率及单次通话成本。
  • 核心模型实测对比:GPT Realtime 2.1 以 79.3% 的全通过率位列稳定性第一;Phonic v1 取得 1.60 秒的中位数响应速度;GPT Realtime 2.1 Mini 拥有每分钟 0.020 美元的最低成本优势。

详细分析

统一框架下的端到端真实测评

随着语音大模型从级联架构(STT + LLM + TTS)向原生端到端(Speech-to-Speech)架构演进,传统静态评测集难以衡量模型在真实通话中的表现。Cekura Bench 采用了标准化的测试基准:将 9 款主流实时语音模型(包括 GPT Realtime 2.1、Gemini Live、Grok 以及 Phonic 等)部署在统一的开源 Pipecat 智能体架构中,赋予其相同的系统提示词、业务工具以及真实电话线路接口。这种严谨的变量控制方法,排除了工程接入层面的偏差,纯粹对比模型本身的对话理解、任务规划与音频交互能力。

复杂垂直场景与严苛的通过判定规则

基准测试选取了具有高容错要求的医疗业务流,包括诊所预约和医疗保险接待登记(Medicare intake)等 82 个细分交互场景。为了排除大模型偶发成功的幸存者偏差,Cekura 采用了严苛的通过机制:每个场景连续进行 3 次独立通话测试,仅当智能体在 3 次通话中全部达成正确业务目标、且提取存储的业务字段完全正确时,该场景才被认定为通过。这一标准不仅考量模型的语义听写与对话轮次控制,还直接检验了模型在遇到口音、停顿、背景杂音及意图修正时的健壮性。

关键维度表现:稳定性、延迟与成本的权衡

在实际测试结果中,不同模型展现了明显的工程取舍特征:在可靠性维度上,OpenAI 的 GPT Realtime 2.1 表现最为优异,在 82 个业务场景中取得了 79.3% 的三重通过率,在信息提取精准度和对话目标达成上明显领先;在响应速度维度上,Phonic v1 录得 1.60 秒的中位数响应延迟,成为测试中反应最迅速的模型,大幅削减了电话场景中的交互迟滞感;在推理成本维度上,GPT Realtime 2.1 Mini 将通话成本压低至每分钟 0.020 美元,为高频次外呼与客服场景提供了极具竞争力的经济性。

行业影响

Cekura Bench 的发布填补了语音 AI 领域在生产级电话环境下的评测空白。长期以来,开发者在选型语音智能体时,往往受限于厂商自测的实验室延迟数据与单点准确率,难以预估模型接入电话网络后的真实表现。通过公开全部通话录音与转录数据,Cekura 建立了透明、可复现的评测标杆。这不仅为企业构建电话客服、智能外呼等应用提供了量化的决策依据,也倒逼底层语音大模型研发机构在追求模型参数的同时,更加重视网络抖动适应能力、打断恢复能力以及端到端延迟的工程优化。

常见问题

什么是 Cekura Bench?

Cekura Bench 是由 Cekura 团队推出的实时语音大模型基准测试套件,专门在真实网络电话环境下对端到端语音模型进行自动化评测,涵盖可靠性、响应时间、数据提取准确率和运行成本等维度。

本次基准测试涉及哪些主要模型?

测试涵盖了 9 款主流实时语音模型,包括 GPT Realtime 2.1、GPT Realtime 2.1 Mini、Gemini Live、Grok 以及 Phonic v1 等,所有模型均在统一的开源架构下完成标准化对比。

为什么说该测试比传统的基准更为严苛?

传统评测多依赖离线音频或单次问答,而 Cekura Bench 不仅使用真实电话网络,还要求智能体在复杂业务流中完成 82 个场景的实测,且每个场景必须在 3 次重复通话中全部正确达成任务才计入通过,极大程度规避了随机性。

相关新闻