Cekura Bench favicon

Cekura Bench

Cekura Bench 是一个开放的基准测试平台,旨在通过涵盖诊所预约排期和联邦医疗保险资格审核的82个模拟电话通话场景,全面评估实时语音到语音 AI 模型的实际表现与可靠性。

研究助理评估原生端到端语音模型,并与未排名的级联参考基准进行对照比较查看包含完整对话转录文本、工具调用记录和评分的公开通话报告测量包括响应延迟、10秒静音及结构化字段提取在内的运行指标标准化语音评估套件
Cekura Bench product interface screenshot
预计月访问量
6.6万
数据月份:
收录于 AIToolly

Cekura Bench 是什么?产品概览

产品用途与官方定位

Cekura Bench 是一个基准评估平台,采用标准化的电话通话场景来测试实时语音到语音模型,从而精准测量模型的对话可靠性、响应延迟以及数据准确率。

该平台基于开源 Pipecat 智能体框架,在82个不同场景下对每个模型分别执行三次测试,并公开发布完整的通话转录文本、工具执行记录以及多维度性能指标。

Cekura Bench 可以用来做什么?

有官方来源支持的使用场景

语音模型评估

开发团队在落地语音智能体之前,对比评估各实时语音模型在对话一致性、响应时间及数据准确率方面的综合表现。

架构基准评测

开发者将原生端到端语音模型与由语音转文字、大语言模型和语音合成组成的标准级联处理流程进行横向对比与性能评估。

基准测试方法与评估指标

该基准测试通过在统一的开源 Pipecat 语音智能体框架中运行每个语音到语音模型,从而标准化测试环境。提示词、集成工具和网络连接在各轮测试中均保持一致,确保模型性能成为唯一的测试变量。测试还纳入了一个结合 Flux、GPT-4.1 和 ElevenLabs Flash 的未排名级联基准线,以此作为系统架构层面的参考对照。

评估涵盖诊所预约处理和联邦医疗保险资格审核两大类别的82个测试场景,且每个场景均执行三次实时通话测试,总计进行了2,952次通话。只有当智能体达成指定业务目标并正确保存所有预期数据字段时,该通话才被判定为通过,系统通过在每次测试运行中均取得成功的场景比例来衡量稳定性与一致性。

  • 短流程医疗接待测试套件包含59个场景,重点检验患者信息查询、可预约时段核对以及预约变更等操作。
  • 长流程联邦医疗保险接收套件包含23个场景,涉及42个数据字段,全面覆盖来电者知情同意、资格初审及转接交接流程。
  • 可靠性排名采用立方通过率(Pass-Cubed)标准,要求模型必须在连续三次运行中均顺利完成才算通过。
  • 提供单次通话的完整转录文本、工具调用记录、延迟数据以及最终评测得分,支持全面审查与复核。

选择 Cekura Bench 前需要测试什么

用自己的素材和工作流完成验证

  • 验证诊所预约挂号与联邦医疗保险接收等基准测试场景是否能够真实反映您实际语音应用所需的对话模式与业务流程。
  • 检查各模型在面对背景噪音、网络丢包、对话打断以及用户主动纠错等特定挑战场景时的稳定性和容错表现。
  • 查阅公开的通话报告与工具执行日志,仔细观察模型在处理复杂的多字段数据录入及转接交接备注时的具体应对情况。

Cekura Bench 来源与核对时间

核对了哪些信息以及核对时间

最后核对

Cekura Bench 常见问题

基于已核对产品资料的回答

Cekura Bench 语音到语音评估涵盖哪些测试场景?

该基准测试共涵盖两个套件中的82个场景:一是包含59个场景的诊所接待套件,用于测试预约挂号流程;二是包含23个场景的联邦医疗保险接收套件,涵盖知情同意、资格初审与通话转接。

Cekura Bench 如何计算可靠性指标?

可靠性采用立方通过率(pass-cubed)指标进行量化评估,该指标专门计算在连续三次独立实时通话运行中均顺利通过测试的场景所占的百分比。

在评估各个模型时保持了哪些环境条件的恒定一致?

所有受测模型均在相同的开源 Pipecat 智能体配置下运行,采用完全相同的提示词、工具定义和网络连接设置,从而确保模型性能成为唯一的评估变量。

Cekura Bench 是否将原生语音模型与级联架构进行了对比?

是的,评测体系中包含了一个未排名的级联参考基准,该基准组合了用于语音识别的 Flux、负责推理的 GPT-4.1 以及用于语音合成的 ElevenLabs Flash,为性能对比提供参考背景。

可以在何处查阅测试日志与对话转录文本?

每个模型的评测条目均直接关联至 Cekura 报告页面,其中包含完整的对话转录记录、工具调用执行详情及最终评测得分,方便公众进行独立验证与复核。

继续查看同一分类中近期收录的其他工具。