Cekura Bench favicon

Cekura Bench

Cekura Bench ofrece un banco de pruebas abierto para evaluar modelos de IA de voz a voz en tiempo real mediante 82 llamadas simuladas de gestión clínica y admisión de Medicare.

Asistente de InvestigaciónEvaluación de modelos nativos de voz a…Revisión de informes públicos de…Medición de métricas operativas como…Suites estandarizadas de evaluación de voz
Cekura Bench product interface screenshot
Visitas mensuales estimadas
66 mil
Periodo de datos:
Publicado en AIToolly

¿Qué es Cekura Bench? Descripción del producto

Qué hace el producto y cómo se presenta oficialmente

Cekura Bench es un benchmark que evalúa modelos de voz a voz en tiempo real mediante escenarios estandarizados de llamadas telefónicas para medir fiabilidad conversacional, latencia y precisión de datos.

La plataforma prueba modelos en 82 escenarios distintos tres veces cada uno mediante el framework de agentes de código abierto Pipecat, publicando transcripciones completas, registros de herramientas y métricas.

¿Para qué se puede usar Cekura Bench?

Casos de uso respaldados por fuentes oficiales

Evaluación de modelos de voz

Los equipos comparan modelos de voz en tiempo real en consistencia, tiempos de respuesta y precisión antes de desplegar agentes.

Comparación de arquitecturas

Los desarrolladores evalúan modelos nativos de voz a voz frente a una canalización en cascada de voz a texto, modelo lingüístico y síntesis.

Metodología del benchmark y métricas de evaluación

El benchmark estandariza las condiciones de prueba ejecutando cada modelo de voz a voz en el mismo framework de agentes de código abierto Pipecat. Los prompts, herramientas de integración y conexiones se mantienen idénticos entre ejecuciones, aislando el rendimiento del modelo como la única variable evaluada. Una línea base en cascada no clasificada que combina Flux, GPT-4.1 y ElevenLabs Flash actúa como referencia arquitectónica.

La evaluación abarca 82 escenarios de prueba en tres ejecuciones en directo, sumando 2952 llamadas entre gestión de citas y cualificación de Medicare. Una llamada se aprueba solo si el agente logra el resultado requerido y guarda correctamente todos los campos esperados, midiendo la consistencia según la proporción de escenarios exitosos en cada ejecución.

  • La suite de recepcionista médica de formato corto incluye 59 escenarios sobre búsqueda de pacientes, disponibilidad y cambios de citas.
  • La suite de admisión de Medicare de formato largo evalúa 23 escenarios con 42 campos sobre consentimiento, cualificación y transferencias.
  • La clasificación de fiabilidad usa la métrica Pass-Cubed, requiriendo completar con éxito las tres ejecuciones consecutivas.
  • Las transcripciones de llamadas, llamadas a herramientas, datos de latencia y puntuaciones de resultados están disponibles para inspección.

Qué probar antes de elegir Cekura Bench

Comprobaciones con tus propios materiales y flujo de trabajo

  • Comprobar si los escenarios de citas clínicas y admisión de Medicare reflejan los patrones de conversación de su aplicación.
  • Verificar la fiabilidad del modelo ante retos como ruido de fondo, pérdida de paquetes, interrupciones y correcciones del usuario.
  • Examinar los informes públicos y registros de herramientas para ver cómo gestionan los modelos la captura de datos y notas de transferencia.

Fuentes y fecha de revisión de Cekura Bench

Qué fuentes se revisaron y cuándo

Última comprobación

Preguntas frecuentes sobre Cekura Bench

Respuestas basadas en el registro de producto con fuentes verificadas

¿Qué escenarios se evalúan en la prueba de voz a voz de Cekura Bench?

El benchmark evalúa 82 escenarios en dos suites: 59 de recepcionista clínica para gestión de citas y 23 de admisión de Medicare con consentimiento, cualificación y derivación.

¿Cómo calcula Cekura Bench la fiabilidad?

La fiabilidad se mide con la métrica Pass-Cubed, calculando el porcentaje de escenarios completados con éxito a lo largo de tres ejecuciones consecutivas de llamadas en directo.

¿Qué condiciones se mantienen constantes entre los modelos evaluados?

Todos los modelos emplean la misma configuración de agente Pipecat de código abierto, con prompts, definiciones de herramientas y conexiones idénticas para aislar su rendimiento.

¿Compara Cekura Bench modelos nativos de voz con arquitecturas en cascada?

Sí, incluye como referencia comparativa no clasificada una cascada compuesta por Flux para voz a texto, GPT-4.1 para razonamiento y ElevenLabs Flash para síntesis de voz.

¿Dónde se pueden revisar los registros de prueba y las transcripciones?

Cada ficha de modelo enlaza directamente con informes de Cekura que contienen las transcripciones completas, ejecuciones de herramientas y puntuaciones para su verificación.

Explora otras herramientas añadidas recientemente en la misma categoría.