Cekura Bench
Cekura Bench propose un banc d'essai ouvert évaluant les modèles d'IA speech-to-speech en temps réel à travers 82 scénarios d'appels téléphoniques simulés de prise de rendez-vous clinique et d'admission Medicare.
Cekura Bench propose un banc d'essai ouvert évaluant les modèles d'IA speech-to-speech en temps réel à travers 82 scénarios d'appels téléphoniques simulés de prise de rendez-vous clinique et d'admission Medicare.
Fonction du produit et positionnement officiel
Cekura Bench est un benchmark qui évalue les modèles vocaux speech-to-speech en temps réel à l'aide de scénarios standardisés d'appels téléphoniques afin de mesurer la fiabilité conversationnelle, la latence et la précision des données.
La plateforme teste chaque modèle trois fois sur 82 scénarios distincts à l'aide d'un framework d'agent open source Pipecat, en publiant l'intégralité des transcriptions d'appels, les enregistrements d'exécution d'outils et les métriques de performance.
Cas d’usage étayés par les sources officielles
Les équipes comparent les modèles vocaux en temps réel sur la cohérence, les temps de réponse et l'exactitude des données avant de déployer des agents vocaux.
Les développeurs évaluent les modèles natifs speech-to-speech par rapport à un pipeline en cascade standard composé de transcription vocale, modèle de langage et synthèse vocale.
Le benchmark standardise les conditions de test en exécutant chaque modèle speech-to-speech via le même framework d'agent vocal open source Pipecat. Les invites, les outils d'intégration et les connexions restent identiques d'un test à l'autre, isolant ainsi la performance du modèle comme seule variable testée. Une référence en cascade non classée combinant Flux, GPT-4.1 et ElevenLabs Flash sert de repère architectural.
L'évaluation comprend 82 scénarios de test menés sur trois séries d'appels en direct, totalisant 2 952 appels portant sur la gestion de rendez-vous en clinique et l'éligibilité Medicare. Un appel n'est validé que si l'agent atteint le résultat requis et enregistre correctement tous les champs de données attendus, la cohérence étant mesurée par la proportion de scénarios réussis sur chaque série.
Vérifications à effectuer avec vos contenus et votre flux de travail
Sources vérifiées et date de la vérification
Réponses fondées sur la fiche produit dont les sources ont été vérifiées
Le benchmark évalue 82 scénarios répartis en deux suites : une suite de 59 scénarios de réception en clinique pour la prise de rendez-vous et une suite de 23 scénarios d'admission Medicare couvrant le consentement, l'éligibilité et l'acheminement.
La fiabilité est mesurée à l'aide d'une métrique pass-cubed, qui calcule le pourcentage de scénarios réussis sur trois séries consécutives d'appels en direct.
Tous les modèles exécutent la même configuration d'agent open source Pipecat avec des invites, des définitions d'outils et des paramètres de connexion identiques afin d'isoler la performance du modèle.
Oui, une cascade de référence non classée associant Flux pour la transcription vocale, GPT-4.1 pour le raisonnement et ElevenLabs Flash pour la synthèse vocale est incluse à des fins de comparaison contextuelle.
Chaque entrée de modèle renvoie directement aux rapports Cekura contenant les transcriptions complètes, les exécutions d'appels d'outils et les scores de résultat à des fins de vérification.