Gemini 3.5 Transcribe favicon

Gemini 3.5 Transcribe

Gemini 3.5 Transcribe est un modèle de reconnaissance vocale conçu pour une transcription précise et en temps réel, gérant les environnements audio complexes, les mots de remplissage et l'attribution multi-locuteurs.

Traduction et TranscriptionTranscription en streaming en temps réelAppel de fonctions pour la délégation…Adaptation au vocabulaire personnaliséDétection automatique de la langue pour…
Gemini 3.5 Transcribe product interface screenshot
Visites mensuelles estimées
9 M
Période des données:
Référencé sur AIToolly

Qu’est-ce que Gemini 3.5 Transcribe ? Présentation du produit

Fonction du produit et positionnement officiel

Gemini 3.5 Transcribe est un modèle intelligent de conversion de la parole en texte conçu pour transformer l'audio brut en un texte épuré et formaté. Il est élaboré pour gérer efficacement le bruit de fond, le jargon spécialisé et les schémas de parole naturels.

Le modèle accompagne les développeurs via des API de streaming en temps réel et de traitement audio pré-enregistré. Il s'intègre à diverses interfaces Google pour fournir une transcription contextuelle et des capacités de commande vocale.

À quoi peut servir Gemini 3.5 Transcribe ?

Cas d’usage étayés par les sources officielles

Interfaces pilotées par la voix

Les développeurs utilisent l'API Live pour créer des agents vocaux haute performance et des outils de sous-titrage en temps réel.

Analyse après appel

Les organisations traitent les réunions enregistrées et les journaux d'appels pour générer des transcriptions avec attribution des locuteurs et horodatage.

Performance et précision de la transcription

Gemini 3.5 Transcribe offre des améliorations significatives en termes de latence et de précision par rapport aux modèles précédents. Il est optimisé pour comprendre l'intention et reconnaître le vocabulaire personnalisé, garantissant une haute performance dans divers environnements.

  • Atteint un taux d'erreur de mots (WER) moyen de 4,0 % pour le streaming et de 2,6 % pour les cas d'utilisation hors streaming.
  • Améliore le temps de transcription finale de 70 % par rapport au modèle précédent Chirp 3.
  • Prend en charge plus de 85 langues avec détection automatique et gestion des accents régionaux.

Points à tester avant de choisir Gemini 3.5 Transcribe

Vérifications à effectuer avec vos contenus et votre flux de travail

  • Vérifiez que l'environnement d'intégration prend en charge l'API requise, soit l'API Live pour le streaming, soit l'API Interactions pour les fichiers pré-enregistrés.
  • Vérifiez que les exigences de vocabulaire personnalisé sont définies pour garantir que le modèle reconnaît avec précision le jargon spécialisé ou les orthographes uniques.

Sources et date de vérification de Gemini 3.5 Transcribe

Sources vérifiées et date de la vérification

Dernière vérification

Questions fréquentes sur Gemini 3.5 Transcribe

Réponses fondées sur la fiche produit dont les sources ont été vérifiées

Quels types d'audio Gemini 3.5 Transcribe peut-il traiter ?

Le modèle prend en charge à la fois le streaming continu en temps réel pour les applications vocales interactives et le traitement de fichiers audio pré-enregistrés tels que les réunions et les journaux d'appels.

Comment le modèle gère-t-il les mots de remplissage et les hésitations ?

Gemini 3.5 Transcribe dispose de capacités de transcription intelligente qui identifient et suppriment automatiquement les mots de remplissage comme les 'euh' tout en corrigeant les auto-corrections.

Le modèle peut-il identifier différents locuteurs dans un enregistrement ?

Oui, le modèle permet l'identification multi-locuteurs jusqu'à trois personnes dans l'audio pré-enregistré, incluant des horodatages au niveau des mots pour chaque attribution.

Gemini 3.5 Transcribe prend-il en charge d'autres langues que l'anglais ?

Le modèle offre une prise en charge linguistique mondiale, capable de détecter et de transcrire automatiquement plus de 85 langues, y compris divers accents et dialectes régionaux.

Comment les développeurs peuvent-ils accéder à Gemini 3.5 Transcribe ?

Les développeurs peuvent accéder au modèle en version préliminaire publique via l'API Gemini dans Google AI Studio, la plateforme Gemini Enterprise Agent et Google Antigravity.

Découvrez d’autres outils récemment ajoutés dans la même catégorie.