Gemini 3.5 Transcribe
Gemini 3.5 Transcribe est un modèle de reconnaissance vocale conçu pour une transcription précise et en temps réel, gérant les environnements audio complexes, les mots de remplissage et l'attribution multi-locuteurs.
Gemini 3.5 Transcribe est un modèle de reconnaissance vocale conçu pour une transcription précise et en temps réel, gérant les environnements audio complexes, les mots de remplissage et l'attribution multi-locuteurs.
Fonction du produit et positionnement officiel
Gemini 3.5 Transcribe est un modèle intelligent de conversion de la parole en texte conçu pour transformer l'audio brut en un texte épuré et formaté. Il est élaboré pour gérer efficacement le bruit de fond, le jargon spécialisé et les schémas de parole naturels.
Le modèle accompagne les développeurs via des API de streaming en temps réel et de traitement audio pré-enregistré. Il s'intègre à diverses interfaces Google pour fournir une transcription contextuelle et des capacités de commande vocale.
Cas d’usage étayés par les sources officielles
Les développeurs utilisent l'API Live pour créer des agents vocaux haute performance et des outils de sous-titrage en temps réel.
Les organisations traitent les réunions enregistrées et les journaux d'appels pour générer des transcriptions avec attribution des locuteurs et horodatage.
Gemini 3.5 Transcribe offre des améliorations significatives en termes de latence et de précision par rapport aux modèles précédents. Il est optimisé pour comprendre l'intention et reconnaître le vocabulaire personnalisé, garantissant une haute performance dans divers environnements.
Vérifications à effectuer avec vos contenus et votre flux de travail
Sources vérifiées et date de la vérification
Réponses fondées sur la fiche produit dont les sources ont été vérifiées
Le modèle prend en charge à la fois le streaming continu en temps réel pour les applications vocales interactives et le traitement de fichiers audio pré-enregistrés tels que les réunions et les journaux d'appels.
Gemini 3.5 Transcribe dispose de capacités de transcription intelligente qui identifient et suppriment automatiquement les mots de remplissage comme les 'euh' tout en corrigeant les auto-corrections.
Oui, le modèle permet l'identification multi-locuteurs jusqu'à trois personnes dans l'audio pré-enregistré, incluant des horodatages au niveau des mots pour chaque attribution.
Le modèle offre une prise en charge linguistique mondiale, capable de détecter et de transcrire automatiquement plus de 85 langues, y compris divers accents et dialectes régionaux.
Les développeurs peuvent accéder au modèle en version préliminaire publique via l'API Gemini dans Google AI Studio, la plateforme Gemini Enterprise Agent et Google Antigravity.