Gemini 3.5 Transcribe
Gemini 3.5 Transcribe ist ein Speech-to-Text-Modell für präzise Echtzeit-Transkriptionen, das komplexe Audio-Umgebungen, Füllwörter und die Zuordnung mehrerer Sprecher beherrscht.
Gemini 3.5 Transcribe ist ein Speech-to-Text-Modell für präzise Echtzeit-Transkriptionen, das komplexe Audio-Umgebungen, Füllwörter und die Zuordnung mehrerer Sprecher beherrscht.
Funktion und offizielle Positionierung des Produkts
Gemini 3.5 Transcribe ist ein intelligentes Speech-to-Text-Modell, das Rohaudio in aufbereiteten, formatierten Text umwandelt. Es wurde entwickelt, um Hintergrundgeräusche, Fachjargon und natürliche Sprachmuster effektiv zu verarbeiten.
Das Modell unterstützt Entwickler durch APIs für Echtzeit-Streaming und die Verarbeitung vorab aufgezeichneter Audioaufnahmen. Es lässt sich in verschiedene Google-Oberflächen integrieren, um kontextbezogene Transkriptionen und Sprachbefehlsfunktionen bereitzustellen.
Durch offizielle Quellen belegte Anwendungsfälle
Entwickler nutzen die Live-API, um leistungsstarke Sprachagenten und Tools für Untertitel in Echtzeit zu erstellen.
Organisationen verarbeiten aufgezeichnete Besprechungen und Anrufprotokolle, um Transkripte mit Sprecherzuordnung und Zeitstempeln zu erstellen.
Gemini 3.5 Transcribe bietet im Vergleich zu Vorgängermodellen erhebliche Verbesserungen bei Latenz und Genauigkeit. Es ist darauf optimiert, Absichten zu verstehen und benutzerdefiniertes Vokabular zu erkennen, was eine hohe Leistung in verschiedenen Umgebungen ermöglicht.
Prüfungen mit eigenen Inhalten und Arbeitsabläufen
Welche Quellen wann geprüft wurden
Antworten auf Basis des quellengeprüften Produkteintrags
Das Modell unterstützt sowohl kontinuierliches Echtzeit-Streaming für interaktive Sprachanwendungen als auch die Verarbeitung vorab aufgezeichneter Audiodateien wie Meetings und Anrufprotokolle.
Gemini 3.5 Transcribe verfügt über intelligente Transkriptionsfunktionen, die Füllwörter wie „Äh“ und „Hm“ automatisch identifizieren und entfernen sowie Selbstkorrekturen bereinigen.
Ja, das Modell bietet eine Identifizierung für bis zu drei Sprecher in vorab aufgezeichneten Audioaufnahmen, einschließlich Zeitstempeln auf Wortebene für jede Zuordnung.
Das Modell bietet globale Sprachunterstützung und kann über 85 Sprachen automatisch erkennen und transkribieren, einschließlich verschiedener regionaler Akzente und Dialekte.
Entwickler können in der Public Preview über die Gemini API in Google AI Studio, die Gemini Enterprise Agent Platform und Google Antigravity auf das Modell zugreifen.