Changelog Update
Gemini 3.5 Transcribe allgemein verfügbar: Wir haben zwei spezielle Speech-to-Text-Modelle auf Grundlage der Audioanalyse von Gemini veröffentlicht:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): Hohe Genauigkeit, geringe Latenz, nicht gestreamte Sprache-zu-Text-Funktion mit auf Äußerungen basierender Spracherkennung in über 85 Sprachen, Sprecherzuordnung, Zeitstempel auf Wortebene und benutzerdefinierte Vokabeln (bis zu 1.000 Begriffe). - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): Bidirektionale Streaming-Sprach-zu-Text-Funktion mit geringer Latenz über WebSockets mit der Live API, die Zwischen- und endgültige Transkriptionsereignisse, den Smart-Transkriptionsmodus und mehrere Strategien zur Erkennung von Sprachaktivitäten (Voice Activity Detection, VAD) unterstützt.
Weitere Informationen finden Sie im Leitfaden zur Audiotranskription, im Leitfaden zur Live-Transkription und auf der Modellseite für Gemini 3.5 Transcribe.
- Gemini 3.5 Transcribe (