Changelog Update
Ogólna dostępność Gemini 3.5 Transcribe: udostępniliśmy 2 modele do transkrypcji mowy oparte na funkcji rozumienia dźwięku w Gemini:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): bardzo dokładna, o niskim opóźnieniu, niestrumieniowa funkcja zamiany mowy na tekst z wykrywaniem języka na podstawie wypowiedzi w ponad 85 językach, rozróżnianiem mówców, znacznikami czasu na poziomie słów i ustawianiem preferencji dla słownictwa niestandardowego (do 1000 terminów). - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): dwukierunkowe przesyłanie strumieniowe mowy na tekst o niskim opóźnieniu za pomocą protokołu WebSockets z użyciem interfejsu Live API, obsługujące zdarzenia transkrypcji tymczasowej i końcowej, tryb inteligentnej transkrypcji oraz wiele strategii wykrywania aktywności głosowej (VAD).
Aby rozpocząć, zapoznaj się z przewodnikiem po transkrypcji dźwięku, przewodnikiem po transkrypcji na żywo i stroną modelu Gemini 3.5 do transkrypcji.
- Gemini 3.5 Transcribe (