Back to feed

Changelog Update

Sep 27, 2026
Google/Gemini APIAPIv3.5
  • Ogólna dostępność Gemini 3.5 Transcribe: udostępniliśmy 2 modele do transkrypcji mowy oparte na funkcji rozumienia dźwięku w Gemini:

    • Gemini 3.5 Transcribe (gemini-3.5-transcribe): bardzo dokładna, o niskim opóźnieniu, niestrumieniowa funkcja zamiany mowy na tekst z wykrywaniem języka na podstawie wypowiedzi w ponad 85 językach, rozróżnianiem mówców, znacznikami czasu na poziomie słów i ustawianiem preferencji dla słownictwa niestandardowego (do 1000 terminów).
    • Gemini 3.5 Transcribe Live (gemini-3.5-transcribe-live): dwukierunkowe przesyłanie strumieniowe mowy na tekst o niskim opóźnieniu za pomocą protokołu WebSockets z użyciem interfejsu Live API, obsługujące zdarzenia transkrypcji tymczasowej i końcowej, tryb inteligentnej transkrypcji oraz wiele strategii wykrywania aktywności głosowej (VAD).

    Aby rozpocząć, zapoznaj się z przewodnikiem po transkrypcji dźwięku, przewodnikiem po transkrypcji na żywo i stroną modelu Gemini 3.5 do transkrypcji.