Back to feed

Changelog Update

Oct 2, 2026
Google/Gemini APIAPIv3.5
  • Gemini 3.5 Transcribe in disponibilità generale (GA): sono stati rilasciati due modelli di sintesi vocale dedicati basati sulla comprensione dell'audio di Gemini:

    • Gemini 3.5 Transcribe (gemini-3.5-transcribe): sintesi vocale non in streaming ad alta precisione e bassa latenza con rilevamento della lingua basato sulle espressioni in oltre 85 lingue, diarizzazione degli oratori, timestamp a livello di parola e bias del vocabolario personalizzato (fino a 1000 termini).
    • Gemini 3.5 Transcribe Live (gemini-3.5-transcribe-live): Streaming bidirezionale di conversione della voce in testo a bassa latenza tramite WebSocket utilizzando l'API Live, che supporta eventi di trascrizione provvisori e finali, la modalità di trascrizione intelligente e più strategie di rilevamento di attività vocale (VAD).

    Per iniziare, consulta la guida alla trascrizione audio, la guida alla trascrizione live e la pagina del modello Gemini 3.5 Transcribe.