Changelog Update
Gemini 3.5 Transcribe in disponibilità generale (GA): sono stati rilasciati due modelli di sintesi vocale dedicati basati sulla comprensione dell'audio di Gemini:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): sintesi vocale non in streaming ad alta precisione e bassa latenza con rilevamento della lingua basato sulle espressioni in oltre 85 lingue, diarizzazione degli oratori, timestamp a livello di parola e bias del vocabolario personalizzato (fino a 1000 termini). - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): Streaming bidirezionale di conversione della voce in testo a bassa latenza tramite WebSocket utilizzando l'API Live, che supporta eventi di trascrizione provvisori e finali, la modalità di trascrizione intelligente e più strategie di rilevamento di attività vocale (VAD).
Per iniziare, consulta la guida alla trascrizione audio, la guida alla trascrizione live e la pagina del modello Gemini 3.5 Transcribe.
- Gemini 3.5 Transcribe (