Changelog Update
- È stato rilasciato
veo-2.0-generate-001, un modello di generazione video da testo e immagini disponibile a livello generale (GA) in grado di generare video dettagliati e artisticamente sfumati. Per saperne di più, consulta la documentazione di Veo. È stata rilasciata il giorno
gemini-2.0-flash-live-001una versione di anteprima pubblica del modello Live API con la fatturazione abilitata.Gestione e affidabilità delle sessioni migliorate
- Ripresa della sessione:mantieni attive le sessioni in caso di interruzioni temporanee della rete. L'API ora supporta l'archiviazione dello stato della sessione lato server (fino a 24 ore) e fornisce handle (session_resumption) per riconnettersi e riprendere da dove avevi interrotto.
- Sessioni più lunghe tramite la compressione del contesto: consente interazioni più lunghe rispetto ai limiti di tempo precedenti. Configura la compressione della finestra contestuale con un meccanismo di finestra scorrevole per gestire automaticamente la lunghezza del contesto, evitando interruzioni improvvise dovute ai limiti del contesto.
- Notifica di disconnessione controllata:ricevi un messaggio del server
GoAwayche indica quando una connessione sta per chiudersi, consentendo una gestione controllata prima della chiusura.
Maggiore controllo sulle dinamiche di interazione
Rilevamento dell'attività vocale (VAD) configurabile: scegli i livelli di sensibilità o disattiva completamente il VAD automatico e utilizza i nuovi eventi client (
activityStart,activityEnd) per il controllo manuale del turno.Gestione configurabile delle interruzioni:decidi se l'input dell'utente deve interrompere la risposta del modello.
Copertura della rotazione configurabile:scegli se l'API elabora continuamente tutti gli input audio e video o li acquisisce solo quando viene rilevato che l'utente finale sta parlando.
Risoluzione dei contenuti multimediali configurabile: ottimizza la qualità o l'utilizzo dei token selezionando la risoluzione per i contenuti multimediali di input.
Output e funzionalità più ricchi
Opzioni di voce e lingua ampliate: scegli tra due nuove voci e 30 nuove lingue per l'uscita audio. La lingua di output è ora configurabile in
speechConfig.Streaming di testo:ricevi risposte di testo in modo incrementale man mano che vengono generate, consentendo una visualizzazione più rapida per l'utente.
Report sull'utilizzo dei token:ottieni approfondimenti sull'utilizzo con conteggi dettagliati dei token forniti nel campo
usageMetadatadei messaggi del server, suddivisi per modalità e fasi di prompt o risposta.