Back to feed

Changelog Update

Apr 9, 2025
Google/Gemini APIAPIv2.0-generate
  • È stato rilasciato veo-2.0-generate-001, un modello di generazione video da testo e immagini disponibile a livello generale (GA) in grado di generare video dettagliati e artisticamente sfumati. Per saperne di più, consulta la documentazione di Veo.
  • È stata rilasciata il giorno gemini-2.0-flash-live-001 una versione di anteprima pubblica del modello Live API con la fatturazione abilitata.

    • Gestione e affidabilità delle sessioni migliorate

      • Ripristino della sessione:mantieni attive le sessioni in caso di interruzioni temporanee della rete. L'API ora supporta l'archiviazione dello stato della sessione lato server (fino a 24 ore) e fornisce handle (session_resumption) per riconnettersi e riprendere da dove avevi interrotto.
      • Sessioni più lunghe tramite la compressione del contesto:consente interazioni estese oltre i limiti di tempo precedenti. Configura la compressione della finestra contestuale con un meccanismo a finestra scorrevole per gestire automaticamente la lunghezza del contesto, evitando interruzioni improvvise dovute ai limiti del contesto.
      • Notifica di disconnessione controllata:ricevi un messaggio del server GoAway che indica quando una connessione sta per chiudersi, consentendo una gestione controllata prima della chiusura.
    • Maggiore controllo sulle dinamiche di interazione

    • Rilevamento dell'attività vocale (VAD) configurabile: scegli i livelli di sensibilità o disattiva completamente il VAD automatico e utilizza i nuovi eventi client (activityStart, activityEnd) per il controllo manuale del turno.

    • Gestione configurabile delle interruzioni:decidi se l'input dell'utente deve interrompere la risposta del modello.

    • Copertura della rotazione configurabile:scegli se l'API elabora continuamente tutti gli input audio e video o li acquisisce solo quando viene rilevato che l'utente finale sta parlando.

    • Risoluzione dei contenuti multimediali configurabile: ottimizza la qualità o l'utilizzo dei token selezionando la risoluzione per i contenuti multimediali di input.

    • Output e funzionalità più ricchi

    • Opzioni di voce e lingua ampliate:scegli tra due nuove voci e 30 nuove lingue per l'uscita audio. La lingua di output ora è configurabile all'interno di speechConfig.

    • Streaming di testo:ricevi risposte di testo in modo incrementale man mano che vengono generate, consentendo una visualizzazione più rapida per l'utente.

    • Report sull'utilizzo dei token:ottieni approfondimenti sull'utilizzo con conteggi dettagliati dei token forniti nel campo usageMetadata dei messaggi del server, suddivisi per modalità e fasi di prompt o risposta.