Back to feed

Changelog Update

Apr 9, 2025
Google/Gemini APIAPIv2.0-generate
  • Merilis veo-2.0-generate-001, model text- dan image-to-video yang tersedia secara umum (GA), yang mampu menghasilkan video yang mendetail dan bernuansa artistik. Untuk mempelajari lebih lanjut, lihat dokumentasi Veo.
  • Merilis gemini-2.0-flash-live-001, versi pratinjau publik model Live API dengan penagihan diaktifkan.

    • Peningkatan Pengelolaan Sesi dan Keandalan

      • Lanjutan Sesi: Menjaga sesi tetap aktif saat terjadi gangguan jaringan sementara. API kini mendukung penyimpanan status sesi sisi server (hingga 24 jam) dan menyediakan handle (session_resumption) untuk terhubung kembali dan melanjutkan dari tempat Anda berhenti.
      • Sesi yang Lebih Panjang melalui Kompresi Konteks: Memungkinkan interaksi yang lebih panjang dari batas waktu sebelumnya. Konfigurasi kompresi jendela konteks dengan mekanisme jendela geser untuk mengelola panjang konteks secara otomatis, sehingga mencegah penghentian mendadak karena batas konteks.
      • Notifikasi Pemutusan Koneksi yang Baik: Menerima pesan server GoAway yang menunjukkan kapan koneksi akan ditutup, sehingga memungkinkan penanganan yang baik sebelum penghentian.
    • Kontrol Lebih Besar atas Dinamika Interaksi

    • Deteksi Aktivitas Suara (VAD) yang Dapat Dikonfigurasi: Pilih tingkat sensitivitas atau nonaktifkan VAD otomatis sepenuhnya dan gunakan peristiwa klien baru (activityStart, activityEnd) untuk kontrol pergantian manual.

    • Penanganan Interupsi yang Dapat Dikonfigurasi: Tentukan apakah input pengguna harus menginterupsi respons model.

    • Cakupan Putaran yang Dapat Dikonfigurasi: Pilih apakah API memproses semua input audio dan video secara terus-menerus atau hanya merekamnya saat pengguna akhir terdeteksi sedang berbicara.

    • Resolusi Media yang Dapat Dikonfigurasi: Optimalkan kualitas atau penggunaan token dengan memilih resolusi untuk media input.

    • Output dan Fitur yang Lebih Kaya

    • Opsi Suara & Bahasa yang Lebih Banyak: Pilih dari dua suara baru dan 30 bahasa baru untuk output audio. Bahasa output kini dapat dikonfigurasi dalam speechConfig.

    • Streaming Teks: Menerima respons teks secara bertahap saat respons tersebut dibuat, sehingga memungkinkan tampilan yang lebih cepat kepada pengguna.

    • Pelaporan Penggunaan Token: Dapatkan insight tentang penggunaan dengan jumlah token mendetail yang diberikan di kolom usageMetadata pesan server, yang dikelompokkan menurut modalitas dan fase perintah atau respons.