Back to feed

Changelog Update

Sep 26, 2026
Google/Gemini APIAPIv3.5
  • Gemini 3.5 Transcribe được phát hành rộng rãi (GA): Phát hành 2 mô hình chuyển lời nói sang văn bản chuyên dụng dựa trên khả năng hiểu âm thanh của Gemini:

    • Gemini 3.5 Transcribe (gemini-3.5-transcribe): Độ chính xác cao, độ trễ thấp, tính năng chuyển lời nói thành văn bản không truyền trực tuyến với tính năng phát hiện ngôn ngữ dựa trên câu nói cho hơn 85 ngôn ngữ, tính năng phân biệt người nói, dấu thời gian ở cấp độ từ và tính năng điều chỉnh từ vựng tuỳ chỉnh (tối đa 1.000 từ).
    • Gemini 3.5 Transcribe Live (gemini-3.5-transcribe-live): Tính năng chuyển lời nói thành văn bản theo cả hai chiều, độ trễ thấp, truyền trực tuyến qua WebSockets bằng Live API, hỗ trợ các sự kiện phiên âm tạm thời và hoàn chỉnh, chế độ Phiên âm thông minh và nhiều chiến lược phát hiện hoạt động giọng nói (VAD).

    Để bắt đầu, hãy xem Hướng dẫn chép lời âm thanh, Hướng dẫn chép lời trực tiếp và trang mô hình Gemini 3.5 Transcribe.