Changelog Update
Gemini 3.5 Transcribe 正式發布:根據 Gemini 的音訊理解能力,推出兩種專用的語音轉文字模型:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe):高準確度、低延遲的非串流語音轉文字服務,支援 85 種以上的語言,可偵測以語句為單位的語言、區分說話者、提供字詞層級的時間戳記,以及自訂詞彙偏誤 (最多 1,000 個字詞)。 - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): 透過 WebSockets 使用 Live API,以低延遲雙向串流方式將語音轉錄為文字,支援暫時和最終轉錄事件、智慧轉錄模式,以及多種語音活動偵測 (VAD) 策略。
如要開始使用,請參閱語音轉錄指南、即時轉錄指南和 Gemini 3.5 Transcribe 模型頁面。
- Gemini 3.5 Transcribe (