Changelog Update
Gemini 3.5 Transcribe พร้อมใช้งานสำหรับผู้ใช้ทั่วไป (GA): เปิดตัวโมเดลการแปลงเสียงเป็นข้อความ 2 รายการโดยเฉพาะซึ่งอิงตามความเข้าใจเสียงของ Gemini
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): การแปลงเสียงพูดเป็นข้อความแบบไม่สตรีมมิงที่มีความแม่นยำสูง และเวลาในการตอบสนองต่ำ พร้อมการตรวจหาภาษาตามคำพูด ในกว่า 85 ภาษา การระบุผู้พูด การประทับเวลาที่ระดับคำ และการปรับคำศัพท์ที่กำหนดเอง (สูงสุด 1,000 คำ) - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): การสตรีมเสียงแบบสองทางที่มีเวลาในการตอบสนองต่ำเป็นข้อความผ่าน WebSockets โดยใช้ Live API ซึ่งรองรับเหตุการณ์การถอดเสียงชั่วคราวและขั้นสุดท้าย โหมดการถอดเสียงอัจฉริยะ และกลยุทธ์การตรวจจับกิจกรรมเสียงพูด (VAD) หลายรายการ
หากต้องการเริ่มต้นใช้งาน โปรดดู คู่มือการถอดเสียง คู่มือการถอดเสียงแบบเรียลไทม์ และ หน้าโมเดลการถอดเสียง Gemini 3.5
- Gemini 3.5 Transcribe (