Back to feed

Changelog Update

Sep 28, 2026
Google/Gemini APIAPIv3.5
  • Gemini 3.5 Transcribe सामान्य रूप से उपलब्ध (जीए) है: Gemini की ऑडियो समझने की क्षमता के आधार पर, दो खास स्पीच-टू-टेक्स्ट मॉडल रिलीज़ किए गए हैं:

    • Gemini 3.5 Transcribe (gemini-3.5-transcribe): यह सुविधा, 85 से ज़्यादा भाषाओं में बोली को टेक्स्ट में बदलने की सुविधा देती है. इसमें बहुत कम समय लगता है और यह सटीक नतीजे देती है. इसमें, बोले गए शब्दों के आधार पर भाषा का पता लगाया जाता है. साथ ही, यह सुविधा बताती है कि कौनसे शब्द किसने बोले. इसमें शब्दों के लेवल पर टाइमस्टैंप भी मिलते हैं. इसके अलावा, इसमें कस्टम शब्दावली के आधार पर शब्दों को प्राथमिकता देने की सुविधा भी मिलती है. इसमें ज़्यादा से ज़्यादा 1,000 शब्दों को प्राथमिकता दी जा सकती है.
    • Gemini 3.5 Transcribe Live (gemini-3.5-transcribe-live): लाइव एपीआई का इस्तेमाल करके, WebSockets पर कम समय में दोनों दिशाओं में स्पीच-टू-टेक्स्ट की सुविधा उपलब्ध कराई जाती है. इसमें, कुछ समय के लिए और फ़ाइनल ट्रांसक्रिप्शन इवेंट, स्मार्ट ट्रांसक्रिप्शन मोड, और आवाज़ की गतिविधि का पता लगाने (वीएडी) की कई रणनीतियां काम करती हैं.

    शुरू करने के लिए, ऑडियो ट्रांसक्रिप्शन गाइड, लाइव ट्रांसक्रिप्शन गाइड, और Gemini 3.5 Transcribe मॉडल पेज देखें.