Changelog Update
Disponibilidad general (DG) de Gemini 3.5 Transcribe: Lanzamos dos modelos de voz a texto dedicados basados en la comprensión de audio de Gemini:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): Transcripción de voz a texto sin transmisión y de alta precisión con baja latencia, detección de idioma basada en enunciados en más de 85 idiomas, identificación de oradores, marcas de tiempo a nivel de palabras y sesgo de vocabulario personalizado (hasta 1,000 términos). - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): Transcripción de voz a texto bidireccional y de baja latencia a través de WebSockets con la API de Live, que admite eventos de transcripción provisionales y finalizados, el modo de transcripción inteligente y varias estrategias de detección de actividad de voz (VAD).
Para comenzar, consulta la guía de transcripción de audio, la guía de transcripción en vivo y la página del modelo Gemini 3.5 Transcribe.
- Gemini 3.5 Transcribe (