Changelog Update
Gemini 3.5 Transcribe — общедоступная версия (GA) : выпущены две специализированные модели преобразования речи в текст, основанные на технологии распознавания звука Gemini:
- Gemini 3.5 Transcribe (
gemini-3.5-transcribe): Высокоточная, низкозадержечная система преобразования речи в текст без потоковой передачи, с распознаванием языка на основе отдельных фраз более чем на 85 языках, диаризацией говорящих, временными метками на уровне слов и настраиваемым словарём (до 1000 терминов). - Gemini 3.5 Transcribe Live (
gemini-3.5-transcribe-live): Двусторонняя потоковая передача речи в текст с низкой задержкой через WebSockets с использованием Live API, поддерживающая промежуточные и окончательные события транскрипции, интеллектуальный режим транскрипции и несколько стратегий обнаружения голосовой активности (VAD).
Для начала ознакомьтесь с руководством по транскрипции аудиозаписей , руководством по транскрипции в реальном времени и страницей модели Gemini 3.5 Transcribe .
- Gemini 3.5 Transcribe (