15 сентября Google выпустила две модели, заточенные под голос: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Это не «озвучка» текстовой модели, а speech-to-speech (речь-в-речь — модель принимает звук и сразу отдаёт звук, без промежуточной расшифровки в текст и обратно). Главное изменение по сравнению с прошлым поколением сформулировано в анонсе прямо: модель теперь может рассуждать и вызывать внешние инструменты, не прерывая разговор.
Звучит как мелочь, но именно на этом ломались голосовые боты последних двух лет. Как только агенту нужно было сходить в базу или в чужой API, разговор замирал: пользователь слышал тишину, начинал переспрашивать, бот перебивал сам себя. Google закрывает эту дыру двумя способами сразу — фоновым исполнением инструментов и «думающим вслух» режимом.
Две модели: дешёвая и думающая
Разделение простое и повторяет логику, которую Google уже применяла в линейке Flash.
- Gemini 3.8 Live — рабочая лошадка для объёма. Ставка на стоимость и разговорную плавность: приём заказов, справочные линии, ассистенты в приложении, всё, где важнее цена за минуту, чем глубина рассуждения.
- Gemini 3.8 Live Extended Thinking — вариант для сложных многошаговых задач с настраиваемым «бюджетом размышления» (configurable thinking). Он рассуждает и говорит одновременно, вставляя естественные словесные маркеры вроде «Сейчас проверю…» и проговаривая ход работы, пока выполняет шаги.
Второй пункт — не косметика. Голосовой интерфейс не прощает пауз: полторы секунды тишины человек считывает как «связь оборвалась». Проговаривание прогресса — это способ выкупить время на реальную работу агента, не теряя собеседника.
Пять вещей, которые изменились для разработчика
1. Фоновые вызовы инструментов
Модель умеет запускать функции и обращения к API асинхронно — прямо во время того, как продолжает стримить аудио-ответ. Результат подмешивается в разговор, когда приходит. Раньше типичная обвязка требовала вручную городить «заполнитель тишины» и state-машину, которая аккуратно склеивает ответ инструмента с репликой.
2. Визуальный контекст в реальном времени
Модель обрабатывает видеопоток — камеру или демонстрацию экрана — почти в реальном времени и использует увиденное как контекст разговора. Для поддержки это означает сценарий «покажите мне экран, на котором ошибка» без переключения на отдельный мультимодальный запрос.
3. Точность на буквенно-цифровых данных
Отдельно заявлена alphanumeric precision — корректное распознавание кодов, артикулов, номеров заказов и прочих строк вида «BX-4471-K». Это та самая боль, из-за которой голосовые боты в e-commerce и логистике до сих пор переспрашивают по три раза.
4. 97 языков с автопереключением
Модель сама определяет язык и переключается посреди разговора, без указания языка в конфигурации сессии. Для мультиязычной поддержки это снимает целый класс задач: не нужен предварительный детектор языка и не нужно разводить звонки по разным пайплайнам.
5. Слияние аудио и структурированных данных
Инкрементальные обновления контента позволяют совмещать живой голосовой поток с выдачей структурированных данных — то есть агент может одновременно говорить и наполнять карточку заказа или форму в интерфейсе.
Что показывают бенчмарки
Google приводит замеры внешних площадок, а не только собственные. Gemini 3.8 Live Extended Thinking:
- 82,6 в Speech to Speech Quality Index от Artificial Analysis — первое место в общем зачёте;
- 68,6 % выполнения агентных задач в τ-Voice;
- 35,1 % в τ-Voice-banking от Sierra — это набор реалистичных задач клиентского обслуживания в банке, и низкие абсолютные цифры у всех участников хорошо показывают, насколько голосовые агенты ещё далеки от «решает всё сам»;
- 97,7 % в Big Bench Audio на аудио-рассуждение.
Базовая Gemini 3.8 Live заняла второе место в Speech Agent Arena.
По сводке Artificial Analysis, которую приводят обозреватели, ближайшие конкуренты в Speech to Speech Quality Index идут плотно: GPT-Live-1 Astra — 81,5, Grok Voice Think Fast 2.0 — 81,3. Разрыв заметнее на агентных наборах: в τ-Voice Astra набирает 67,9 %, Grok — 56,5 %; в банковском наборе Sierra у Astra 32,0 %, у xAI-Realtime — 16,5 %. То есть по «качеству речи» тройка практически сравнялась, а расходятся модели на умении довести задачу до конца.
Цена
В блоге для разработчиков Google называет тариф на аудио: $0,005 за минуту входящего звука и $0,018 за минуту исходящего. Для сравнения, Grok Voice Think Fast 2.0 в июле стоил $0,08 за минуту — разница на порядок.
Важная оговорка: полного прайса с разбивкой по двум вариантам модели Google в анонсе не опубликовала, и режим Extended Thinking с включённым «бюджетом размышления» почти наверняка обойдётся дороже базового. Прежде чем закладывать экономику в продукт, стоит дождаться обновления страницы тарифов Gemini API и померить реальное потребление на своём трафике.
Транскрибация и остальной аудио-стек
Вместе с Live-моделями вышла Gemini 3.5 Transcribe — отдельная модель распознавания речи в текст: 85+ языков, WER (word error rate, доля ошибочно распознанных слов) 4,0 % в потоковом режиме и 2,6 % в пакетном. Если задача — расшифровка звонков или субтитры, брать полноценную разговорную модель незачем.
Аудио-линейка Google теперь выглядит так: Live-модели для диалога, 3.5 Transcribe для распознавания, Gemini 3.5 Live Translate для перевода (70+ языков), Gemini 3.1 Flash TTS для синтеза речи и Lyria 3.5 для генерации музыки.
Весь генерируемый аудиовыход помечается водяным знаком SynthID — Google встраивает его для последующей детекции сгенерированного звука.
Где это уже работает
- Разработчикам: Gemini API и Google AI Studio. Заявлены готовые интеграции с LiveKit, Pipecat, LangChain, Agora и Vercel — то есть подключать модель к существующей WebRTC-обвязке не придётся с нуля.
- Компаниям: закрытое превью в Gemini Enterprise, отдельно обещан вариант для клиентского обслуживания.
- Пользователям: 3.8 Live — в Search Live; Extended Thinking — в Gemini Live и в Google Workspace (в Документах для подписчиков Pro/Ultra, в Gmail и Keep — для всех платных ИИ-подписок).
Чего Google не раскрыла
Анонс обходит стороной ровно те цифры, без которых голосового агента не выкатывают в прод: перцентили сквозной задержки (p50/p95), лимит контекста сессии, региональную доступность и детальное описание поведения при перебивании собеседником. Это не придирка: в голосовом сценарии хвостовая задержка важнее средней — именно редкие долгие паузы ломают разговор, а не средние 300 мс. Пока эти данные не опубликованы, единственный способ понять пригодность модели — прогнать её на своих сценариях самому.
Что это значит на практике
Голосовой агент перестал быть отдельной экзотической веткой разработки и превращается в обычный API-вызов поверх той же логики, что и текстовый. Владельцу интернет-магазина это даёт реалистичный сценарий «бот принимает заказ по телефону, сам проверяет наличие на складе и не молчит, пока проверяет». Разработчику — возможность выкинуть половину самописной обвязки: детектор языка, буфер тишины, ручную склейку ответов инструментов.
Ограничение остаётся прежним и хорошо видно по банковскому набору Sierra: 35 % доведённых до конца задач — это всё ещё сценарий «агент как первая линия с быстрой эскалацией на человека», а не «агент вместо оператора». Тенденция при этом однозначная: конкуренция среди голосовых моделей за год сместилась с качества синтеза речи на умение выполнять работу — примерно так же, как это произошло с текстовыми агентами после выхода Agents API у OpenAI.
Частые вопросы
Базовая Gemini 3.8 Live оптимизирована под объём и стоимость: разговорная плавность, визуальное понимание, минимальная цена за минуту. Extended Thinking добавляет настраиваемый «бюджет размышления» для многошаговых задач — модель рассуждает и говорит одновременно, проговаривая ход работы вслух. Именно этот вариант занял первое место в Speech to Speech Quality Index (82,6).
В блоге для разработчиков Google указывает $0,005 за минуту входящего аудио и $0,018 за минуту исходящего. Полного прайса с разбивкой по двум вариантам модели в анонсе нет, поэтому стоимость режима Extended Thinking с включённым размышлением стоит уточнять на странице тарифов Gemini API.
Нет. Модель сама определяет язык и переключается между 97 языками прямо посреди разговора. Отдельный детектор языка и разные пайплайны под разные языки больше не нужны.
Для чистого распознавания речи в текст лучше подходит выпущенная вместе с ними Gemini 3.5 Transcribe: 85+ языков, WER 4,0 % в потоковом режиме и 2,6 % в пакетном. Полноценная разговорная speech-to-speech модель для этой задачи избыточна.
Источники
- 1.Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking — Google Bloghttps://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinking/
- 2.Build real-time voice applications with Gemini 3.8 Live and 3.5 Transcribe — Google Bloghttps://blog.google/innovation-and-ai/technology/developers-tools/build-real-time-voice-applications-gemini-audio/
- 3.Google Releases Gemini 3.8 Live and 3.8 Live Extended Thinking for Production Grade Voice Agents — MarkTechPosthttps://www.marktechpost.com/2026/09/15/google-releases-gemini-3-8-live-and-3-8-live-extended-thinking-for-production-grade-voice-agents/
- 4.Google Launches Gemini 3.8 Live and Extended Thinking Voice Models — Unite.AIhttps://www.unite.ai/google-launches-gemini-3-8-live-and-extended-thinking-voice-models/
- 5.Google Releases Gemini 3.8 Live-Extended Conversational Model — OfficeChaihttps://officechai.com/ai/google-releases-gemini-3-8-live-extended-conversational-model-claims-better-performance-than-gpt-live-1-astra-and-grok-voice-think-fast-2-0-at-lower-price/



