Cyber News

Gemini 3.8 Live: голосовой агент Google думает и ходит в API, не прерывая разговор

M
Markabus
·
Крупный план студийного микрофона на тёмном рабочем столе, позади в расфокусе монитор с синей звуковой волной и аудиоинтерфейс со светящимися индикаторами. Иллюстрация · изображение сгенерировано ИИ

15 сентября Google выпустила две модели, заточенные под голос: Gemini 3.8 Live и Gemini 3.8 Live Extended Thinking. Это не «озвучка» текстовой модели, а speech-to-speech (речь-в-речь — модель принимает звук и сразу отдаёт звук, без промежуточной расшифровки в текст и обратно). Главное изменение по сравнению с прошлым поколением сформулировано в анонсе прямо: модель теперь может рассуждать и вызывать внешние инструменты, не прерывая разговор.

Звучит как мелочь, но именно на этом ломались голосовые боты последних двух лет. Как только агенту нужно было сходить в базу или в чужой API, разговор замирал: пользователь слышал тишину, начинал переспрашивать, бот перебивал сам себя. Google закрывает эту дыру двумя способами сразу — фоновым исполнением инструментов и «думающим вслух» режимом.

Две модели: дешёвая и думающая

Разделение простое и повторяет логику, которую Google уже применяла в линейке Flash.

  • Gemini 3.8 Live — рабочая лошадка для объёма. Ставка на стоимость и разговорную плавность: приём заказов, справочные линии, ассистенты в приложении, всё, где важнее цена за минуту, чем глубина рассуждения.
  • Gemini 3.8 Live Extended Thinking — вариант для сложных многошаговых задач с настраиваемым «бюджетом размышления» (configurable thinking). Он рассуждает и говорит одновременно, вставляя естественные словесные маркеры вроде «Сейчас проверю…» и проговаривая ход работы, пока выполняет шаги.

Второй пункт — не косметика. Голосовой интерфейс не прощает пауз: полторы секунды тишины человек считывает как «связь оборвалась». Проговаривание прогресса — это способ выкупить время на реальную работу агента, не теряя собеседника.

Пять вещей, которые изменились для разработчика

1. Фоновые вызовы инструментов

Модель умеет запускать функции и обращения к API асинхронно — прямо во время того, как продолжает стримить аудио-ответ. Результат подмешивается в разговор, когда приходит. Раньше типичная обвязка требовала вручную городить «заполнитель тишины» и state-машину, которая аккуратно склеивает ответ инструмента с репликой.

2. Визуальный контекст в реальном времени

Модель обрабатывает видеопоток — камеру или демонстрацию экрана — почти в реальном времени и использует увиденное как контекст разговора. Для поддержки это означает сценарий «покажите мне экран, на котором ошибка» без переключения на отдельный мультимодальный запрос.

3. Точность на буквенно-цифровых данных

Отдельно заявлена alphanumeric precision — корректное распознавание кодов, артикулов, номеров заказов и прочих строк вида «BX-4471-K». Это та самая боль, из-за которой голосовые боты в e-commerce и логистике до сих пор переспрашивают по три раза.

4. 97 языков с автопереключением

Модель сама определяет язык и переключается посреди разговора, без указания языка в конфигурации сессии. Для мультиязычной поддержки это снимает целый класс задач: не нужен предварительный детектор языка и не нужно разводить звонки по разным пайплайнам.

5. Слияние аудио и структурированных данных

Инкрементальные обновления контента позволяют совмещать живой голосовой поток с выдачей структурированных данных — то есть агент может одновременно говорить и наполнять карточку заказа или форму в интерфейсе.

Что показывают бенчмарки

Google приводит замеры внешних площадок, а не только собственные. Gemini 3.8 Live Extended Thinking:

  • 82,6 в Speech to Speech Quality Index от Artificial Analysis — первое место в общем зачёте;
  • 68,6 % выполнения агентных задач в τ-Voice;
  • 35,1 % в τ-Voice-banking от Sierra — это набор реалистичных задач клиентского обслуживания в банке, и низкие абсолютные цифры у всех участников хорошо показывают, насколько голосовые агенты ещё далеки от «решает всё сам»;
  • 97,7 % в Big Bench Audio на аудио-рассуждение.

Базовая Gemini 3.8 Live заняла второе место в Speech Agent Arena.

По сводке Artificial Analysis, которую приводят обозреватели, ближайшие конкуренты в Speech to Speech Quality Index идут плотно: GPT-Live-1 Astra — 81,5, Grok Voice Think Fast 2.0 — 81,3. Разрыв заметнее на агентных наборах: в τ-Voice Astra набирает 67,9 %, Grok — 56,5 %; в банковском наборе Sierra у Astra 32,0 %, у xAI-Realtime — 16,5 %. То есть по «качеству речи» тройка практически сравнялась, а расходятся модели на умении довести задачу до конца.

Цена

В блоге для разработчиков Google называет тариф на аудио: $0,005 за минуту входящего звука и $0,018 за минуту исходящего. Для сравнения, Grok Voice Think Fast 2.0 в июле стоил $0,08 за минуту — разница на порядок.

Важная оговорка: полного прайса с разбивкой по двум вариантам модели Google в анонсе не опубликовала, и режим Extended Thinking с включённым «бюджетом размышления» почти наверняка обойдётся дороже базового. Прежде чем закладывать экономику в продукт, стоит дождаться обновления страницы тарифов Gemini API и померить реальное потребление на своём трафике.

Транскрибация и остальной аудио-стек

Вместе с Live-моделями вышла Gemini 3.5 Transcribe — отдельная модель распознавания речи в текст: 85+ языков, WER (word error rate, доля ошибочно распознанных слов) 4,0 % в потоковом режиме и 2,6 % в пакетном. Если задача — расшифровка звонков или субтитры, брать полноценную разговорную модель незачем.

Аудио-линейка Google теперь выглядит так: Live-модели для диалога, 3.5 Transcribe для распознавания, Gemini 3.5 Live Translate для перевода (70+ языков), Gemini 3.1 Flash TTS для синтеза речи и Lyria 3.5 для генерации музыки.

Весь генерируемый аудиовыход помечается водяным знаком SynthID — Google встраивает его для последующей детекции сгенерированного звука.

Где это уже работает

  • Разработчикам: Gemini API и Google AI Studio. Заявлены готовые интеграции с LiveKit, Pipecat, LangChain, Agora и Vercel — то есть подключать модель к существующей WebRTC-обвязке не придётся с нуля.
  • Компаниям: закрытое превью в Gemini Enterprise, отдельно обещан вариант для клиентского обслуживания.
  • Пользователям: 3.8 Live — в Search Live; Extended Thinking — в Gemini Live и в Google Workspace (в Документах для подписчиков Pro/Ultra, в Gmail и Keep — для всех платных ИИ-подписок).

Чего Google не раскрыла

Анонс обходит стороной ровно те цифры, без которых голосового агента не выкатывают в прод: перцентили сквозной задержки (p50/p95), лимит контекста сессии, региональную доступность и детальное описание поведения при перебивании собеседником. Это не придирка: в голосовом сценарии хвостовая задержка важнее средней — именно редкие долгие паузы ломают разговор, а не средние 300 мс. Пока эти данные не опубликованы, единственный способ понять пригодность модели — прогнать её на своих сценариях самому.

Что это значит на практике

Голосовой агент перестал быть отдельной экзотической веткой разработки и превращается в обычный API-вызов поверх той же логики, что и текстовый. Владельцу интернет-магазина это даёт реалистичный сценарий «бот принимает заказ по телефону, сам проверяет наличие на складе и не молчит, пока проверяет». Разработчику — возможность выкинуть половину самописной обвязки: детектор языка, буфер тишины, ручную склейку ответов инструментов.

Ограничение остаётся прежним и хорошо видно по банковскому набору Sierra: 35 % доведённых до конца задач — это всё ещё сценарий «агент как первая линия с быстрой эскалацией на человека», а не «агент вместо оператора». Тенденция при этом однозначная: конкуренция среди голосовых моделей за год сместилась с качества синтеза речи на умение выполнять работу — примерно так же, как это произошло с текстовыми агентами после выхода Agents API у OpenAI.

Частые вопросы

Q.Чем Gemini 3.8 Live отличается от Extended Thinking?

Базовая Gemini 3.8 Live оптимизирована под объём и стоимость: разговорная плавность, визуальное понимание, минимальная цена за минуту. Extended Thinking добавляет настраиваемый «бюджет размышления» для многошаговых задач — модель рассуждает и говорит одновременно, проговаривая ход работы вслух. Именно этот вариант занял первое место в Speech to Speech Quality Index (82,6).

Q.Сколько стоит использование моделей?

В блоге для разработчиков Google указывает $0,005 за минуту входящего аудио и $0,018 за минуту исходящего. Полного прайса с разбивкой по двум вариантам модели в анонсе нет, поэтому стоимость режима Extended Thinking с включённым размышлением стоит уточнять на странице тарифов Gemini API.

Q.Нужно ли указывать язык при создании сессии?

Нет. Модель сама определяет язык и переключается между 97 языками прямо посреди разговора. Отдельный детектор языка и разные пайплайны под разные языки больше не нужны.

Q.Можно ли использовать эти модели для расшифровки звонков?

Для чистого распознавания речи в текст лучше подходит выпущенная вместе с ними Gemini 3.5 Transcribe: 85+ языков, WER 4,0 % в потоковом режиме и 2,6 % в пакетном. Полноценная разговорная speech-to-speech модель для этой задачи избыточна.

Источники

Предыдущая
iOS 27 вышла: Siri AI читает экран и действует в приложениях, а Safari 27 привозит кастомный select и top-level await

Читайте также

Смартфон в алюминиевой подставке на столе разработчика: на экране мобильная веб-страница и панель инспектора, позади — ноутбук с кодом. Иллюстрация · изображение не отражает реальный продуктCyber News
15 сентября 2026 г.

iOS 27 вышла: Siri AI читает экран и действует в приложениях, а Safari 27 привозит кастомный select и top-level await

Apple выпустила iOS 27, macOS 27 и Safari 27. Новая Siri AI видит содержимое экрана, подтягивает личный контекст и выполняет действия в приложениях через App Intents — но только на английском и не в ЕС. Разбираем ограничения релиза и новинки WebKit, которые важнее ассистента.

Читать →
Ноутбук на тёмном рабочем столе разработчика: на экране терминал с выводом менеджера пакетов, рядом клавиатура с подсветкой и внешний SSD. Иллюстрация · изображение сгенерировано ИИCyber News
14 сентября 2026 г.

Homebrew 7.0.0: встроенный сканер уязвимостей, графическое приложение и понижение Intel-маков до Tier 3

13 сентября вышел первый за полтора года мажорный релиз Homebrew: команда brew vulns проверяет пакеты по базе OSV, появилось приложение BrewUI, установка стала параллельной. Intel-маки переведены в третий уровень поддержки — запуск на них отключат в сентябре 2027-го.

Читать →
Крупный план рабочего места разработчика в тёмной графитовой комнате: на большом мониторе запущенная терминальная сессия с логами и редактор кода с подсветкой синтаксиса, позади — второй экран с панелями мониторингаCyber News
11 сентября 2026 г.

OpenAI открыла Agents API: обвязка Codex доступна через один вызов, песочницы — в комплекте

10 сентября OpenAI выпустила Agents API в публичной бете: управляющий слой Codex, долгоживущие сессии, автоматическая компактация контекста, субагенты, MCP и хостируемые песочницы. Разбираем, что это меняет для разработчиков, сколько стоят контейнеры и почему бета пока не подойдёт части команд.

Читать →