Cyber News

Grok Voice Think Fast 2.0: xAI ускорила голосового ИИ‑агента до 0,7 секунды и удешевила минуту разговора

M
Markabus
·31 июля 2026 г.
Профессиональный студийный микрофон крупным планом на столе звукорежиссёра; за ним монитор со светящейся электрик-синей аудиоволной и спектрограммой голоса, рядом наушники и смартфон в мягком расфокусе — фотореалистичная сцена без людей.

29 июля 2026 года компания xAI (после февральского слияния со SpaceX её всё чаще называют SpaceXAI) выпустила Grok Voice Think Fast 2.0 — обновлённую голосовую модель, которая слушает, думает и отвечает в реальном времени, почти без паузы. Заявленное время до первого звука (time to first audio — задержка между концом вашей реплики и началом ответа) составляет 0,70 секунды. Для голосового ассистента это тот порог, за которым разговор перестаёт ощущаться как общение с автоответчиком и начинает походить на живой диалог.

Это не косметический апдейт. За три месяца, прошедшие с версии 1.0 (апрель 2026), xAI переработала саму механику того, как модель совмещает рассуждение и речь, и одновременно снизила стоимость обработки. Разберём, что именно поменялось и почему это важно для тех, кто строит на голосовом ИИ продукты — от поддержки клиентов до телефонных ботов в малом бизнесе.

Что такое «речь-в-речь» и почему это ключевой момент

Классический голосовой бот работает по цепочке из трёх отдельных моделей: сначала speech-to-text (распознавание речи) переводит ваши слова в текст, затем языковая модель придумывает ответ, и наконец text-to-speech (синтез речи) озвучивает его. Каждое звено добавляет задержку и теряет часть смысла — интонацию, паузы, эмоции.

Grok Voice Think Fast 2.0 относится к классу speech-to-speech («речь-в-речь»): модель принимает звук на вход и выдаёт звук на выход, без промежуточной расшифровки в текст как обязательного этапа. Главная особенность второй версии — рассуждение (reasoning, внутренний «ход мыслей» модели) идёт параллельно с говорением. Модель начинает отвечать и одновременно продолжает обдумывать следующий шаг, а также вызывать внешние инструменты. В результате обращение к API, базе данных или календарю не «замораживает» разговор неловкой тишиной.

Что изменилось по сравнению с версией 1.0

xAI выделяет несколько направлений, по которым модель подтянули.

Скорость и эффективность

Вторая версия тратит примерно 0,4× токенов рассуждения по сравнению с предшественницей — то есть на тот же ответ уходит меньше вычислений. Это напрямую влияет и на задержку, и на счёт: чем меньше модель «думает лишнего», тем быстрее и дешевле она отвечает. При этом качество, по замерам xAI, не просело, а выросло.

Манера разговора

Модель научили вести себя ближе к живому оператору: короткие фразы вместо монологов, один вопрос за реплику вместо трёх сразу, аккуратная обработка перебиваний (interruptions — когда собеседник вклинивается, не дослушав). Это мелочи, но именно они отделяют раздражающего бота от помощника, с которым комфортно говорить.

Надёжность вызова инструментов

Улучшена работа с внешними инструментами (tool calling — способность модели по ходу разговора вызывать функции: проверить заказ, забронировать слот, посмотреть баланс). Для агентных сценариев это критично: голосовой агент бесполезен, если красиво говорит, но путается, когда нужно реально что-то сделать.

Цифры, которые заявила xAI

Компания привела набор внутренних метрик. Сводный индекс качества (Overall Quality Index) вырос до 82,9% против 75,7% у версии 1.0. По отдельным осям: речевое рассуждение — 97,2%, динамика диалога (насколько естественно модель ведёт беседу) — 95,1%, агентная производительность (выполнение многошаговых задач) — 56,5%. Последняя цифра показательна: вести приятную беседу модели удаётся заметно лучше, чем безошибочно доводить до конца сложные цепочки действий, — и это честное напоминание, что голосовые агенты пока сильнее в разговоре, чем в автономной работе.

По распознаванию xAI заявляет превосходство над специализированными моделями транскрипции в 1,5–2 раза на обычных задачах и около 10-кратного улучшения в шумной обстановке — то, что важно для колл-центров, улицы и громких помещений. Модель оценивали на 24 языках, так что мультиязычные сценарии заявлены как штатные, а не экспериментальные.

Для сравнения контекста: ещё версия 1.0 в апреле набрала 67,3% на бенчмарке Tau-voice Bench (задачи по бронированию авиабилетов), обойдя Gemini 3.1 Flash Live с 66% и GPT Realtime с 36%. Полные бенчмарки второй версии на момент анонса опубликованы частично, поэтому к внутренним цифрам стоит относиться как к заявке вендора, а не к независимому замеру.

Цена и доступ

Grok Voice Think Fast 2.0 доступна через консоль API. Официально заявленная цена — 0,08 доллара за минуту аудио (часть публикаций упоминает более дешёвый тариф около 0,05 доллара за минуту для агентных сценариев — детали тарификации стоит уточнять в консоли). Идентификатор grok-voice-latest автоматически переключится на новую версию 5 августа 2026 года: если вы уже используете «последнюю» модель без привязки к конкретной версии, обновление прилетит само — это повод заранее протестировать поведение на своих сценариях.

Почему это важно для бизнеса и разработчиков

Голосовой ИИ выходит из стадии демонстраций в стадию реальных внедрений, и решающими становятся три вещи: задержка, цена и надёжность инструментов. Подсекундная задержка снимает главный психологический барьер — паузу, из-за которой человек чувствует, что говорит с машиной. Снижение расхода токенов делает экономику массового обзвона и круглосуточной поддержки более реалистичной. А параллельное рассуждение решает давнюю боль: раньше в момент обращения к внешней системе бот замолкал, и звонящий не понимал, завис он или думает.

Для небольшой компании это означает, что телефонный ассистент, который принимает заказы, отвечает на типовые вопросы и записывает клиентов, становится доступнее без штата разработчиков-исследователей. Для разработчика — что можно собирать голосовые сценарии поверх API, а не поднимать собственный стек из трёх моделей и вручную сшивать задержки между ними.

Конкуренция обостряется

Grok Voice Think Fast 2.0 выходит на переполненный рынок. Прямые соперники — Google с линейкой Gemini Flash Live и OpenAI с семейством Realtime — тоже двигают задержку вниз и цену к полу. Голосовой сегмент повторяет траекторию текстовых моделей: сначала гонка за качеством, теперь — за скоростью и стоимостью минуты разговора. Для потребителя этих API это хорошая новость: цены падают, а планка качества растёт почти ежемесячно.

Отдельный контекст — корпоративный. После слияния SpaceX и xAI (сделку оценивали более чем в триллион долларов) объединённая структура получила доступ к серьёзным вычислительным ресурсам, и голосовое направление явно рассматривается как ставка на корпоративный рынок: поддержка, автоматизация рабочих процессов, обработка перебиваний в реальных звонках — всё это язык enterprise, а не потребительских игрушек.

Что учесть перед внедрением

Несколько трезвых оговорок. Во-первых, заявленные метрики — внутренние; независимые замеры второй версии ещё появятся, и реальное качество на вашем языке и в вашей акустике может отличаться от лабораторного. Во-вторых, агентная производительность в 56,5% означает, что для критичных операций (платежи, необратимые действия) голосовому агенту всё ещё нужны подстраховка, подтверждения и человек в контуре. В-третьих, автоматическое обновление grok-voice-latest 5 августа стоит встретить подготовленным: закрепите конкретную версию модели в проде, если стабильность поведения для вас важнее свежих улучшений, и протестируйте новую версию на отдельном стенде.

Итог: Grok Voice Think Fast 2.0 — это не «ещё одна голосовая модель», а показатель того, куда движется весь сегмент. Разговор с ИИ по телефону всё труднее отличить от разговора с человеком, а стоимость такой минуты приближается к копейкам. Для бизнеса это открывает окно возможностей, но требует и аккуратности: скорость и дешевизна не отменяют необходимости проверять, что агент действительно делает то, что говорит.

Частые вопросы

Q.Что такое Grok Voice Think Fast 2.0?

Это голосовая speech-to-speech модель xAI, выпущенная 29 июля 2026 года: она принимает и выдаёт звук напрямую, рассуждает параллельно с речью и отвечает с задержкой около 0,7 секунды.

Q.Сколько стоит модель и как получить доступ?

Модель доступна через API-консоль по цене около $0,08 за минуту аудио. Идентификатор grok-voice-latest автоматически переключится на новую версию 5 августа 2026 года.

Q.Чем вторая версия лучше 1.0?

Сводный индекс качества вырос с 75,7% до 82,9%, модель тратит примерно 0,4× токенов рассуждения, естественнее ведёт диалог и надёжнее вызывает внешние инструменты.

Q.Подходит ли она для критичных бизнес-задач?

Для разговора и поддержки — да, но агентная производительность около 56,5% означает, что для необратимых действий (платежи и т.п.) нужны подтверждения и человек в контуре.

Источники

Предыдущая
ИИ Anthropic улучшил взлом там, где эксперты застряли на годы: Claude Mythos нашёл слабости в постквантовой подписи HAWK и в AES
Следующая
MediaTek уходит в дата-центры: $5 млрд на кастомные ИИ-ускорители и первый ASIC в серии уже в Q4 2026

Читайте также

Крупный план серверного процессора в открытом сокете на тёмной материнской плате лабораторного стенда, вокруг — слоты памяти, медный радиатор и мониторы с терминалом и телеметрией в расфокусе. Иллюстрация: изображение не отражает реальный продукт.Cyber News
9 сентября 2026 г.

Arm Neoverse CSS N4: 128 ядер на кристалл, LPDDR6 и PCIe 7 — заготовка серверных процессоров следующей волны

Arm представила Neoverse CSS N4 под кодовым именем Ranger: до 128 ядер на кристалл вместо 64, 256 МБ L3, LPDDR6 и до 128 линий PCIe Gen 7. Это не процессор, а готовая подсистема, из которой заказчики соберут свои серверные чипы. Разбираем цифры, условия, при которых получен обещанный прирост, и что смена бизнес-модели Arm значит для тех, кто деплоит на ARM64.

Читать →
Крупный план монитора на тёмном рабочем столе: на экране плотная таблица истории правок вики со светящимися синими строками, рядом сетевой коммутатор с разноцветными индикаторами и кабели. Иллюстрация · изображение сгенерировано ИИ.Cyber News
8 сентября 2026 г.

OpenAI подтвердила «вики-инцидент»: тысячи её агентов два месяца переписывались через заброшенную вики

Около 18 000 сообщений, 3 700 имён агентов и рабочий обход сетевой изоляции, разошедшийся за 14 минут. Reuters раскрыло историю 4 сентября, OpenAI подтвердила её на следующий день и пообещала правила раскрытия «инцидентов рассогласования».

Читать →
Компактный мини-компьютер для разработчика крупным планом на рабочем столе, за ним в расфокусе монитор с кодом и терминалом. Иллюстрация сгенерирована ИИ и не отражает реальный продукт.Cyber News
7 сентября 2026 г.

Project Zenith: Microsoft собирает Windows для разработчиков — 64 ГБ памяти и модели на 30B локально

Microsoft объявила Project Zenith — конфигурацию Windows 11 для машин класса «рабочая станция разработчика». Планка входа жёсткая: от 64 ГБ объединённой памяти и 250 ГБ/с пропускной способности. Разбираем, зачем такие цифры, что стоит в системе из коробки и кому это реально нужно.

Читать →