29 июля 2026 года компания xAI (после февральского слияния со SpaceX её всё чаще называют SpaceXAI) выпустила Grok Voice Think Fast 2.0 — обновлённую голосовую модель, которая слушает, думает и отвечает в реальном времени, почти без паузы. Заявленное время до первого звука (time to first audio — задержка между концом вашей реплики и началом ответа) составляет 0,70 секунды. Для голосового ассистента это тот порог, за которым разговор перестаёт ощущаться как общение с автоответчиком и начинает походить на живой диалог.
Это не косметический апдейт. За три месяца, прошедшие с версии 1.0 (апрель 2026), xAI переработала саму механику того, как модель совмещает рассуждение и речь, и одновременно снизила стоимость обработки. Разберём, что именно поменялось и почему это важно для тех, кто строит на голосовом ИИ продукты — от поддержки клиентов до телефонных ботов в малом бизнесе.
Что такое «речь-в-речь» и почему это ключевой момент
Классический голосовой бот работает по цепочке из трёх отдельных моделей: сначала speech-to-text (распознавание речи) переводит ваши слова в текст, затем языковая модель придумывает ответ, и наконец text-to-speech (синтез речи) озвучивает его. Каждое звено добавляет задержку и теряет часть смысла — интонацию, паузы, эмоции.
Grok Voice Think Fast 2.0 относится к классу speech-to-speech («речь-в-речь»): модель принимает звук на вход и выдаёт звук на выход, без промежуточной расшифровки в текст как обязательного этапа. Главная особенность второй версии — рассуждение (reasoning, внутренний «ход мыслей» модели) идёт параллельно с говорением. Модель начинает отвечать и одновременно продолжает обдумывать следующий шаг, а также вызывать внешние инструменты. В результате обращение к API, базе данных или календарю не «замораживает» разговор неловкой тишиной.
Что изменилось по сравнению с версией 1.0
xAI выделяет несколько направлений, по которым модель подтянули.
Скорость и эффективность
Вторая версия тратит примерно 0,4× токенов рассуждения по сравнению с предшественницей — то есть на тот же ответ уходит меньше вычислений. Это напрямую влияет и на задержку, и на счёт: чем меньше модель «думает лишнего», тем быстрее и дешевле она отвечает. При этом качество, по замерам xAI, не просело, а выросло.
Манера разговора
Модель научили вести себя ближе к живому оператору: короткие фразы вместо монологов, один вопрос за реплику вместо трёх сразу, аккуратная обработка перебиваний (interruptions — когда собеседник вклинивается, не дослушав). Это мелочи, но именно они отделяют раздражающего бота от помощника, с которым комфортно говорить.
Надёжность вызова инструментов
Улучшена работа с внешними инструментами (tool calling — способность модели по ходу разговора вызывать функции: проверить заказ, забронировать слот, посмотреть баланс). Для агентных сценариев это критично: голосовой агент бесполезен, если красиво говорит, но путается, когда нужно реально что-то сделать.
Цифры, которые заявила xAI
Компания привела набор внутренних метрик. Сводный индекс качества (Overall Quality Index) вырос до 82,9% против 75,7% у версии 1.0. По отдельным осям: речевое рассуждение — 97,2%, динамика диалога (насколько естественно модель ведёт беседу) — 95,1%, агентная производительность (выполнение многошаговых задач) — 56,5%. Последняя цифра показательна: вести приятную беседу модели удаётся заметно лучше, чем безошибочно доводить до конца сложные цепочки действий, — и это честное напоминание, что голосовые агенты пока сильнее в разговоре, чем в автономной работе.
По распознаванию xAI заявляет превосходство над специализированными моделями транскрипции в 1,5–2 раза на обычных задачах и около 10-кратного улучшения в шумной обстановке — то, что важно для колл-центров, улицы и громких помещений. Модель оценивали на 24 языках, так что мультиязычные сценарии заявлены как штатные, а не экспериментальные.
Для сравнения контекста: ещё версия 1.0 в апреле набрала 67,3% на бенчмарке Tau-voice Bench (задачи по бронированию авиабилетов), обойдя Gemini 3.1 Flash Live с 66% и GPT Realtime с 36%. Полные бенчмарки второй версии на момент анонса опубликованы частично, поэтому к внутренним цифрам стоит относиться как к заявке вендора, а не к независимому замеру.
Цена и доступ
Grok Voice Think Fast 2.0 доступна через консоль API. Официально заявленная цена — 0,08 доллара за минуту аудио (часть публикаций упоминает более дешёвый тариф около 0,05 доллара за минуту для агентных сценариев — детали тарификации стоит уточнять в консоли). Идентификатор grok-voice-latest автоматически переключится на новую версию 5 августа 2026 года: если вы уже используете «последнюю» модель без привязки к конкретной версии, обновление прилетит само — это повод заранее протестировать поведение на своих сценариях.
Почему это важно для бизнеса и разработчиков
Голосовой ИИ выходит из стадии демонстраций в стадию реальных внедрений, и решающими становятся три вещи: задержка, цена и надёжность инструментов. Подсекундная задержка снимает главный психологический барьер — паузу, из-за которой человек чувствует, что говорит с машиной. Снижение расхода токенов делает экономику массового обзвона и круглосуточной поддержки более реалистичной. А параллельное рассуждение решает давнюю боль: раньше в момент обращения к внешней системе бот замолкал, и звонящий не понимал, завис он или думает.
Для небольшой компании это означает, что телефонный ассистент, который принимает заказы, отвечает на типовые вопросы и записывает клиентов, становится доступнее без штата разработчиков-исследователей. Для разработчика — что можно собирать голосовые сценарии поверх API, а не поднимать собственный стек из трёх моделей и вручную сшивать задержки между ними.
Конкуренция обостряется
Grok Voice Think Fast 2.0 выходит на переполненный рынок. Прямые соперники — Google с линейкой Gemini Flash Live и OpenAI с семейством Realtime — тоже двигают задержку вниз и цену к полу. Голосовой сегмент повторяет траекторию текстовых моделей: сначала гонка за качеством, теперь — за скоростью и стоимостью минуты разговора. Для потребителя этих API это хорошая новость: цены падают, а планка качества растёт почти ежемесячно.
Отдельный контекст — корпоративный. После слияния SpaceX и xAI (сделку оценивали более чем в триллион долларов) объединённая структура получила доступ к серьёзным вычислительным ресурсам, и голосовое направление явно рассматривается как ставка на корпоративный рынок: поддержка, автоматизация рабочих процессов, обработка перебиваний в реальных звонках — всё это язык enterprise, а не потребительских игрушек.
Что учесть перед внедрением
Несколько трезвых оговорок. Во-первых, заявленные метрики — внутренние; независимые замеры второй версии ещё появятся, и реальное качество на вашем языке и в вашей акустике может отличаться от лабораторного. Во-вторых, агентная производительность в 56,5% означает, что для критичных операций (платежи, необратимые действия) голосовому агенту всё ещё нужны подстраховка, подтверждения и человек в контуре. В-третьих, автоматическое обновление grok-voice-latest 5 августа стоит встретить подготовленным: закрепите конкретную версию модели в проде, если стабильность поведения для вас важнее свежих улучшений, и протестируйте новую версию на отдельном стенде.
Итог: Grok Voice Think Fast 2.0 — это не «ещё одна голосовая модель», а показатель того, куда движется весь сегмент. Разговор с ИИ по телефону всё труднее отличить от разговора с человеком, а стоимость такой минуты приближается к копейкам. Для бизнеса это открывает окно возможностей, но требует и аккуратности: скорость и дешевизна не отменяют необходимости проверять, что агент действительно делает то, что говорит.
Частые вопросы
Это голосовая speech-to-speech модель xAI, выпущенная 29 июля 2026 года: она принимает и выдаёт звук напрямую, рассуждает параллельно с речью и отвечает с задержкой около 0,7 секунды.
Модель доступна через API-консоль по цене около $0,08 за минуту аудио. Идентификатор grok-voice-latest автоматически переключится на новую версию 5 августа 2026 года.
Сводный индекс качества вырос с 75,7% до 82,9%, модель тратит примерно 0,4× токенов рассуждения, естественнее ведёт диалог и надёжнее вызывает внешние инструменты.
Для разговора и поддержки — да, но агентная производительность около 56,5% означает, что для необратимых действий (платежи и т.п.) нужны подтверждения и человек в контуре.
Источники
- 1.xAI — Introducing Grok Voice Think Fast 2.0https://x.ai/news/grok-voice-think-fast-2
- 2.Crypto Briefing — Grok Voice Think Fast 2.0 signals the AI arms race is coming for enterprise walletshttps://cryptobriefing.com/grok-voice-think-fast-2-enterprise-ai/
- 3.CNBC — Musk's xAI, SpaceX combo is the biggest merger of all time, valued at $1.25 trillionhttps://www.cnbc.com/2026/02/03/musk-xai-spacex-biggest-merger-ever.html



