Cyber News

NVIDIA Vera Rubin: первые поставки ускорителей нового поколения

M
Markabus
·14 июля 2026 г.
Крупный план серверного ИИ-ускорителя нового поколения с жидкостным охлаждением на фоне размытых стоек дата-центра в тёмно-графитовых тонах с синей подсветкой чипа

Эпоха Blackwell у NVIDIA подходит к концу: по данным цепочки поставок, в июле 2026 года компания начала отгружать первые системы на новой архитектуре Vera Rubin крупнейшим облачным операторам. Это не очередной разгон существующих ускорителей, а полная смена поколения — шесть новых чипов, память HBM4, обновлённый межсоединительный слой и заявка на то, чтобы стать фундаментом для «агентного» искусственного интеллекта (agentic AI — ИИ, который сам выполняет длинные цепочки действий). Разбираемся, что именно приезжает в дата-центры, чем Rubin отличается от предшественника и почему это касается даже тех, кто не покупает серверные GPU.

Что такое Vera Rubin и почему это «платформа», а не один чип

NVIDIA давно перестала продавать просто видеоускорители — она продаёт готовую вычислительную стойку. Vera Rubin — это именно платформа из шести взаимосвязанных чипов, каждый из которых закрывает свой участок работы дата-центра. В официальном техническом блоге компания перечисляет их так: центральный процессор Vera CPU, ускоритель Rubin GPU, коммутатор NVLink 6 для связи видеокарт между собой, сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 DPU и Ethernet-коммутатор Spectrum-6.

Название отсылает к астроному Вере Рубин, чьи работы стали одним из главных аргументов в пользу существования тёмной материи. Для NVIDIA это уже традиция называть архитектуры именами учёных — до этого были Grace Hopper и Blackwell. Ключевая мысль: производительность в современном ИИ определяется не одним GPU, а тем, насколько быстро тысячи ускорителей обмениваются данными внутри стойки. Поэтому Rubin имеет смысл оценивать целиком, а не по характеристикам отдельной платы.

Характеристики: HBM4, 50 петафлопс и 88 ядер Arm

Rubin GPU

По официальным данным NVIDIA, один Rubin GPU выдаёт 50 петафлопс (PFLOPS) в режиме инференса и 35 петафлопс в обучении в формате NVFP4 — это фирменный 4-битный формат вычислений, которым NVIDIA ускоряет работу нейросетей. Каждый ускоритель несёт до 288 ГБ памяти HBM4 с суммарной пропускной способностью до 22 ТБ/с. Для сравнения: у поколения Blackwell пропускная способность памяти составляла около 8 ТБ/с, то есть Rubin почти утраивает этот показатель. Именно память, а не «сырые» флопсы, чаще всего становится узким местом при работе больших языковых моделей, поэтому переход на HBM4 здесь принципиален.

Vera CPU

Центральный процессор Vera построен на 88 кастомных ядрах Olympus с архитектурой Arm, разработанных самой NVIDIA. Он выпускается по 3-нанометровому техпроцессу TSMC и отвечает за подготовку данных, оркестрацию задач и связь с GPU. Логика та же, что и в предыдущих «суперчипах» Grace: снять с видеокарт всё, что они делают неэффективно, и освободить их исключительно под матричные вычисления.

Связь и сеть

Коммутатор NVLink 6 обеспечивает 3,6 ТБ/с двунаправленной пропускной способности на каждый GPU и топологию «все со всеми» внутри стойки — то есть любая видеокарта общается с любой напрямую. Сетевой адаптер ConnectX-9 добавляет 1,6 Тбит/с сетевой полосы на ускоритель, а Ethernet-коммутатор Spectrum-6 масштабирует всё это до 102,4 Тбит/с суммарной пропускной способности. Для агентных нагрузок, где один запрос порождает сотни шагов рассуждений и обращений к инструментам, скорость обмена данными критична не меньше, чем скорость счёта.

Стоечная система и прирост относительно Blackwell

Главная единица продукта — не отдельный чип, а стойка Vera Rubin NVL72, объединяющая 72 GPU Rubin и связанные с ними процессоры Vera в единый ускоритель. NVIDIA формулирует прирост в терминах реальной работы, а не абстрактных флопсов: платформа обеспечивает десятикратную пропускную способность агентов (agent throughput) при масштабировании по сравнению с предыдущим поколением Grace Blackwell.

Отраслевые обзоры добавляют деталей к этой картине: примерно пятикратный рост производительности инференса на уровне стойки, десятикратное снижение стоимости одного токена при выводе и потребность в вчетверо меньшем числе GPU для обучения моделей класса Mixture-of-Experts (MoE — архитектура, где активируется лишь часть «экспертов» модели). Даже если делать поправку на маркетинг, направление очевидно: NVIDIA бьётся прежде всего за снижение стоимости инференса, потому что именно ежедневный вывод моделей, а не разовое обучение, стал основной статьёй расходов в эпоху массовых ИИ-агентов.

Сроки: июльские поставки и полное производство

Здесь важно аккуратно развести два потока сообщений. Официально NVIDIA ещё 1 июня 2026 года объявила, что Vera Rubin выходит на полномасштабное производство: по формулировке компании, ведущие тайваньские производители серверов и глобальные поставщики выпускают системы на базе Vera Rubin «в промышленных объёмах», а серийные поставки начнутся «этой осенью». В экосистему сборки, по данным NVIDIA, вовлечено более 350 заводов в 30 странах, включая Dell, HPE, Lenovo, Supermicro, ASUS и Foxconn. Среди первых облачных заказчиков названы CoreWeave, Lambda, Oracle Cloud Infrastructure, Microsoft Azure и IBM Cloud.

Параллельно источники в цепочке поставок (тайваньское издание Economic Daily, на которое ссылаются профильные площадки) сообщают о более раннем событии: самые первые единицы Rubin отгружаются уже в июле избранным гиперскейлерам — называются Microsoft, Google, Amazon, Meta и Oracle. Пробное производство при этом прошло в июне, а массовые отгрузки прогнозируются на третий квартал. Иными словами, официальный «старт осенью» относится к широким серийным поставкам, тогда как штучные системы для крупнейших клиентов, по неофициальным данным, поехали раньше. Разночтения в датах — обычное дело для запусков такого масштаба, и относиться к июльской цифре стоит как к инсайду цепочки поставок, а не как к подтверждённому NVIDIA факту.

Почему это важно

Смена поколения серверных ускорителей может показаться темой только для операторов дата-центров, но эффект расходится шире. Во-первых, стоимость инференса напрямую влияет на цены API у поставщиков моделей: чем дешевле обходится вывод токена, тем ниже в перспективе счета, которые платят разработчики и продукты, встроившие ИИ. Во-вторых, ставка NVIDIA на «агентные» нагрузки — сигнал всей индустрии: инфраструктура затачивается не под чат-ботов, отвечающих одной репликой, а под агентов, выполняющих длинные автономные цепочки. Как сформулировал глава NVIDIA Дженсен Хуанг, «один запрос может запустить путешествие из тысячи шагов рассуждений, поиска, использования инструментов и генерации ответа — Vera Rubin создана именно для этого момента».

В-третьих, масштаб заказов и нагрузка на TSMC показывают, что дефицит вычислительных мощностей в 2026 году сохраняется: спрос на Rubin, по отраслевым оценкам, продолжает опережать предложение. Для небольших команд и владельцев проектов практический вывод прост — доступ к топовым ускорителям в ближайший год останется дефицитным и дорогим ресурсом, а значит, выигрывает тот, кто умеет выжимать максимум из моделей меньшего размера и оптимизировать собственный инференс, не рассчитывая на бесконечно дешёвые GPU в облаке.

Частые вопросы

Q.Чем Vera Rubin отличается от Blackwell?

Это следующее поколение архитектуры NVIDIA. Rubin GPU несёт до 288 ГБ памяти HBM4 с пропускной способностью до 22 ТБ/с (почти втрое больше, чем у Blackwell с ~8 ТБ/с) и выдаёт 50 петафлопс инференса в формате NVFP4. На уровне стойки NVIDIA заявляет десятикратный рост пропускной способности ИИ-агентов относительно Grace Blackwell.

Q.Когда Vera Rubin реально появится в продаже?

NVIDIA официально объявила о выходе на полномасштабное производство 1 июня 2026 года и назвала старт серийных поставок «этой осенью». Источники в цепочке поставок при этом сообщают, что первые штучные системы поехали крупнейшим облакам уже в июле 2026-го, а массовые отгрузки ожидаются в третьем квартале.

Q.Из каких чипов состоит платформа Vera Rubin?

Из шести: процессор Vera CPU (88 ядер Arm Olympus), ускоритель Rubin GPU, коммутатор NVLink 6, сетевой адаптер ConnectX-9, процессор данных BlueField-4 DPU и Ethernet-коммутатор Spectrum-6. NVIDIA продаёт их как единую стоечную систему Vera Rubin NVL72.

Q.Почему это важно для обычных разработчиков?

Главная ставка Rubin — снижение стоимости инференса (по обзорам, до десяти раз на токен). Дешевле вывод — ниже в перспективе цены API у поставщиков моделей. Но дефицит топовых ускорителей сохраняется, поэтому в ближайший год выигрывает тот, кто оптимизирует собственные затраты на ИИ, а не полагается на дешёвые GPU в облаке.

Источники

Предыдущая
Node.js 26.5.0: импорт текста как модулей, потоковый Blob и пост-квантовый TLS
Следующая
Claude Code открывает артефакты наружу: публичные ссылки и совместное редактирование

Читайте также

Фотореалистичный кадр коридора дата-центра: ряды серверных стоек с патч-кордами, зелёными индикаторами и синей подсветкой; в углу пометка «Иллюстрация · изображение сгенерировано ИИ» — к новости о покупке Anyscale британским ИИ-облаком NscaleCyber News
2 августа 2026 г.

Nscale покупает Anyscale за $1,65 млрд: создатель Ray уходит к британскому ИИ-облаку ради «полного стека»

Британское ИИ-облако Nscale покупает Anyscale — создателя открытого фреймворка Ray — примерно за $1,65 млрд и строит вертикально интегрированный «полный стек». Разбираем, что это значит для рынка и что будет с Ray.

Читать →
Фотореалистичный макрокадр крупного чипа-ускорителя на серверной плате с конденсаторами, шлейфами и синей подсветкой, на фоне размытых стоек дата-центра; в углу пометка «Иллюстрация · изображение не отражает реальный продукт» — к новости о заказных ИИ-ASIC MediaTek для дата-центровCyber News
2 августа 2026 г.

MediaTek уходит в дата-центры: $5 млрд на кастомные ИИ-ускорители и первый ASIC в серии уже в Q4 2026

На отчёте за Q2 2026 MediaTek объявила разворот в дата-центры: бюджет $5 млрд на мощности, первый кастомный ИИ-ASIC в серию уже в четвёртом квартале и цель — 15–20% рынка ускорителей к 2027 году. Разбираем, что стоит за ставкой и почему она важна.

Читать →
Профессиональный студийный микрофон крупным планом на столе звукорежиссёра; за ним монитор со светящейся электрик-синей аудиоволной и спектрограммой голоса, рядом наушники и смартфон в мягком расфокусе — фотореалистичная сцена без людей.Cyber News
31 июля 2026 г.

Grok Voice Think Fast 2.0: xAI ускорила голосового ИИ‑агента до 0,7 секунды и удешевила минуту разговора

29 июля xAI представила Grok Voice Think Fast 2.0 — голосовую модель «речь-в-речь», которая рассуждает параллельно с речью, отвечает за 0,7 секунды и стоит около $0,08 за минуту. Разбираем ключевые изменения, бенчмарки и что это значит для голосовых ассистентов в бизнесе.

Читать →