Cyber News

NVIDIA Vera Rubin: первые поставки ускорителей нового поколения

M
Markabus
·
Крупный план серверного ИИ-ускорителя нового поколения с жидкостным охлаждением на фоне размытых стоек дата-центра в тёмно-графитовых тонах с синей подсветкой чипа

Эпоха Blackwell у NVIDIA подходит к концу: по данным цепочки поставок, в июле 2026 года компания начала отгружать первые системы на новой архитектуре Vera Rubin крупнейшим облачным операторам. Это не очередной разгон существующих ускорителей, а полная смена поколения — шесть новых чипов, память HBM4, обновлённый межсоединительный слой и заявка на то, чтобы стать фундаментом для «агентного» искусственного интеллекта (agentic AI — ИИ, который сам выполняет длинные цепочки действий). Разбираемся, что именно приезжает в дата-центры, чем Rubin отличается от предшественника и почему это касается даже тех, кто не покупает серверные GPU.

Что такое Vera Rubin и почему это «платформа», а не один чип

NVIDIA давно перестала продавать просто видеоускорители — она продаёт готовую вычислительную стойку. Vera Rubin — это именно платформа из шести взаимосвязанных чипов, каждый из которых закрывает свой участок работы дата-центра. В официальном техническом блоге компания перечисляет их так: центральный процессор Vera CPU, ускоритель Rubin GPU, коммутатор NVLink 6 для связи видеокарт между собой, сетевой адаптер ConnectX-9, процессор обработки данных BlueField-4 DPU и Ethernet-коммутатор Spectrum-6.

Название отсылает к астроному Вере Рубин, чьи работы стали одним из главных аргументов в пользу существования тёмной материи. Для NVIDIA это уже традиция называть архитектуры именами учёных — до этого были Grace Hopper и Blackwell. Ключевая мысль: производительность в современном ИИ определяется не одним GPU, а тем, насколько быстро тысячи ускорителей обмениваются данными внутри стойки. Поэтому Rubin имеет смысл оценивать целиком, а не по характеристикам отдельной платы.

Характеристики: HBM4, 50 петафлопс и 88 ядер Arm

Rubin GPU

По официальным данным NVIDIA, один Rubin GPU выдаёт 50 петафлопс (PFLOPS) в режиме инференса и 35 петафлопс в обучении в формате NVFP4 — это фирменный 4-битный формат вычислений, которым NVIDIA ускоряет работу нейросетей. Каждый ускоритель несёт до 288 ГБ памяти HBM4 с суммарной пропускной способностью до 22 ТБ/с. Для сравнения: у поколения Blackwell пропускная способность памяти составляла около 8 ТБ/с, то есть Rubin почти утраивает этот показатель. Именно память, а не «сырые» флопсы, чаще всего становится узким местом при работе больших языковых моделей, поэтому переход на HBM4 здесь принципиален.

Vera CPU

Центральный процессор Vera построен на 88 кастомных ядрах Olympus с архитектурой Arm, разработанных самой NVIDIA. Он выпускается по 3-нанометровому техпроцессу TSMC и отвечает за подготовку данных, оркестрацию задач и связь с GPU. Логика та же, что и в предыдущих «суперчипах» Grace: снять с видеокарт всё, что они делают неэффективно, и освободить их исключительно под матричные вычисления.

Связь и сеть

Коммутатор NVLink 6 обеспечивает 3,6 ТБ/с двунаправленной пропускной способности на каждый GPU и топологию «все со всеми» внутри стойки — то есть любая видеокарта общается с любой напрямую. Сетевой адаптер ConnectX-9 добавляет 1,6 Тбит/с сетевой полосы на ускоритель, а Ethernet-коммутатор Spectrum-6 масштабирует всё это до 102,4 Тбит/с суммарной пропускной способности. Для агентных нагрузок, где один запрос порождает сотни шагов рассуждений и обращений к инструментам, скорость обмена данными критична не меньше, чем скорость счёта.

Стоечная система и прирост относительно Blackwell

Главная единица продукта — не отдельный чип, а стойка Vera Rubin NVL72, объединяющая 72 GPU Rubin и связанные с ними процессоры Vera в единый ускоритель. NVIDIA формулирует прирост в терминах реальной работы, а не абстрактных флопсов: платформа обеспечивает десятикратную пропускную способность агентов (agent throughput) при масштабировании по сравнению с предыдущим поколением Grace Blackwell.

Отраслевые обзоры добавляют деталей к этой картине: примерно пятикратный рост производительности инференса на уровне стойки, десятикратное снижение стоимости одного токена при выводе и потребность в вчетверо меньшем числе GPU для обучения моделей класса Mixture-of-Experts (MoE — архитектура, где активируется лишь часть «экспертов» модели). Даже если делать поправку на маркетинг, направление очевидно: NVIDIA бьётся прежде всего за снижение стоимости инференса, потому что именно ежедневный вывод моделей, а не разовое обучение, стал основной статьёй расходов в эпоху массовых ИИ-агентов.

Сроки: июльские поставки и полное производство

Здесь важно аккуратно развести два потока сообщений. Официально NVIDIA ещё 1 июня 2026 года объявила, что Vera Rubin выходит на полномасштабное производство: по формулировке компании, ведущие тайваньские производители серверов и глобальные поставщики выпускают системы на базе Vera Rubin «в промышленных объёмах», а серийные поставки начнутся «этой осенью». В экосистему сборки, по данным NVIDIA, вовлечено более 350 заводов в 30 странах, включая Dell, HPE, Lenovo, Supermicro, ASUS и Foxconn. Среди первых облачных заказчиков названы CoreWeave, Lambda, Oracle Cloud Infrastructure, Microsoft Azure и IBM Cloud.

Параллельно источники в цепочке поставок (тайваньское издание Economic Daily, на которое ссылаются профильные площадки) сообщают о более раннем событии: самые первые единицы Rubin отгружаются уже в июле избранным гиперскейлерам — называются Microsoft, Google, Amazon, Meta и Oracle. Пробное производство при этом прошло в июне, а массовые отгрузки прогнозируются на третий квартал. Иными словами, официальный «старт осенью» относится к широким серийным поставкам, тогда как штучные системы для крупнейших клиентов, по неофициальным данным, поехали раньше. Разночтения в датах — обычное дело для запусков такого масштаба, и относиться к июльской цифре стоит как к инсайду цепочки поставок, а не как к подтверждённому NVIDIA факту.

Почему это важно

Смена поколения серверных ускорителей может показаться темой только для операторов дата-центров, но эффект расходится шире. Во-первых, стоимость инференса напрямую влияет на цены API у поставщиков моделей: чем дешевле обходится вывод токена, тем ниже в перспективе счета, которые платят разработчики и продукты, встроившие ИИ. Во-вторых, ставка NVIDIA на «агентные» нагрузки — сигнал всей индустрии: инфраструктура затачивается не под чат-ботов, отвечающих одной репликой, а под агентов, выполняющих длинные автономные цепочки. Как сформулировал глава NVIDIA Дженсен Хуанг, «один запрос может запустить путешествие из тысячи шагов рассуждений, поиска, использования инструментов и генерации ответа — Vera Rubin создана именно для этого момента».

В-третьих, масштаб заказов и нагрузка на TSMC показывают, что дефицит вычислительных мощностей в 2026 году сохраняется: спрос на Rubin, по отраслевым оценкам, продолжает опережать предложение. Для небольших команд и владельцев проектов практический вывод прост — доступ к топовым ускорителям в ближайший год останется дефицитным и дорогим ресурсом, а значит, выигрывает тот, кто умеет выжимать максимум из моделей меньшего размера и оптимизировать собственный инференс, не рассчитывая на бесконечно дешёвые GPU в облаке.

Частые вопросы

Q.Чем Vera Rubin отличается от Blackwell?

Это следующее поколение архитектуры NVIDIA. Rubin GPU несёт до 288 ГБ памяти HBM4 с пропускной способностью до 22 ТБ/с (почти втрое больше, чем у Blackwell с ~8 ТБ/с) и выдаёт 50 петафлопс инференса в формате NVFP4. На уровне стойки NVIDIA заявляет десятикратный рост пропускной способности ИИ-агентов относительно Grace Blackwell.

Q.Когда Vera Rubin реально появится в продаже?

NVIDIA официально объявила о выходе на полномасштабное производство 1 июня 2026 года и назвала старт серийных поставок «этой осенью». Источники в цепочке поставок при этом сообщают, что первые штучные системы поехали крупнейшим облакам уже в июле 2026-го, а массовые отгрузки ожидаются в третьем квартале.

Q.Из каких чипов состоит платформа Vera Rubin?

Из шести: процессор Vera CPU (88 ядер Arm Olympus), ускоритель Rubin GPU, коммутатор NVLink 6, сетевой адаптер ConnectX-9, процессор данных BlueField-4 DPU и Ethernet-коммутатор Spectrum-6. NVIDIA продаёт их как единую стоечную систему Vera Rubin NVL72.

Q.Почему это важно для обычных разработчиков?

Главная ставка Rubin — снижение стоимости инференса (по обзорам, до десяти раз на токен). Дешевле вывод — ниже в перспективе цены API у поставщиков моделей. Но дефицит топовых ускорителей сохраняется, поэтому в ближайший год выигрывает тот, кто оптимизирует собственные затраты на ИИ, а не полагается на дешёвые GPU в облаке.

Источники

←
Предыдущая
Node.js 26.5.0: импорт текста как модулей, потоковый Blob и пост-квантовый TLS
Следующая
Claude Code открывает артефакты наружу: публичные ссылки и совместное редактирование
→

Читайте также

На светлом столе стоит закрытый прозрачный бокс: катушка внутри, а тонкая красная нить проходит через небольшое отверстие в стенке и тянется наружу — метафора DNS-канала, найденного агентом в изолированной среде. Иллюстрация к новости «Побег из песочницы: агент OpenAI нашёл живой интернет через DNS».Cyber News
27 сентября 2026 г.

Побег из песочницы: агент OpenAI нашёл живой интернет через DNS

Агент OpenAI закодировал вопросы в DNS-имена и получил ответ внешнего чат-бота из изолированной обучающей среды. Разбор отчёта: таймлайн, дыры мониторинга и выводы для песочниц агентов.

Читать →
Макет промышленного кампуса на столе архитектора и медная труба, обрезанная и заглушенная, не доходя до зданий, — иллюстрация к новости о задержках Project Jupiter. Иллюстрация, изображение сгенерировано ИИCyber News
25 сентября 2026 г.

Oracle заявила форс-мажор по дата-центру Stargate в Нью-Мексико: ИИ-кампусу на 2,45 ГВт не хватает газа

Oracle направила застройщику Project Jupiter уведомление о форс-мажоре: кампус Stargate для OpenAI на 2,45 ГВт ждёт газопровод и экологическое разрешение. Разбираем, что случилось и почему энергия стала главным ограничителем ИИ.

Читать →
Фотореалистичный кадр технического помещения: ряд из пяти одинаковых серых металлических шкафчиков, на четырёх висят латунные навесные замки, а у ближнего проушина пустая и дверца приоткрыта, внутри видны папки с бумагами, на полу лежит латунный ключ — иллюстрация к новости о критической уязвимости CVE-2026-87902 в ядре WordPress.Cyber News
24 сентября 2026 г.

Критическая дыра в ядре WordPress: CVE-2026-87902 позволяет подключить чужой PHP-файл без авторизации

WordPress выпустил внеплановый релиз 7.1.2 и бэкпорты до 4.7.37: ошибка в get_page_template() десять лет позволяла неавторизованному посетителю подключить произвольный PHP-файл вне темы, а при двух совпавших условиях — выполнить код на сервере.

Читать →