Cyber News

Как OpenAI проектировала чип Jalapeño своими же моделями: 9 месяцев от RTL до кремния и команда меньше 100 человек

M
Markabus
·
Крупный план процессорного пакета ИИ-ускорителя с шестью стеками памяти на антистатическом мате лабораторного стола; на заднем плане в расфокусе мониторы с исходным кодом и временными диаграммами. Иллюстрация, изображение не отражает реальный продукт.

История про «ИИ, который проектирует чипы» до сих пор жила в презентациях. На прошлой неделе IEEE Spectrum опубликовал разбор с инженерами OpenAI, где впервые описано, что конкретно делали языковые модели при разработке Jalapeño — первого собственного ускорителя компании. Картина получилась куда менее сказочной и куда более полезной, чем маркетинговые обещания: модели не «нарисовали чип», они убрали рутину с самого дорогого участка — от первой строки описания схемы до передачи проекта на фабрику.

Ключевая цифра, вокруг которой всё крутится: девять месяцев от первого RTL до tape-out и меньше 20 месяцев от концепции до первого кремния. Для высокопроизводительной специализированной микросхемы такого класса это ненормально быстро.

Что за чип и зачем он OpenAI

Jalapeño — ASIC (специализированная микросхема под одну задачу), сделанный совместно с Broadcom и представленный 24 июня 2026 года. Он умеет ровно одно: инференс (inference — работа уже обученной модели, генерация ответа), то есть обучать на нём ничего не будут. Это важная оговорка: в тренировке позиции Nvidia никто не оспаривает.

Технические детали компания раскрыла позже, на конференции Hot Chips 2026:

  • Вычисления: до 13,4 петафлопс в формате MXFP4 и 3,4 петафлопс в MXFP8 на один процессор.
  • Память: шесть стеков HBM4 — 216 ГиБ (около 232 ГБ) с пропускной способностью до 15,4 ТБ/с.
  • Кристалл: вычислительный чиплет около 840 мм² — практически у предела поля экспонирования EUV-литографии (858 мм²). Техпроцесс — 3-нанометрового класса TSMC.
  • Питание: 700 Вт по паспорту, около 550 Вт в измерениях, тактовая частота 1,70 ГГц с прицелом на 1,80 ГГц.
  • Архитектура: 64 «слайса» ядра, каждый со своим куском HBM — NUMA-подобная схема, где память нарезана под вычислительные блоки, а не висит общим пулом.
  • Масштабирование: 128 ускорителей на стойку через Ethernet на 600 ГБ/с; до 2048 процессоров в поде — это 432 ТБ HBM4, 32 ПБ/с совокупной полосы памяти и 27 эксафлопс.

Физическую часть — бэкенд-проектирование от уровня вентилей до производства — вёл Broadcom. Платы, стойки и системную интеграцию делает Celestica. OpenAI оставила себе системный дизайн целиком и фронтенд: от RTL до верификации. Именно на этом участке и работали модели.

Как языковые модели вошли в маршрут проектирования

Ставка на XLS, а не на Verilog

Главное архитектурное решение принято до всякого ИИ: команда писала логику не на Verilog, а через XLS — открытый инструмент высокоуровневого синтеза (HLS, high-level synthesis — генерация схемы из кода на языке высокого уровня), который развивает Google. Проектировать в нём можно на DSLX или на C++. По данным Hot Chips, более половины ядра написано именно так.

Логика простая. Модели 2025 года были заметно сильнее в обычном программировании, чем в языках описания аппаратуры: корпусов кода на Verilog в природе на порядки меньше, чем на C++ и Python. Перенеся описание схемы ближе к обычному коду, команда получила участок, где ИИ уже был полезен. Ричард Хо, вице-президент OpenAI по железу, описал эффект так: модели «дают инженерам суперспособности» — можно перебрать гораздо больше вариантов, чем позволяет ручной труд.

Отдельно отмечено, что более поздние внутренние модели уже работают напрямую с Verilog, то есть обходной манёвр через HLS может оказаться приёмом одного поколения.

Где именно ИИ дал измеримый прирост

Самое ценное в этой истории — что приросты названы не «в целом», а по конкретным блокам. ИИ-оптимизация дала +56% для умножителя BF16 и +21% для блока скалярного произведения FP4 относительно базового варианта. Это микроархитектурная работа: перебор вариантов конвейера, разрядностей, способов раскладки операций — та самая задача, где человек упирается в количество итераций, а не в понимание.

И ещё 40 часов уже после кремния

Второй эпизод касается софта. Кремний с фабрики приехал в мае 2026-го, и дальше нужно было писать вычислительные ядра под новую архитектуру. По описанию Spectrum, для latency-ядра DeepSeek производительность подняли с 0,31% до 88,94% от теоретического потолка примерно за 40 часов работы с моделями.

Эта цифра честнее, чем кажется на первый взгляд: 0,31% — это состояние «код формально запускается на новом железе», а не «оптимизированная реализация». Но именно такой разрыв обычно и съедает месяцы инженерного времени при запуске любой новой архитектуры, и именно он закрылся за считанные дни.

Почему команда меньше 100 человек — главный результат

Над проектом работало в среднем менее сотни человек. На фоне штатов, которыми традиционно делаются ускорители такого класса, это и есть настоящая новость — не бенчмарки.

Сроки выстраиваются в понятную цепочку: RTL начали в феврале 2025-го, tape-out прошёл в ноябре, кремний получили в мае 2026-го, развёртывание в собственных дата-центрах намечено на конец года. Второе поколение, по словам компании, подойдёт к tape-out в ближайшие месяцы. Хок Тан, глава Broadcom, говорит о «многопоколенческой дорожной карте» и разворачивании на гигаваттных масштабах с Microsoft и другими партнёрами.

При этом сами инженеры расставили границы аккуратно. Хо и его коллега Лири прямо оговариваются: они не утверждают, что теперь кто угодно соберёт чип уровня state-of-the-art при помощи автоматизации. Экспертиза в предметной области никуда не делась — изменилась цена одной итерации.

Что с производительностью: цифры и оговорки

OpenAI заявляет в 1,5–1,9 раза больше пропускной способности на киловатт и в 1,7–3,6 раза меньшую сквозную задержку (end-to-end latency — время от запроса до полного ответа) по сравнению с системами Nvidia GB200 и GB300. Сравнение шло между 700-ваттным Jalapeño и ускорителями на 1200 и 1400 Вт.

Оговорок к этим числам достаточно, и их стоит держать в голове:

  • Сравнивали не с актуальной платформой. Vera Rubin, которая разворачивается позже в 2026 году, в тестах не участвовала.
  • Разные режимы генерации. Тесты шли на предсказании по одному токену, тогда как в реальных развёртываниях Nvidia часто применяется мультитокенное предсказание.
  • Энергия «из розетки» сглаживает разрыв. При нормировке на полное потребление узла — 1,18 кВт против 2,55 кВт у GB300 — преимущество заметно сужается.
  • Класс задач у́же. Обучение моделей Jalapeño не выполняет вовсе.

Иначе говоря: это не «убийца Nvidia», а очень узко заточенный инструмент, у которого хороший шанс окупиться внутри одной компании с гигантским собственным трафиком инференса.

Что здесь практического для разработчиков

Прямого вывода «идите проектировать чипы» тут нет. Зато есть переносимый принцип, который на этом кейсе виден в чистом виде.

Модели окупаются там, где задача измерима и итерация дешёвая. Оба задокументированных успеха — микроархитектурные блоки и вычислительные ядра — имеют жёсткий численный критерий качества: процент от теоретического потолка, площадь, задержка. Модель генерирует вариант, тест выносит вердикт, цикл повторяется тысячи раз. Там, где критерий размыт («сделай архитектуру лучше»), никакого чуда не произошло — это осталось работой людей.

Иногда выгоднее сменить язык, чем ждать модель получше. Переход на XLS — это решение подстроить процесс под сильные стороны инструмента, а не наоборот. Ровно тот же приём работает в обычной разработке: типизированный код, декларативные конфиги, тесты как спецификация — всё, что превращает задачу в проверяемую, резко повышает отдачу от ИИ-ассистента.

Порог входа в собственное железо падает. Если сотня человек за 20 месяцев доводит до кремния ускоритель ретикл-размера, то у компаний с предсказуемой и однотипной нагрузкой появляется аргумент считать свой ASIC. Для рынка это значит больше специализированных чипов и меньше универсальных — со всеми последствиями для того, под что придётся оптимизировать код в ближайшие годы.

Частые вопросы

Q.Правда ли, что чип Jalapeño спроектировал искусственный интеллект?

Нет. Модели работали на конкретных участках: помогали писать и оптимизировать логику через инструмент высокоуровневого синтеза XLS и подбирать варианты микроархитектурных блоков — там зафиксированы приросты +56% для умножителя BF16 и +21% для блока FP4. Системный дизайн, верификацию и физическое проектирование вели люди, а Broadcom отвечала за бэкенд. Сами инженеры OpenAI специально оговариваются, что собрать чип такого уровня одной автоматизацией нельзя.

Q.Почему команда писала логику на XLS, а не на Verilog?

XLS — открытый инструмент высокоуровневого синтеза от Google, где схему описывают на DSLX или C++. Обучающих данных по обычным языкам программирования на порядки больше, чем по языкам описания аппаратуры, поэтому модели на таком коде были заметно полезнее. По данным Hot Chips, больше половины ядра написано именно через XLS. При этом более поздние внутренние модели OpenAI уже работают напрямую с Verilog.

Q.Jalapeño действительно быстрее решений Nvidia?

В заявленных OpenAI тестах — от 1,5 до 1,9 раза больше пропускной способности на киловатт и от 1,7 до 3,6 раза меньшая сквозная задержка против GB200 и GB300. Но оговорок много: сравнения с более новой платформой Vera Rubin не было, тесты шли на предсказании по одному токену, а при нормировке на полное потребление узла разрыв сужается. Обучать модели чип не умеет вообще.

Q.Когда Jalapeño начнёт работать?

Кремний с фабрики получили в мае 2026 года, развёртывание в дата-центрах намечено на конец 2026-го при участии Microsoft и других партнёров. Второе поколение, по словам компании, подойдёт к tape-out в ближайшие месяцы. В свободную продажу чип не поступает — это внутреннее железо OpenAI.

Источники

Предыдущая
GitLab.com переводит лимиты API на тарифы: неавторизованным — 60 запросов в час вместо 500 в минуту

Читайте также

Крупный план рабочего места разработчика: на мониторе график частоты запросов к API упирается в горизонтальную границу лимита, рядом терминал с логами, в расфокусе сетевой коммутатор и серверная стойка. Иллюстрация · изображение сгенерировано ИИ.Cyber News
18 сентября 2026 г.

GitLab.com переводит лимиты API на тарифы: неавторизованным — 60 запросов в час вместо 500 в минуту

GitLab перестраивает лимиты запросов на GitLab.com: вместо единой планки — квоты по тарифам, а неавторизованный трафик падает с 500 запросов в минуту до 60 в час. Free и запросы без токена переводят 19 октября, Premium и Ultimate — в январе 2027-го. Разбираем новые цифры, brownout-окна и чек-лист подготовки.

Читать →
Крупный план монитора с журналом аудита безопасности на рабочем столе, в расфокусе — серверная стойка с индикаторами. Иллюстрация · изображение сгенерировано ИИ.Cyber News
17 сентября 2026 г.

Первая утечка, исполненная ИИ-агентом: испанский регулятор разобрал атаку по фазам и сказал, что менять компаниям

Испанское агентство по защите данных впервые получило уведомление об утечке персональных данных, атаку в которой от разведки до изменения записей автономно провёл ИИ-агент. Регулятор разобрал инцидент по фазам, отдельно оговорил, что провайдера модели никто не взламывал, и выпустил рекомендации: скорость атак изменилась, ручные процедуры реагирования за ней не успевают.

Читать →
Крупный план студийного микрофона на тёмном рабочем столе, позади в расфокусе монитор с синей звуковой волной и аудиоинтерфейс со светящимися индикаторами. Иллюстрация · изображение сгенерировано ИИCyber News
16 сентября 2026 г.

Gemini 3.8 Live: голосовой агент Google думает и ходит в API, не прерывая разговор

Google выпустила Gemini 3.8 Live и 3.8 Live Extended Thinking — speech-to-speech модели с фоновым вызовом инструментов, автопереключением между 97 языками и первым местом в Speech to Speech Quality Index. Разбираем возможности, бенчмарки, цену и то, чего в анонсе не раскрыли.

Читать →