История про «ИИ, который проектирует чипы» до сих пор жила в презентациях. На прошлой неделе IEEE Spectrum опубликовал разбор с инженерами OpenAI, где впервые описано, что конкретно делали языковые модели при разработке Jalapeño — первого собственного ускорителя компании. Картина получилась куда менее сказочной и куда более полезной, чем маркетинговые обещания: модели не «нарисовали чип», они убрали рутину с самого дорогого участка — от первой строки описания схемы до передачи проекта на фабрику.
Ключевая цифра, вокруг которой всё крутится: девять месяцев от первого RTL до tape-out и меньше 20 месяцев от концепции до первого кремния. Для высокопроизводительной специализированной микросхемы такого класса это ненормально быстро.
Что за чип и зачем он OpenAI
Jalapeño — ASIC (специализированная микросхема под одну задачу), сделанный совместно с Broadcom и представленный 24 июня 2026 года. Он умеет ровно одно: инференс (inference — работа уже обученной модели, генерация ответа), то есть обучать на нём ничего не будут. Это важная оговорка: в тренировке позиции Nvidia никто не оспаривает.
Технические детали компания раскрыла позже, на конференции Hot Chips 2026:
- Вычисления: до 13,4 петафлопс в формате MXFP4 и 3,4 петафлопс в MXFP8 на один процессор.
- Память: шесть стеков HBM4 — 216 ГиБ (около 232 ГБ) с пропускной способностью до 15,4 ТБ/с.
- Кристалл: вычислительный чиплет около 840 мм² — практически у предела поля экспонирования EUV-литографии (858 мм²). Техпроцесс — 3-нанометрового класса TSMC.
- Питание: 700 Вт по паспорту, около 550 Вт в измерениях, тактовая частота 1,70 ГГц с прицелом на 1,80 ГГц.
- Архитектура: 64 «слайса» ядра, каждый со своим куском HBM — NUMA-подобная схема, где память нарезана под вычислительные блоки, а не висит общим пулом.
- Масштабирование: 128 ускорителей на стойку через Ethernet на 600 ГБ/с; до 2048 процессоров в поде — это 432 ТБ HBM4, 32 ПБ/с совокупной полосы памяти и 27 эксафлопс.
Физическую часть — бэкенд-проектирование от уровня вентилей до производства — вёл Broadcom. Платы, стойки и системную интеграцию делает Celestica. OpenAI оставила себе системный дизайн целиком и фронтенд: от RTL до верификации. Именно на этом участке и работали модели.
Как языковые модели вошли в маршрут проектирования
Ставка на XLS, а не на Verilog
Главное архитектурное решение принято до всякого ИИ: команда писала логику не на Verilog, а через XLS — открытый инструмент высокоуровневого синтеза (HLS, high-level synthesis — генерация схемы из кода на языке высокого уровня), который развивает Google. Проектировать в нём можно на DSLX или на C++. По данным Hot Chips, более половины ядра написано именно так.
Логика простая. Модели 2025 года были заметно сильнее в обычном программировании, чем в языках описания аппаратуры: корпусов кода на Verilog в природе на порядки меньше, чем на C++ и Python. Перенеся описание схемы ближе к обычному коду, команда получила участок, где ИИ уже был полезен. Ричард Хо, вице-президент OpenAI по железу, описал эффект так: модели «дают инженерам суперспособности» — можно перебрать гораздо больше вариантов, чем позволяет ручной труд.
Отдельно отмечено, что более поздние внутренние модели уже работают напрямую с Verilog, то есть обходной манёвр через HLS может оказаться приёмом одного поколения.
Где именно ИИ дал измеримый прирост
Самое ценное в этой истории — что приросты названы не «в целом», а по конкретным блокам. ИИ-оптимизация дала +56% для умножителя BF16 и +21% для блока скалярного произведения FP4 относительно базового варианта. Это микроархитектурная работа: перебор вариантов конвейера, разрядностей, способов раскладки операций — та самая задача, где человек упирается в количество итераций, а не в понимание.
И ещё 40 часов уже после кремния
Второй эпизод касается софта. Кремний с фабрики приехал в мае 2026-го, и дальше нужно было писать вычислительные ядра под новую архитектуру. По описанию Spectrum, для latency-ядра DeepSeek производительность подняли с 0,31% до 88,94% от теоретического потолка примерно за 40 часов работы с моделями.
Эта цифра честнее, чем кажется на первый взгляд: 0,31% — это состояние «код формально запускается на новом железе», а не «оптимизированная реализация». Но именно такой разрыв обычно и съедает месяцы инженерного времени при запуске любой новой архитектуры, и именно он закрылся за считанные дни.
Почему команда меньше 100 человек — главный результат
Над проектом работало в среднем менее сотни человек. На фоне штатов, которыми традиционно делаются ускорители такого класса, это и есть настоящая новость — не бенчмарки.
Сроки выстраиваются в понятную цепочку: RTL начали в феврале 2025-го, tape-out прошёл в ноябре, кремний получили в мае 2026-го, развёртывание в собственных дата-центрах намечено на конец года. Второе поколение, по словам компании, подойдёт к tape-out в ближайшие месяцы. Хок Тан, глава Broadcom, говорит о «многопоколенческой дорожной карте» и разворачивании на гигаваттных масштабах с Microsoft и другими партнёрами.
При этом сами инженеры расставили границы аккуратно. Хо и его коллега Лири прямо оговариваются: они не утверждают, что теперь кто угодно соберёт чип уровня state-of-the-art при помощи автоматизации. Экспертиза в предметной области никуда не делась — изменилась цена одной итерации.
Что с производительностью: цифры и оговорки
OpenAI заявляет в 1,5–1,9 раза больше пропускной способности на киловатт и в 1,7–3,6 раза меньшую сквозную задержку (end-to-end latency — время от запроса до полного ответа) по сравнению с системами Nvidia GB200 и GB300. Сравнение шло между 700-ваттным Jalapeño и ускорителями на 1200 и 1400 Вт.
Оговорок к этим числам достаточно, и их стоит держать в голове:
- Сравнивали не с актуальной платформой. Vera Rubin, которая разворачивается позже в 2026 году, в тестах не участвовала.
- Разные режимы генерации. Тесты шли на предсказании по одному токену, тогда как в реальных развёртываниях Nvidia часто применяется мультитокенное предсказание.
- Энергия «из розетки» сглаживает разрыв. При нормировке на полное потребление узла — 1,18 кВт против 2,55 кВт у GB300 — преимущество заметно сужается.
- Класс задач у́же. Обучение моделей Jalapeño не выполняет вовсе.
Иначе говоря: это не «убийца Nvidia», а очень узко заточенный инструмент, у которого хороший шанс окупиться внутри одной компании с гигантским собственным трафиком инференса.
Что здесь практического для разработчиков
Прямого вывода «идите проектировать чипы» тут нет. Зато есть переносимый принцип, который на этом кейсе виден в чистом виде.
Модели окупаются там, где задача измерима и итерация дешёвая. Оба задокументированных успеха — микроархитектурные блоки и вычислительные ядра — имеют жёсткий численный критерий качества: процент от теоретического потолка, площадь, задержка. Модель генерирует вариант, тест выносит вердикт, цикл повторяется тысячи раз. Там, где критерий размыт («сделай архитектуру лучше»), никакого чуда не произошло — это осталось работой людей.
Иногда выгоднее сменить язык, чем ждать модель получше. Переход на XLS — это решение подстроить процесс под сильные стороны инструмента, а не наоборот. Ровно тот же приём работает в обычной разработке: типизированный код, декларативные конфиги, тесты как спецификация — всё, что превращает задачу в проверяемую, резко повышает отдачу от ИИ-ассистента.
Порог входа в собственное железо падает. Если сотня человек за 20 месяцев доводит до кремния ускоритель ретикл-размера, то у компаний с предсказуемой и однотипной нагрузкой появляется аргумент считать свой ASIC. Для рынка это значит больше специализированных чипов и меньше универсальных — со всеми последствиями для того, под что придётся оптимизировать код в ближайшие годы.
Частые вопросы
Нет. Модели работали на конкретных участках: помогали писать и оптимизировать логику через инструмент высокоуровневого синтеза XLS и подбирать варианты микроархитектурных блоков — там зафиксированы приросты +56% для умножителя BF16 и +21% для блока FP4. Системный дизайн, верификацию и физическое проектирование вели люди, а Broadcom отвечала за бэкенд. Сами инженеры OpenAI специально оговариваются, что собрать чип такого уровня одной автоматизацией нельзя.
XLS — открытый инструмент высокоуровневого синтеза от Google, где схему описывают на DSLX или C++. Обучающих данных по обычным языкам программирования на порядки больше, чем по языкам описания аппаратуры, поэтому модели на таком коде были заметно полезнее. По данным Hot Chips, больше половины ядра написано именно через XLS. При этом более поздние внутренние модели OpenAI уже работают напрямую с Verilog.
В заявленных OpenAI тестах — от 1,5 до 1,9 раза больше пропускной способности на киловатт и от 1,7 до 3,6 раза меньшая сквозная задержка против GB200 и GB300. Но оговорок много: сравнения с более новой платформой Vera Rubin не было, тесты шли на предсказании по одному токену, а при нормировке на полное потребление узла разрыв сужается. Обучать модели чип не умеет вообще.
Кремний с фабрики получили в мае 2026 года, развёртывание в дата-центрах намечено на конец 2026-го при участии Microsoft и других партнёров. Второе поколение, по словам компании, подойдёт к tape-out в ближайшие месяцы. В свободную продажу чип не поступает — это внутреннее железо OpenAI.
Источники
- 1.How OpenAI Used Its Own LLMs to Design Its Jalapeño Chip — IEEE Spectrumhttps://spectrum.ieee.org/llms-for-chip-design
- 2.OpenAI and Broadcom unveil LLM-optimized inference chip — OpenAIhttps://openai.com/index/openai-broadcom-jalapeno-inference-chip/
- 3.OpenAI and Broadcom Unveil LLM-Optimized Intelligence Processor — Broadcomhttps://investors.broadcom.com/news-releases/news-release-details/openai-and-broadcom-unveil-llm-optimized-intelligence-processor
- 4.Hot Chips 2026: OpenAI's Jalapeño AI ASIC unpacked — Tom's Hardwarehttps://www.tomshardware.com/tech-industry/artificial-intelligence/hot-chips-2026-openais-jalapeno-ai-asic-unpacked-accelerator-developed-using-ai-achieves-efficiency-and-throughput-gains-against-power-hungry-blackwell
- 5.OpenAI's 700W Jalapeño ASIC outpaces 1,400W Nvidia flagship GPU — Tom's Hardwarehttps://www.tomshardware.com/tech-industry/semiconductors/openai-says-its-jalapeno-chip-beats-nvidias-gb300-in-first-published-benchmarks



