Результаты бенчмарка чипа OpenAI Jalapeno: разбор данных

2026-08-26
OpenAI опубликовала первые результаты бенчмарка своего кастомного чипа AI-инференса Jalapeno, показав значительные преимущества над оборудованием Nvidia.
OpenAI опубликовала первые результаты бенчмарка Jalapeño, своего кастомного чипа для ИИ-инференса, 25 августа 2026 года. Цифры достаточно впечатляющие, чтобы заинтересовать любого, кто пользуется ChatGPT на телефоне. Чип по данным OpenAI обеспечивает более быстрые ответы, позволяет обслуживать больше пользователей на каждый ватт и эффективнее обрабатывает большие языковые модели, чем сравниваемые системы на базе оборудования NVIDIA. Если вы используете ChatGPT или любое приложение на базе моделей OpenAI, чип Jalapeño важен, потому что он может напрямую повлиять на скорость и стабильность серверной обработки запросов.
Что представляет собой чип OpenAI Jalapeno
Jalapeño — это интегральная схема специального назначения (ASIC), созданная в партнёрстве с Broadcom. OpenAI представила её в июне 2026 года как свой первый кастомный кремниевый чип, разработанный специально для ИИ-инференса. В отличие от GPU общего назначения, которые используются и для обучения, и для инференса, Jalapeño сосредоточен на одной задаче: запуске обученных моделей для обслуживания пользовательских запросов. Эта специализация имеет значение. Когда чип проектируется для конкретной цели, можно убрать функции, которые ей не нужны, и направить ресурсы на действительно важные операции.
Чип работает при номинальной мощности 700 ватт, но его измеренное постоянное энергопотребление во время опубликованных тестов не превышало 550 ватт. Команда разработчиков OpenAI создала его с нуля, чтобы минимизировать перемещение данных между вычислительными блоками, которое является одним из главных источников задержек при ИИ-инференсе. Состояние модели, включая KV-кэш, используемый при генерации ответов, может сохраняться локально в рамках системы, а не постоянно перемещаться между чипами. По замыслу OpenAI, это позволяет Jalapeño одновременно обеспечивать высокую пропускную способность и низкую задержку, тогда как у универсальных систем часто возникает компромисс между этими показателями.
Результаты бенчмарка Jalapeno в сравнении с оборудованием Nvidia
OpenAI тестировала Jalapeño на InferenceX, публичной платформе бенчмаркинга от SemiAnalysis, которая измеряет полный процесс обслуживания ИИ-запроса. Системами для сравнения послужили NVIDIA GB200 и GB300. При этом результаты были опубликованы OpenAI, а SemiAnalysis проверила лишь часть запусков в лабораторных условиях. Поэтому их нельзя считать полной независимой оценкой всех производственных сценариев.
Результаты охватывают три модели с открытыми весами: GPT-OSS 120B, DeepSeek R1 670B и Kimi K2.5 1T. Вот что показали опубликованные OpenAI результаты в протестированном диапазоне рабочих режимов:
- В 1,5-1,9 раза больше AI-работы на ватт при пиковой пропускной способности во всех трёх моделях
- В 1,7-3,6 раза меньше сквозная задержка во всех трёх моделях
- В 2,1-4,1 раза выше производительность на высокоинтерактивных рабочих нагрузках
- на Kimi K2.5 1T, крупнейшей модели в тесте, Jalapeño показал примерно в 1,5 раза более высокую пиковую производительность на ватт и в 3,4 раза меньшую сквозную задержку.
Сравнение использовало Сравнение использовало опубликованные номиналы мощности каждого ускорителя. Jalapeño рассчитан на 700 ватт против 1200 ватт у GB200 и 1400 ватт у GB300. Это сравнение мощности, а не прямое доказательство того, что система будет потреблять вдвое меньше электроэнергии в любом центре обработки данных.номиналы мощности каждого ускорителя. Jalapeno рассчитан на 700 ватт против 1200 ватт у GB200 и 1400 ватт у GB300. То есть Jalapeno достиг этих результатов, потребляя значительно меньше энергии, чем альтернативы Nvidia.
| Модель | Прирост пропускной способности/ватт | Снижение задержки |
|---|---|---|
| GPT-OSS 120B | в 1,9 раза выше | в 1,7 раза ниже |
| DeepSeek R1 670B | в 1,7 раза выше | в 3,6 раза ниже |
| Kimi K2.5 1T | в 1,5 раза выше | в 3,4 раза ниже |
Для GPT-OSS 120B Jalapeño выдал 85 448 смешанных токенов в секунду на киловатт против 44 960 у GB200. На DeepSeek R1 — 19 641 против 11 781. Это существенные улучшения в условиях данного теста, но они не означают автоматического превосходства во всех моделях, конфигурациях и производственных нагрузках.
Как Jalapeno обрабатывает AI-инференс иначе
Инференс языковых моделей проходит через несколько фаз. Prefill, когда система обрабатывает запрос, требует больших вычислительных ресурсов. Decode, когда система генерирует ответ токен за токеном, в большей степени ограничен пропускной способностью памяти. Чип, который отлично справляется с prefill, может простаивать во время decode, ожидая перемещения данных между вычислительными блоками.
Архитектура Jalapeño решает эту проблему, по утверждению OpenAI, уменьшая перемещение данных и сохраняя состояние модели, включая KV-кэш, локально там, где это возможно. Чип и система вокруг него используют крупный домен связанной памяти и вычислительных ресурсов, позволяющий рабочей нагрузке оставаться в рамках одной подключённой системы. Это снижает задержки связи, которые могут возникать при передаче данных между GPU и другими компонентами. Результат — ускоритель, рассчитанный на баланс между prefill и decode, а также на изменение этого баланса в агентных рабочих нагрузках.
Что это значит для пользователей ChatGPT на мобильных
Если вы используете приложение ChatGPT на Android, вы не будете напрямую взаимодействовать с оборудованием Jalapeño. Чип находится в дата-центрах OpenAI, а не в вашем телефоне. Но возможное повышение производительности может проявиться для пользователя тремя способами.
Во-первых, меньшая сквозная задержка означает, что ответы могут начинаться быстрее. В наиболее крупных протестированных моделях задержка снизилась более чем в три раза. Для интерактивных агентов, которым нужно выполнить несколько шагов подряд, эта экономия накапливается. Задача, требующая пяти последовательных вызовов инференса, может выполняться заметно быстрее, если каждый вызов работает в сопоставимых условиях.
Во-вторых, более высокая пропускная способность на ватт означает, что OpenAI потенциально сможет обслуживать больше одновременных пользователей при том же энергетическом бюджете. В часы пиковой нагрузки это может уменьшить задержки и повысить доступность, однако конкретный пользовательский эффект зависит не только от чипа, но и от загрузки дата-центров, сетевого соединения, выбранной модели и ограничений тарифа.
В-третьих, стоимость инференса может снизиться. OpenAI заявила, что Jalapeño способен улучшить операционную эффективность, позволяя объёму полезной работы и выручке расти быстрее затрат на обслуживание. Более низкие затраты могут облегчить предоставление более мощных моделей на доступных тарифах, но компания пока не объявила, как именно это отразится на ценах подписки или API.
График развёртывания и партнёрство с Nvidia
OpenAI планирует начать небольшое развёртывание Jalapeño в собственной вычислительной инфраструктуре до конца 2026 года, с дальнейшим наращиванием в 2027 году. Компания не раскрыла точных объёмов поставок. Это чип первого поколения, а OpenAI уже разрабатывает второе и третье поколения.
Но Jalapeño не заменит оборудование NVIDIA полностью. Ричард Хо, руководитель аппаратного направления OpenAI, заявил, что общая вычислительная стратегия компании включает нескольких крупных партнёров и что OpenAI не ожидает полной замены сторонних ускорителей Jalapeño. Компания продолжит развёртывать ускорители NVIDIA и других производителей для обучения и инференса параллельно со своим кастомным кремнием.
Этот двойной подход имеет смысл. GPU NVIDIA универсальны и могут быстро работать с новыми архитектурами моделей. Jalapeño настроен на конкретные рабочие нагрузки, которые OpenAI выполняет сегодня, а адаптация к новым семействам моделей всё ещё требует новых ядер и специфических доработок. Гибкость оборудования NVIDIA заполняет пробелы, которые специализированный кремний пока не может закрыть.
ИИ использовался для проектирования и программирования чипа
Одна из самых ярких деталей в блоге OpenAI — то, что сам ИИ сыграл прямую роль в разработке Jalapeño. Команда прошла путь от первоначального дизайна до tapeout за девять месяцев, используя предыдущие модели OpenAI для исследования вариантов реализации и сокращения циклов проектирования, измерений и проверки. ИИ также помог улучшить арифметические схемы чипа, позволив команде разместить больше вычислительной производительности в доступной площади.
На стороне программирования инженеры использовали Codex совместно с GPT-Astra, чтобы довести три модели с открытыми весами до высокой производительности на Jalapeño за два месяца, включая модели, не входившие в первоначальный производственный план. Для отдельных блоков внимания и блоков mixture-of-experts в GPT-OSS реализации, сгенерированные ИИ, работали в 1,5–1,8 раза быстрее, чем версии, написанные экспертами-людьми. Эти показатели относятся только к выбранным блокам, а не ко всей модели или полной системе.
Почему чип OpenAI важен для AI-приложений
Результаты бенчмарка Jalapeño важны за пределами самих цифр производительности. Они показывают, что компания, создающая ИИ-модели, может также разрабатывать оборудование, которое в конкретных нагрузках обслуживает эти модели эффективнее универсальных альтернатив. Такая вертикальная интеграция — от проектирования моделей до кремния — позволяет OpenAI настраивать несколько уровней стека совместно.
Для более широкого рынка ИИ-приложений лучшее оборудование для инференса означает, что разработчики могут создавать более сложные агентные приложения, не упираясь в ограничения задержек. Если вы используете API OpenAI или модели OpenAI в своём Android-приложении, более быстрый и дешёвый инференс может дать больше возможностей для создания отзывчивых мобильных сценариев. Однако конечный результат также зависит от API, сети, серверного ПО и тарифных ограничений.
Конкурентное давление также может заставить NVIDIA и других производителей оборудования улучшаться быстрее. Более эффективные альтернативы способны повлиять на ценообразование для облачных провайдеров и, в конечном итоге, разработчиков приложений. Если вы используете ИИ-приложения на Android, гонка между кастомным кремнием OpenAI и GPU NVIDIA косвенно влияет на стоимость, скорость и доступность серверных услуг.
Суть в следующем: Jalapeño — не просто история об оборудовании для инженеров дата-центров. Это инфраструктурный слой, определяющий, насколько быстро могут отвечать ИИ-приложения и сколько стоит их обслуживание. Первые результаты бенчмарка OpenAI показывают, что компания серьёзно настроена строить этот слой самостоятельно, но окончательные выводы потребуют данных о массовом развёртывании и реальных производственных нагрузках.
Чтобы попробовать ИИ-функции, которые могут выиграть от улучшения инфраструктуры, скачайте приложение ChatGPT из официального Google Play или с официального сайта OpenAI. Приложение даёт доступ к моделям OpenAI на Android-устройстве, однако пользователь не может заранее гарантировать, что конкретный запрос будет обработан именно на Jalapeño. По мере ввода нового оборудования в эксплуатацию серверная производительность может улучшаться без обновления приложения, но это зависит от решений OpenAI.
Примечание по безопасности и конфиденциальности: результаты бенчмарка основаны на материалах OpenAI и тестах на публичной платформе InferenceX, причём часть данных была предоставлена самой OpenAI, а независимая проверка охватывала не весь диапазон результатов. Реальная производительность ChatGPT на мобильных устройствах зависит от сетевого соединения, выбранной модели, тарифа, нагрузки на серверы и состояния дата-центров.