OpenAI и Broadcom представили Jalapeño, первый собственный ускоритель OpenAI для инференса LLM. Инференс — это этап, где модель уже обучена и отвечает на запрос пользователя: пишет текст в ChatGPT, выполняет задачу в Codex или обслуживает вызов через API.
Главная идея чипа в том, чтобы оптимизировать не абстрактную ИИ-нагрузку, а реальные сценарии OpenAI. Компания пишет, что архитектура учитывает модели, ядра вычислений, системы обслуживания запросов, сетевую часть и будущие агентские продукты. Для OpenAI это важный шаг вниз по стеку: от приложений и моделей к собственному железу, на котором эти модели работают.
Jalapeño рассчитан на ответы моделей, а не на их обучение
Jalapeño создан для работы LLM после обучения. Это отличает его от универсальных GPU, которые используются и для обучения, и для обслуживания моделей. Специализация даёт шанс снизить задержку и стоимость ответа, если чип действительно хорошо ложится на рабочие нагрузки OpenAI.
Компания говорит, что инженерные образцы уже запускают ML-нагрузки в лаборатории на целевой частоте и мощности. Среди тестируемых задач OpenAI называет GPT-5.3-Codex-Spark. Финальных цифр пока нет: OpenAI отдельно уточняет, что продолжает измерять производительность, а подробный технический отчёт обещает в ближайшие месяцы.
Это важная оговорка. Пока заявление про лучшую производительность на ватт остаётся ранней оценкой самой компании, а не независимым сравнением с Nvidia Blackwell, Google TPU или другими ускорителями.
Broadcom даёт кремний, Celestica — серверную сборку
OpenAI проектировала Jalapeño вместе с Broadcom и Celestica. По описанию компаний, Broadcom отвечает за реализацию кремния, сетевые технологии и подключение на уровне крупной инфраструктуры. В проекте также упоминается сетевой чип Tomahawk. Celestica помогает с платами, стойками и интеграцией серверных систем.
Jalapeño станет первой частью много поколенной вычислительной платформы. Первое развёртывание заявлено до конца 2026 года, дальше OpenAI и партнёры планируют масштабировать платформу в дата-центрах. В анонсе Broadcom отдельно говорится о развёртывании на гигаваттном уровне с Microsoft и другими партнёрами, начиная с 2026 года.
Здесь хорошо видно, почему новость больше обычного релиза железа. OpenAI пытается контролировать не отдельный ускоритель, а цепочку от модели до дата-центра: архитектуру чипа, память, сеть, планирование задач и продуктовый опыт.
Девять месяцев до передачи дизайна в производство
OpenAI и Broadcom заявляют, что путь от начального дизайна до передачи финального проекта в производство занял девять месяцев. Компания подчёркивает, что часть проектирования и оптимизации ускорялась с помощью собственных моделей.
Это сильный редакционный момент: ИИ уже используют не только как продукт для пользователей, но и как инструмент для создания следующей инфраструктуры ИИ. Если такой цикл подтвердится на нескольких поколениях чипов, преимущество будет не только в цене одного ответа, но и в скорости обновления железа под новые модели.
Reuters уточняет, что производство связано с TSMC, а серверные системы будет собирать Celestica. Издание также пишет, что чипы и системы Jalapeño предназначены для использования самой OpenAI, а не для продажи как отдельный продукт.
Nvidia остаётся в игре, но давление растёт
Jalapeño не выглядит как немедленный отказ от Nvidia. Чип рассчитан прежде всего на обслуживание запросов, а обучение новых моделей остаётся отдельной задачей с другими требованиями к вычислениям, памяти и сети.
Смысл релиза в другом: OpenAI хочет уменьшить зависимость от внешнего железа там, где ежедневно сгорает огромный объём вычислений. Чем больше пользователей у ChatGPT, Codex и API, тем дороже становится каждый процент неэффективности. Собственный ускоритель может дать компании больше контроля над стоимостью ответа, доступностью сервиса и планированием будущих моделей.
Здесь конкуренция переходит из уровня «чья модель умнее» в уровень «у кого дешевле и стабильнее работает вся фабрика ответов». Для пользователей это может проявиться не сразу. Сначала эффект будет внутри инфраструктуры: меньше задержек, выше пропускная способность, спокойнее работа под пиковыми нагрузками. Потом это может отразиться на тарифах, лимитах и скорости агентских продуктов.
Главный открытый вопрос — публичные бенчмарки. Пока OpenAI показала направление и партнёров, но не раскрыла детальные показатели, цену владения, конфигурации памяти и сравнение в одинаковых условиях. Именно по этим данным станет понятно, Jalapeño — инфраструктурный символ или реальный рычаг против дефицита дорогих GPU.