突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA
9040点击    2026-08-26 09:40

你敢信,OpenAI第一次做芯片,竟然把英伟达全系干趴下了?!


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


就在刚刚,OpenAI首颗自研芯片Jalapeño「墨西哥辣椒」,交出了首批实测成绩单——


AI推理性能,全面反超英伟达GB200和GB300。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


实测速度直接起飞!


Jalapeño一秒能狂吐1459个Token,英伟达GB200只有535个,连一半都不到。


「辣椒」跑完一个任务只要1.65秒,GB300却得花将近6秒,整整3.6倍的差距


最狠的是,哪怕把GB300逼到它自己最快的解码速度,Jalapeño的吞吐也依然是它的104.3倍。


而Jalapeño的标称功耗只有700W,GB300是1400W,整整一半。


著名半导体分析师Dylan Patel更是直接放出狠话,「被掀翻的不只是Blackwell,就连英伟达Rubin芯片也被超越了」!


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


一时间,整个AI圈都炸了。网友们纷纷惊叹,OpenAI简直杀疯,英伟达也被击败了。


奥特曼的表态则是霸气又克制,「我们造了一颗芯片,快得离谱」!


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


一颗「辣椒」,干翻了英伟达旗舰


这可不是OpenAI自说自话。


SemiAnalysis钻进实验室实测了一趟,写下的结论是——


Jalapeño把他们此前测过的每一颗英伟达、AMD、谷歌的芯片,全干趴下了。


差距有多大?英伟达最新那颗Vera Rubin吃掉的电,够喂将近三颗Jalapeño。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


测试中,OpenAI挑了三个公开模型来跑:GPT-OSS 120B,还有一款670B和1T的模型。


这一轮测试,覆盖了从中型到万亿参数的MoE架构。整体结果如下:


  • 每瓦特AI工作负载提升1.5–1.9倍
  • 端到端延迟降低1.7–3.6倍
  • 在高度交互式工作负载上,性能提升2.1–4.1倍


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


前面提及的1459个Token/s,是在GPT-OSS 120B上测的。


换算成出词间隔,两个Token之间只隔0.69毫秒。


人正常朗读一秒钟大概吐五六个字,而它一秒甩出1459个,眼睛跟不上,屏幕也刷不过来。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


绿色是Jalapeño,蓝色是现有最强。三个模型上分别快2.7倍、4.1倍和3.8倍


1.65秒对5.99秒的那四秒差距,放在聊天里还能忍,放到Agent身上就是另一回事,因为一个任务要连着走几十步,差值是要乘上去的。


然后说那个全网都在转的104.3倍。


它的准确意思是,把GB300推到自己最快的解码速度,也就是每秒169个Token,在那一个点上,Jalapeño的吞吐是它的104.3倍。


三个模型上都是这个走势,GPT-OSS到53.7倍,1T模型到56.1倍。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


同一个模型,随着要求的出词速度往上抬,领先幅度从1.7倍一路涨到104.3倍


换句话说,对手跑到极限开始喘的地方,正是它还在从容巡航的地方。


如果按各自最好的工作点算峰值,差距会温和很多,三个模型上分别是1.9倍、1.7倍和1.5倍。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


真正拉开距离的是高交互场景


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


左图横轴是出词速度,右图横轴是完整请求的延迟。绿色的Jalapeño在整条曲线上都压着蓝色的GB200


SemiAnalysis这边,则是把供电、散热、网络全算进去,然后再摊到每颗芯片头上。


结果,Jalapeño每颗1.125千瓦,GB200是1.87千瓦,而Vera Rubin是3.3千瓦。


在这个口径下跑GPT-OSS,Jalapeño每兆瓦每秒吐出约5300万个Token,GB200 NVL72只有约1000万。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


紫色那条一骑绝尘的就是Jalapeño,横轴是交互速度,纵轴是每兆瓦每秒吐出的Token数


成本方面,每芯片每小时的总拥有成本,Jalapeño是1.56美元,跟H100的1.55美元几乎一样,而Vera Rubin是3.61美元。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


绿色是Vera Rubin,紫色是Jalapeño。过了每秒200个Token,紫色一路走到绿色够不到的地方


最要命的是,这些成绩还不是Jalapeño的全部实力。


它连投机解码和Token预测都没开,也没做prefill和decode的分离部署,而图上其他每颗芯片跑的都是各自最优配置,该开的优化一个不落。


SemiAnalysis估算,光投机解码这一项就能把每Token成本再压掉2/3以上。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


一颗Jalapeño,还能跑起「毁灭战士」


九个月,GPT‑Astra一路干到了流片室


这么一颗东西,从设计到流片OpenAI只用了九个月。相比之下,业内常见的时间是18-36个月。


做过ASIC的都知道,这个周期里最磨人的活是验证。仿真得一轮轮重跑,改一个地方就得从头再来。


OpenAI之所以能「开挂」,是因为它把自家最强的模型请进了流片室——


协助开发Jalapeño的模型叫GPT-Astra,也就是外界一直在传的GPT-6!


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


在整个过程里,GPT-Astra基本上成了团队的最强辅助。


它帮着探索实现方案,把「设计-测量-验证」这一整圈往死里压,还顺手微操了算术电路。


微操到什么程度呢?SemiAnalysis挖到的数字是,AI辅助设计让SIMD单元面积减少8%,矩阵引擎面积减少10%。


同时,这些模块在时序和功耗上都比初版更好。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


计算die居中,两侧各三颗HBM4,上方那条是I/O小芯片


主计算die约840平方毫米,而EUV光刻机的掩模版极限是858平方毫米,这块硅离物理天花板只差18平方毫米。


可以说,基本上把光刻机能画的地方占满了,一点没留。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


粉色那行是Jalapeño,最右边三列是每瓦HBM带宽、每瓦FLOPs和算力带宽比


每瓦HBM带宽这一项,Jalapeño是22,第二名Rubin是11.1,GB300只有5.71。它比第二名高出整整一倍。


而每瓦FLOPs它是19.1,Rubin是19.4,两者几乎打平,可Rubin要烧1800瓦以上,Jalapeño只要700瓦。


这还只是用A0步进跑的。B0已经在晶圆厂里了,每瓦性能比A0还要再高约25%。


就这样,靠着Codex加GPT-Astra这对王炸组合,OpenAI在短短两个月内,把三个原本压根没排进计划的开源模型,一路爆改到了高性能状态。


更吓人的是,在最吃性能的「注意力」和MoE模块上,AI手敲的代码跑起来,直接比人类顶尖专家快了1.5到1.8倍。


AI设计芯片,芯片跑AI,AI再回头优化芯片上的AI。


这个飞轮,OpenAI已经转起来了。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


CUDA护城河,死了?


一直以来,英伟达最深的护城河一直是CUDA。


将近二十年攒下来的软件栈养出了全世界工程师的肌肉记忆,换一次硬件就得推倒重来。


而SemiAnalysis在文章里下了一句相当重的判断,说CUDA的护城河可能已经死了


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


理由,就是速度。


他们还补了一个更扎心的对照,英伟达的Rubin其实比Jalapeño早一个月完成CoWoS流片。


可到现在为止,外界能看到的Rubin成绩只有CoreWeave工程样片那点数据,英伟达并没有像OpenAI这样把第三方放进实验室随便测。


所以问题出在软件起步的速度上,英伟达的硬件本身没毛病。


而从零开始甚至还让OpenAI占了便宜,不用背历史包袱,架构可以完全按白纸来画。


SemiAnalysis最后那句写得很有画面感——


他们说GPT-5.6 Sol这类跑在英伟达GPU上的OpenAI模型,被用来设计了一颗真正威胁CUDA护城河的芯片,英伟达自己的GPU正在实时催生自己的「接班人」。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


10吉瓦,这才刚开场


Jalapeño只是一条战线的第一枪。


去年10月,OpenAI和博通搞了个大动作,签了个10GW定制加速器的合作大单。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


奥特曼和博通CEO陈福阳一起展示Jalapeño晶圆,铭牌上写着「Jalapeño Intelligence Processor」


10GW量级,差不多相当于十座核电机组满发。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


左边CPU主机柜,右边ASIC柜,一柜128颗芯片,两柜合计约160千瓦


顺便说,装CPU的托盘叫Katsu日式炸猪排,装芯片的叫Vindaloo印度咖喱,交换机叫Chana鹰嘴豆,从日本菜一路辣到印度菜,这帮人是真想让你记住这套系统。


而Jalapeño只是路线图上的第一代,OpenAI在报告里写得明明白白——


Gen2已经在深度开发,Gen3也正在成形。


量产要到2027年才逐步爬坡,下一个里程碑是100兆瓦。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


不过,就在今天,OpenAI还被爆出,数据中心大总管Chris Malone走了!


Malone可是负责「星际之门」(Stargate)的掌门人。


如今,IPO越来越近,在这个节骨眼上,失去算力基础设施的关键统帅,不禁让人对OpenAI背后的暗流涌动浮想联翩。


突发,OpenAI首颗「辣椒」芯片压倒英伟达!GPT-6干崩CUDA


当然,一颗Jalapeño,还不足以掀翻英伟达。


但真正危险的信号在于,OpenAI已经把模型、芯片和软件拧成了一个加速飞轮。


今天的Jalapeño只是第一代,后面还有Gen2、Gen3,以及10GW的算力版图。哪怕核心高管离场,也挡不住这条路线继续向前。


英伟达依然坐在王座上。


只是这一次,替代者没有在门外排队,它已经跑进了机房。


英伟达的对手,终于开始自己造英伟达了。


参考资料:


https://openai.com/index/jalapeno-first-results/


https://openai.com/index/the-full-stack-behind-abundant-intelligence/


文章来自于微信公众号 “新智元”,作者 “新智元”

关键词: AI新闻 , AI芯片 , 辣椒 , GPT-6 , Jalapeño
AI转型,免费服务,就找AITNT
AITNT资源拓展
根据文章内容,系统为您匹配了更有价值的资源信息。内容由AI生成,仅供参考
1
智能体

【开源免费】AutoGPT是一个允许用户创建和运行智能体的(AI Agents)项目。用户创建的智能体能够自动执行各种任务,从而让AI有步骤的去解决实际问题。

项目地址:https://github.com/Significant-Gravitas/AutoGPT


【开源免费】MetaGPT是一个“软件开发公司”的智能体项目,只需要输入一句话的老板需求,MetaGPT即可输出用户故事 / 竞品分析 / 需求 / 数据结构 / APIs / 文件等软件开发的相关内容。MetaGPT内置了各种AI角色,包括产品经理 / 架构师 / 项目经理 / 工程师,MetaGPT提供了一个精心调配的软件公司研发全过程的SOP。

项目地址:https://github.com/geekan/MetaGPT/blob/main/docs/README_CN.md