想象一下一座巨大而灯火通明的数据中心——一座永不入眠的人工之城。成千上万块 GPU 昼夜不停地运转,散热风扇轰鸣如瀑布倾泻。电流在无尽的服务器机架间奔流,让整栋建筑仿佛成为一个有生命、有呼吸的有机体。几乎在每一块电路板上,你都能看到熟悉的绿色英伟达(Nvidia)标志,从生成式人工智能、搜索引擎、推荐系统,到你此刻正在使用的聊天机器人,一切都由它驱动。
但再仔细看看。在同一座数据中心的某个角落,另一种芯片正在悄然崛起。谷歌的 TPU Ironwood 与亚马逊的 Trainium3 正在暗中蓄力,准备挑战英伟达在 AI 计算领域长期建立的统治地位。一场很可能成为过去十年最具决定性意义的科技对决,正在拉开序幕。
英伟达的统治:高利润、强实力,也越来越被质疑
英伟达的霸主地位不仅在技术上无可匹敌,在商业上同样极其成功。公司最近公布的季度营收高达 570 亿美元,其中 512 亿美元 直接来自数据中心 GPU。其 GAAP 毛利率飙升至 73.4%,甚至超过了许多软件巨头。
简单来说,英伟达每卖出一块 GPU,就能带来惊人的利润。这正是投资者将其称为 “AI 时代的军火商” 的原因。但这份利润,却成了其他企业沉重的负担。训练最前沿的 AI 大模型,往往需要成千上万块 GPU。再叠加高带宽显存(HBM)、庞大的存储集群、先进的网络系统以及不断上涨的电费,总体成本结构迅速失控。即便是一些深受用户欢迎的 AI 服务,也依然难以实现盈利。
于是,高管和投资者开始反复追问一个紧迫的问题:
我们究竟还能承受英伟达这样高昂的定价多久?
正是这个问题,为谷歌和亚马逊打开了一扇全新的机会之门——它们正从英伟达的最大客户,转变为最直接的竞争者。
谷歌 TPU Ironwood:数据中心里的“沉默巨兽”
谷歌最新发布的第七代 TPU 芯片 Ironwood,专为高吞吐量机器学习任务而设计。它具备 4,614 TFLOPS 的 FP8 算力,配备 192GB 的 HBM3e 显存,带宽高达 7.3TB/s。
真正的突破在于规模。最多可将 9,216 颗 Ironwood 芯片 互联成一个统一系统,整体 FP8 算力超过 40 Exaflops,共享内存高达 1.7PB。谷歌毫不犹豫地将这一系统称为 AI 超级计算机。
更值得关注的是,谷歌甚至公开将 Ironwood 与英伟达即将推出的 GB300 进行对比,并宣称其 FP8 性能更具优势。传递出的信息非常明确:
驱动 AI 未来的,不再只有英伟达一个引擎。
目前,Ironwood 已在谷歌内部承担实际工作负载,并通过部分 Google Cloud AI 实例对外提供。尽管尚未全面商业化,但英伟达“唯一王者”的时代显然已经开始松动。
亚马逊 Trainium3:重塑 AI 基础设施的经济逻辑
亚马逊云计算服务(AWS)同样动作迅猛。由 Annapurna Labs 设计、采用 3nm 制程工艺 的 Trainium3,可提供 2.52 FP8 Petaflops 的算力,搭配 144GB HBM3e 显存 与 4.9TB/s 的带宽。
AWS 将 144 颗 Trainium3 集成进全新的 EC2 Trn3 UltraServer。单个机架即可实现:
- 362 FP8 Petaflops 的计算性能
- 20.7TB 的 HBM3e 显存
- 706TB/s 的系统带宽
该平台专为 超大规模模型训练 及 上下文长度超过百万 Token 的超长推理任务 而设计。
其背后的战略非常直接:
AWS 希望为客户提供更低成本的 AI 基础设施,并夺回目前被英伟达占据的大量利润空间。
其中一个关键变化尤其引人注目。AWS 宣布,下一代 Trainium4 将通过 NVLink 与英伟达 GPU 实现互联互通。在这种混合架构中,最重负载由英伟达承担,而低压力的推理任务则交由 Trainium 处理,目标并非彻底取代英伟达,而是 显著降低总体成本。
为什么开发者仍然选择英伟达:CUDA 依然不可撼动
从纸面上看,切换到 TPU 或 Trainium 似乎并不困难。但若真正去问工程师,他们往往只给出同一个答案:
CUDA 用起来更简单。
自 2006 年以来,英伟达持续打造 CUDA 生态体系,使其成为全球最成熟的 GPU 编程平台。早在生成式 AI 爆发之前,研究人员、物理学家和深度学习先驱们就已经在 CUDA 上进行探索。即便到了今天,大量新的机器学习特性,仍然优先在英伟达硬件上发布。
现实摆在企业面前十分残酷:整个软件栈——包括流水线、内核与优化方案——都深度绑定 CUDA。迁移到 TPU 或 Trainium 意味着要重写大量代码,并进行大规模系统级调优。理论上的成本节约,往往无法抵消真实世界中的技术风险。
尽管谷歌与 AWS 一再强调其芯片兼容 PyTorch、TensorFlow 与 JAX,并表示切换框架像改几行代码一样简单,但这只适用于小规模演示。在真正的生产级 AI 系统中,现实截然不同。那是一个由定制内核、通信层和手工极致调优算法构成的复杂迷宫。
这正是英伟达护城河看起来更难被攻破的根本原因。
英伟达的反击:用“绝对速度”击退一切对手
英伟达早已意识到威胁的存在,并迅速展开反击。即便 Blackwell 架构 尚未全面部署,英伟达便率先公布了 Rubin 架构 以及下一代 Vera Rubin NVL144 系统。
Rubin 的目标是单 GPU 达到 50 FP4 Petaflops 的推理性能;NVL144 机架整体性能超过 3.6 Exaflops,是上一代 GB300 NVL72 的三倍以上。
随后,英伟达还推出了 Rubin CPX——一款专门负责长上下文推理的配套芯片,而 Rubin GPU 则专注于内容生成。二者组成的 Vera Rubin NVL144 CPX 机架目标性能为:
- 8 Exaflops 的 NVFP4 算力
- 100TB 内存
- 1.7PB/s 的系统带宽
英伟达的战略只有一句话:
如果对手追得上来,那就把产品节奏加快到他们永远追不上。
这也让押注 TPU 或 Trainium 的企业不得不面对一个现实问题:
两三年后,如今的成本优势是否还会存在?
英伟达还能守住王座吗?
当前最可能出现三种局面。
第一种: 英伟达继续保持霸主地位,但利润率下滑。随着谷歌、AWS 和 AMD 规模化扩张,英伟达 70% 的毛利率不可能永久维持。
第二种: 市场走向多极化格局。正如 CPU 从英特尔一家独大,演变为英特尔、AMD、ARM 以及各国芯片公司并存,AI 加速器市场也可能走上同样的道路。英伟达仍是领头羊,但不再拥有垄断权力。
第三种: AI 泡沫降温,企业投资热情减弱,GPU 支出放缓,英伟达最先受到冲击。但从当前的产业普及速度来看,更像是降速,而非崩盘。
最现实的结果,很可能是前两种情况的结合:英伟达依然是巨头,但谷歌与亚马逊正在持续蚕食其版图。
这对所有人意味着什么?
对于普通用户和开发者来说,真正的问题在于:
未来十年,AI 的使用成本和能力将发生怎样的变化?
AI 订阅服务会变便宜吗?模型是否能支持更长的上下文窗口,并在文本、视频、3D、游戏等场景中实现真正的多任务协同?我们是否会迎来一个由专用芯片主导应用演进的 AI 生态?
AI 芯片之战不仅关乎输赢,更关乎 未来十年计算规则由谁来书写。
英伟达依然稳坐王座,但谷歌和亚马逊已不再只是旁观者——他们正在王庭之内磨刀霍霍。
AI 的未来,将取决于这些巨头选择如何开战。
**免责声明:**本文仅代表作者个人观点,半导体行业观察转载该文仅为呈现不同视角,并不代表其对文中观点的认同或支持。如有异议,请联系半导体行业观察。

