NVIDIA 正在通过下一代 Feynman 芯片主导 AI 推理堆栈,并计划将 Groq LPU 单元集成其中。据 GPU 专家 AGF 称,LPU 很可能采用台积电 混合键合(SoIC)技术堆叠在 Feynman GPU 上,就像 AMD 的 X3D CPU 堆叠 3D V-Cache 一样。
这种架构的核心优势是:LPU 配备大量 片上 SRAM,实现低延迟推理和高模型浮点利用率(MFU),同时保留 HBM 作为容量存储。这让 NVIDIA 在解码和低延迟推理任务上获得领先,而 ASIC 厂商的空间被大幅压缩。
为规避反垄断风险,NVIDIA 并未直接收购 Groq,而是签署了 非独家 IP 许可协议,获得 LPU 技术使用权。这种“反向收购”策略类似微软早前收购初创团队的做法,确保 NVIDIA 能整合 LPU 到 AI Factory 架构中,同时避开监管调查。
总结来看,Feynman + LPU 的组合可能将 NVIDIA 在 AI 推理领域的竞争力提升到新高度,同时让 ASIC 竞争者难以追赶。



