英伟达(Nvidia)正试图在其庞大的中国客户群中巧妙权衡——既要保证面向中国市场的产品效能,又要遵守美国全面出口管制所施加的限制。

如今,在北京方面积极劝阻企业进口特朗普(Trump)政府专门批准对华销售的英伟达H200(NVIDIA H200)图形处理器之际,英伟达显然正尝试一条不同的路径,以期在遵守美国出口管制的前提下继续为中国客户群提供价值,而这条狭窄的路径似乎围绕着Groq的语言处理单元(LPU)展开。
英伟达试图将16块Blackwell GPU和4个服务器CPU装入液冷壁挂式机箱,以零前期成本将用户家中的墙壁变成迷你数据中心。英伟达似乎正在设计一款面向中国市场的专用芯片,借助Groq的LPU技术,为AI推理工作负载提供极具吸引力的解决方案。据《信息》(The Information)报道,英伟达正计划通过设计一款面向中国的新型推理芯片来重返中国市场。据悉,这款新芯片将于年底前准备就绪,并将搭载Groq的语言处理单元(LPU)。
或许有些读者尚不了解,英伟达于2025年12月与Groq签署了一项技术许可及资产与人才转移协议。Groq的LPU将数百乃至数千颗专用芯片集群化部署,每颗芯片内部包含庞大的矩阵乘法(MXM)单元和向量(VXM)单元,以及约230MB的超高速静态随机存取存储器(SRAM)。此外,AI模型权重直接烧录至SRAM中,完全绕过了内存缓存的概念。
关键在于,LPU没有分支预测器,也没有硬件调度器。取而代之的是,Groq编译器将每一步计算精确规划到纳秒级,确保相关数据能从SRAM中持续、精准地按规划节奏抵达处理单元,从而实现极速推理。
据《信息》报道,英伟达的新芯片将符合美国出口管制规定——这些规定主要限定了面向中国的AI加速器可搭载的高带宽内存(HBM)容量,同时往往也对晶圆上芯片封装(CoWoS)等先进封装技术实施限制。
与此同时,美国的出口管制反而为中芯国际(SMIC)带来了可观商机。这家中国大陆唯一的7纳米级代工厂产能利用率高达93.7%,最新季度营收达30.1亿美元(同比增长36.1%),净利润几乎翻了两番,达到4.792亿美元。
此外,中国企业正在采用创造性的变通方案应对美国出口管制。例如,阿里巴巴(Alibaba)于2026年3月发布了玄铁C950(XuanTie C950),将其定位为一款基于RISC-V架构的边缘AI芯片。与典型的专用集成电路(ASIC)不同,玄铁C950在处理AI工作负载时并不依赖GPU。这款芯片本质上是一款服务器级的64位RISC-V处理器,单颗芯片上集成了64个计算核心,时钟频率最高可扩展至3.20GHz,多个核心簇(每簇8个核心)通过高速AMBA CHI互连架构原生连接。更值得一提的是,为应对苛刻的AI工作负载,矩阵和向量加速引擎被直接嵌入芯片之中,彻底消除了对GPU的需求。
另一方面,DFSX的DF1000芯片采用成熟的14纳米工艺制造,但搭载了新颖的3D近存计算架构——存储层直接堆叠在计算层之上,并通过3D晶圆级混合键合技术连接,将两层的铜互连融合在一起,完全消除了微凸点或引线。这种设计如同数千万部超高速垂直电梯,而非单一的水平高速公路。
更进一步的是,预计于2026年第四季度在14纳米节点问世的DF2000芯片则将这一理念推向新高度。DF2000并非仅在计算层上堆叠单层存储,而是采用了DFSX所称的“3.5D无限芯粒(Infinity Chiplet)”布局——在基底上将多个堆叠式存储-计算塔并排组合。该芯片本质上以定制工程的3D动态随机存取存储器(DRAM)布局取代了基础存储层,大幅提升了可直接存储于芯片结构内部的临时数据容量。
最后需要指出的是,一家名为上海艾晟钠(Shanghai Aishegna)的神秘中国公司已进军深紫外光刻(DUV)设备领域,计划今年生产5台DUV光刻机,明年再产20台。在这一快速演变的背景下,英伟达似乎已意识到需要采取新的策略来维持其在中国的市场足迹。
英伟达否认正在中国推行LPU路线。该公司将《信息》关于在中国销售LPU的报道称为“不实”,但其声明在很大程度上聚焦于LPU相关计划的当前状态,为未来的策略调整留出了空间。



