阿里正在效仿英伟达(NVIDIA)那套成熟的垂直整合打法:为自家定制的RISC-V芯片——玄铁C950(XuanTie C950),提供其高性能AI模型《Qwen-3.8 27B》的发布首日支持。该模型仅需32GB显存即可运行。

Alibaba-XuanTie-C950-Cover-Image-1.jpeg

现在,阿里可以在自家芯片上运行其通义千问系列AI模型,在全球竞争最激烈的AI市场中,为自己筑起了一道宽阔的护城河。

阿里于2026年3月发布了玄铁C950,将其定位为一款基于RISC-V架构的边缘AI芯片。与典型的ASIC(专用集成电路)不同,玄铁C950不依赖GPU来处理AI工作负载。这颗芯片本质上是一款服务器级的64位RISC-V处理器:单芯片内集成64个计算核心,主频最高可扩展至3.20GHz,并可通过高速AMBA CHI互联总线,将多个计算簇(每簇8个核心)原生地连接在一起。更关键的是,为应对高强度的AI工作负载,芯片内还直接嵌入了矩阵与向量加速引擎,消除了对GPU的需求。

阿里的玄铁C950配备标准一级缓存、灵活且高度可配置的二级缓存,并支持可选共享三级缓存,以消除核间通信瓶颈。该芯片还运用了硬件级的智能数据预取算法,在执行引擎发出请求之前,将内存数据串预加载至缓存层级中。其他重要细节包括:

  • 该芯片基于开源的RISC-V指令集架构(ISA),使阿里能够绕开与x86架构或安谋(ARM)设计相关的授权费用,同时实现更高的定制化程度。

  • 该芯片采用8指令解码宽度,使核心能够同时读取并处理海量命令。

  • 该芯片拥有16级流水线,通过将每条指令分解为16个步骤,在维持高主频的同时,也兼顾了高效执行复杂服务器与AI工作负载的能力。

  • 与GPU不同,玄铁C950在每个插槽上仅运行单条推理线程,因此更适合边缘部署和私有推理场景,而非高并发的公共API(应用程序编程接口)。

定制流水线与集成式加速引擎的结合,使玄铁C950成为首款专为完全原生运行十亿参数级大语言模型(LLM)而设计的RISC-V处理器,无需仿真或转换层——其硬件单元和指令集扩展旨在于直接执行中小型AI模型所需的核心运算。

关键的一点是,业界普遍认为玄铁C950由台积电(TSMC)采用其5nm工艺制造,但阿里并未直接确认这一信息。

“阿里平头哥(T-Head)玄铁RISC-V团队宣布,为Qwen-3.8模型提供发布首日支持,特别是27B版本。其64核C950 CPU(支持RVV向量扩展)可实现每秒30个token的解码速度,首次响应时间(TTFT)为1.9秒。玄铁家族拥有覆盖不同边缘应用的广泛RISC-V芯片系列。阿里现在可以出售……”—— tphuang (@tphuang) 2026年8月18日。

这就引出了今天的核心话题。阿里已为其最新《Qwen-3.8 27B》模型在玄铁C950芯片上提供了发布首日支持,可实现每秒30个token的解码速度,首次响应时间(TTFT)仅为1.9秒。

或许有些读者尚不清楚,《Qwen-3.8 27B》是一个拥有270亿参数的开放权重AI模型,其编程能力与文心一言4.5(Opus 4.5)相当,却能单台笔记本电脑上运行。

通过为玄铁C950提供该模型的发布首日支持,阿里不仅试图将客户锁定在自家生态系统内,还大幅扩展了其算力布局的选择空间。毕竟,阿里可以轻松地将C950与其数据中心内的其他AI加速器配对,以高效处理推理相关工作负载。


文章标签: #处理器 #AI芯片 #RISCV #通义千问 #阿里
菠萝老师先生

负责编辑

  菠萝老师先生 

  让你的每一个瞬间都充满意义地生活,因为在生命的尽头,衡量的不是你活了多少年,而是你如何度过这些年。