A20 Pro堪称智能手机芯片领域的奇迹,最新的单核与多核跑分成绩进一步巩固了它在业界的声誉。不过,我们对这款SoC的强悍之处仍在不断了解中,最新的发现是:其双16核神经网络引擎的峰值算力据称高于7核GPU——前提是这些工作负载专为NPU量身定制。

在设备端运行30亿参数的小型AI模型以及提示词处理,正是A20 Pro双16核神经网络引擎的专属任务,能够带来巨大的峰值性能提升。
马克斯·温巴赫(Max Weinbach)在X上分享了一个关于A20 Pro和M6的有趣事实:双16核神经网络引擎带来的性能提升可以超过GPU,前提是这些任务能够充分利用它。当然,如果让神经网络引擎去处理图形密集型工作负载或特定动画,速度会慢如蜗牛。
相反,参数为30亿的小型AI模型或提示词处理可以轻松由新的神经网络引擎承担,从而为CPU和GPU释放大量算力。此外,量化AI模型在预填充阶段的提示词处理可直接映射到神经网络引擎流水线,使其成为又一专为该组件设计的工作负载。
设备端语音识别或实时音频增强同样专为NPU打造,视觉功能也是如此,例如实时摄像头深度估计、背景虚化、文字识别和图像分割。然而,如你所知,各类任务会回退到CPU和GPU,比如非量化的FP32或64位浮点数学运算,或者动态改变形状的张量。
回到设备端AI的话题,单token大语言模型生成可能受到神经网络引擎调度开销的影响,使得CPU或GPU更适合这类工作负载。首批iPhone 18 Pro、iPhone 18 Pro Max和iPhone Duo尚未发货,但我们终将遇到一些专为双16核神经网络引擎设计的任务,届时将更好地展示这一升级的实际能力,敬请期待。



