铭鸿体育资讯网

前几个月,我们硬件部刚出完一期讲NPU有点鸡肋的视频,没想到这么快就要被打脸了 —— 下一代高通似乎铁了心要加强NPU。 目前,高通已经透露了,他们专门给 NPU 做了一个新的加速器,叫Element Accelerator。之前的 NPU 加速器,各个单元都是各管各的,标量管图像识别、音频分析这类经典 AI,向量管像 ​

前几个月,我们硬件部刚出完一期讲NPU有点鸡肋的视频,没想到这么快就要被打脸了 —— 下一代高通似乎铁了心要加强NPU。

目前,高通已经透露了,他们专门给 NPU 做了一个新的加速器,叫Element Accelerator。之前的 NPU 加速器,各个单元都是各管各的,标量管图像识别、音频分析这类经典 AI,向量管像素级图像模型和长上下文,张量管大矩阵和视觉大模型。Element Accelerator 把这个假设扔了,专押 Transformer,向量单元和标量单元之间的数据通路被重新设计成一条面向 Transformer 运算流的流水线,不再分开搞。再加上给到 NPU的共享内存也会更大——下一代骁龙旗舰的NPU 共享内存最高扩容 50%,上下文与 KV-cache 全程留在 NPU 内部,减少 DDR 往返,这样AI的对话记忆不用每次都跑到内存里去读取了。

这么一搞,高通自己声称可以把300 亿参数的模型装进手机。是的你没有听错,高通正联合内存与模型厂商,把"从闪存加载的 MoE 架构"带上手机,通过智能专家调度,把300亿的参数的模型按需从闪存调入。这样300 亿参数的 MoE 模型,每生成一个词元仅需激活约 30 亿个被路由选中的参数,也算是讨了个巧,毕竟真的让300亿参数的模型按传统的方式在手机上跑,还是不太现实的。至于联合的是哪个内存厂商,还没有透露。

很明显这一代 NPU 的叙事重心从“算得快”转向了“省带宽”——这分明就是冲着多模型并发和长上下文来的。就看各个手机厂商拿到之后,怎么把这部分能力给用起来了。

另外从之前的爆料来看,下一代高通骁龙旗舰的 GPU 也专门针对 AI 进行了优化,但这是面向AI超分和插帧的。他们三个 GPU 切片里各内嵌了一组叫 Matrix Cores 的矩阵计算单元,让 GPU 能在图形管线内直接运行 AI 模型,做AI 超分和插帧,不用再先让 NPU 推理,再把结果传回 GPU 渲染,一来一回的延迟和功耗就被省出来了,虽然显存没有增大,还是18MB,但少了这部分延迟和功耗,高通下一代的游戏AI超分和插帧效果还是可以期待一下的。