高通公布了下一代旗舰移动平台的部分 NPU 架构信息,新一代 Hexagon NPU 不只是继续堆算力,而是针对 Agentic AI 重新做了架构设计。
核心变化有两个:全新的 Element Accelerator,以及更大的共享内存。前者针对 Transformer 工作负载,通过向量和标量计算单元加速生成式 AI、智能体 AI 的关键运算;后者则让模型状态、上下文和 KV-cache 更靠近 NPU,减少 DDR 访问。
更有意思的是,它还针对 MoE 模型进行了优化。300 亿参数的 MoE,每个 Token 生成阶段只需要激活约 30 亿参数,再结合闪存到内存的智能模型加载,让手机运行更大模型时,不至于被功耗和内存拖住。
另外,INT2/4/8、FP8、FP16 全覆盖,INT4 模型预填充性能最高提升 50%。
所以这次升级的重点,其实不是一句“AI 更快”就能概括的——下一代骁龙正在为真正长期运行、持续推理、主动执行的 AI 智能体重新设计底层架构。
