智东西(公众号:zhidxcom)
作者 | 云鹏
编辑 | 漠影

今天,各类智能终端都在向智能体(Agentic AI)方向快速进化,AI加速从云端走向边缘,越来越多的AI功能可以在端侧高效、快速、安全的实现。

用户只需一句话,智能体就能执行几十甚至上百步操作完成复杂任务;有时你甚至不需要说话,智能体就能感知你所在的环境、理解你的需求、根据记忆主动提供贴心的服务。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

而这一切出色端侧AI体验,都离不开底层芯片平台的扎实支撑,智能体趋势的到来,也在加速着芯片的进化:更高性能、更低功耗、更强大的端侧AI算力、更高效的存储、更安全的保障,这都是智能体时代的“刚需”。

就在最近,芯片生态巨头高通再次“亮剑”,提前剧透了即将在2026骁龙峰会上发布的新一代骁龙旗舰移动平台将采用的诸多硬核技术升级,揭秘了CPU、GPU、NPU等核心模块面向AI智能体的一系列能力强化细节。

从CPU缓存架构革新突破存储瓶颈、AI渲染深度集成于图形管线、GPU专用AI核心的引入到NPU AI计算单元和共享内存的升级,我们看到,新一代骁龙旗舰移动平台完成了一次围绕智能体的全面进化,也将成为2026年下半年旗舰AI手机之战的关键底层支撑。

一、NPU成智能体时代“刚需”,高通联合行业头部构建新一代终端侧AI架构

谈及AI时代芯片变革,NPU的进化始终是行业核心议题。

相比CPU、GPU这两个更基础、发展历史更长久、更成熟的SoC组成单元,NPU的发展从源头就与AI强相关——‌Neural Processing Unit‌,神经网络处理单元,也因此NPU在智能体时代几乎成为智能终端在算力层的“标配”。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

从智能体理解用户个人情境、跨应用协同运行持续推理,到根据用户意图完成操作。AI在端侧的高效落地,离不开出色NPU能力的支撑,离不开NPU与CPU、GPU等模块之间形成高效协同的异构计算系统。

尤其在当下的智能体浪潮中,AI不仅需要更强的推理能力,还需要持续低功耗运行、全天候感知、多模态、低时延等诸多特性的支撑。

这一趋势下,高通将在新一代旗舰平台上发布新的Hexagon NPU和两项关键技术创新,包括新的Element Accelerator和更大的共享内存系统。

据了解,Element Accelerator专为生成式AI和智能体AI的Transformer工作负载打造,其结合向量计算单元和标量计算单元,能加速大模型中最关键的运算,让智能体更快地响应、更高效地推理,同时兼顾能效表现。

此外,Hexagon NPU扩展了大容量共享内存,可以让模型状态、上下文信息和KV-cache数据存储在更靠近AI计算单元的位置,进而缓解内存瓶颈。

这样一来,智能体在处理更长上下文、调用更多工具以及执行更多并发任务时就可以运行更流畅响应更及时、实现更快token生成速度,可以用更少的等待时间完成回答、修订、规划和执行,这对AI智能体体验的提升非常重要。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

值得一提的是,高通正与行业头部内存和模型厂商合作,引入混合专家模型(Mixture-of-Experts,MoE)构建新一代终端侧AI架构。

简单来说就是在兼顾模型性能质量的同时降低模型对存储的消耗:一个300亿参数的MoE模型可以在保持数百亿参数可用的同时,在NPU上每次生成一个词元,仅需激活约30亿个被路由选中的参数。

MoE会根据输入动态选择专用专家网络,从而减少实际计算负载和内存带宽需求,结合智能的专家模块闪存到内存加载管理机制与缓存技术,以低功耗和低内存需求实现更大模型级别的AI体验,颇有“事半功倍”的效果。

同时,对INT2、INT4、INT8、FP8和FP16的支持,让开发者能更灵活地在性能、内存、模型质量和功耗之间取得平衡。

对于基于INT4的模型,Hexagon NPU可以实现最高50%的预填充性能提升、更快的解码吞吐速度、增强的推测解码、更快的词元生成速度。直观效果就是,智能体响应更快、性能更强、结果更个性化,首次生成时间低于1.5秒,近乎即时交互。

总体来看,新一代Hexagon NPU融合了计算性能、存储架构、灵活性等多方面创新,形成了由Element Accelerator、向量和标量计算单元、更大的共享内存以及基于闪存的模型加载机制共同构成的协同架构,在支撑智能体AI端侧落地方面起到了关键作用。

二、5GHz高主频、动态缓存架构创新,Oryon CPU让智能体有个“强大脑”

在AI大模型刚刚诞生之初,AI生成文字、图片是主要用例,那时AI应用的需求更多侧重GPU,而在智能体时代,海量复杂任务的拆解、规划执行,海量数据的感知、处理、分析,都对CPU提出了更高要求。

用高通的话来说,CPU是定义整个平台的核心基础,也是决定整体性能表现的关键所在。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

在硬核峰值性能方面,这一代Oryon CPU成为了业内首个最高主频达到5GHz的移动CPU。

值得注意的是,这一极高的主频并非仅依靠先进制程工艺实现,高通为其进行了完整的定制化设计,从CPU内核的微架构、落地方案到CPU子系统,研发团队对每个组件都进行了精细调校,最终突破移动芯片限制,实现5GHz主频。

在高主频基础上,新一代Oryon CPU的关键IPC性能也进一步提升,两者相结合,让手机在启动App、网页、游戏、内容创作等场景都更流畅,同时让手机在处理智能体AI需求时,CPU的每一次调度、协调、复杂计算都更高效。

众所周知,缓存对IPC的表现至关重要。从智能体规划任务调用工具到多任务多线程并行进行,这些场景涉及大量数据访问,都对缓存有高要求。

为此,高通在下一代旗舰移动平台中引入了新的动态缓存架构Qualcomm Oryon FlexCache,实现“定制化”的CPU体验,其支持异构计算核心访问相同的缓存池,系统可以根据工作负载动态调整分配缓存资源。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

面对高负载任务,超级内核可以充分利用整个缓存池,峰值性能可以更持久的释放。

在当前行业普遍面临存储供应短缺的背景下,这项技术的创新意义尤为凸显:FlexCache减少了核心访问系统内存的频率,因此即使在内存资源受限的情况下,CPU也能提供稳定的性能表现。

在AI智能体时代,FlexCache的重要性更加突出。智能体往往会执行一连串任务,不同任务步骤需要跨不同核心轮流执行。由于所有核心共享同一缓存空间,任务切换过程中相关数据依然保留在缓存中,无需重复加载,智能体能够更高效地在不同核心间协同运行。

从CPU主频、IPC核心性能的大幅提升,到FlexCache缓存架构层的颠覆式升级,新一代Oryon CPU可以说给智能体时代的旗舰移动平台夯实了根基。

新的Oryon CPU会在智能体工作流中承担更多的编排规划工作,统筹平台各类计算资源、协调工作流,并根据智能体的需求调用相应工具,让AI手机可以更好地应对更复杂、更有挑战的AI应用需求。

三、把AI专用核心塞入GPU,AI颠覆游戏体验的时代已经来了

聊完了CPU,我们将目光聚焦于GPU。今天,AI游戏时代俨然已经到来,AI愈发深度地与游戏开发、游戏玩法相结合。

前不久PC端侧发布的DLSS 5技术,将AI模型深度融入图形渲染管线,对端侧游戏市场带来颠覆性冲击。而在移动游戏市场,必然需要高通这样的芯片玩家来推动AI变革的落地。

在高通看来,移动游戏行业十年来一直在追求三件事:主机级的画质、稳定的帧率,以及出色的电池续航。在过去的大部分时间里,用户只能选其二。而高通通过结合AI、专用芯片和先进内存架构,力图让这三件事得以兼得。

为此,高通在GPU层面祭出多项硬核技术大招。

深度解读高通下一代骁龙旗舰芯:CPU、GPU、NPU终极AI进化,黑科技拉满

首先是AI图形渲染技术——Adreno Neural Fusion,这一技术将神经处理、AI超分和帧生成统一整合到单一图形管线中,可以在降低渲染成本和功耗的同时,实现更高的视觉质量,可以说是既要又要了。

值得一提的是,高通还第一次将专用于AI的GPU核心Adreno Matrix Cores引入图形管线,搭配18MB的Adreno独立高速显存(HPM),实现AI工作负载的本地处理,从而降低延迟、延长游戏时的手机续航时间。

纵观行业,英伟达、苹果公司分别在2017年、2025年给自家GPU中加入了专用的AI核心,前者是Tensor Core,后者是Neural Accelerator。高通的入场进一步证明,这已经是行业头部玩家共识的GPU迭代重要方向之一。

高通技术公司产品市场高级总监Cisco Cheng提到,新一代高通Adreno GPU在图形性能和能效两方面都实现了迄今为止最大的代际提升。

与之前的解决方案相比,Adreno Neural Fusion提供了更好的图像质量,减少了画质瑕疵,提升了帧稳定性,并保持细节锐利清晰。

引入Adreno Matrix Cores也是非常关键的一步,这是一组专为AI设计的GPU核心,能在图形管线内直接运行AI模型。

借此,开发者可以以更低的延迟和更小的功耗开销运行日益复杂的渲染模型,神经计算不再需要离开图形管线去别处完成。

高通称这是其AI路线图上的一个重要里程碑:从NPU、CPU到GPU,骁龙平台中的每个核心引擎都已得到Matrix加速能力的加持。

当然,GPU在AI任务处理方面同样离不开高效存储的支撑。Adreno Matrix Cores搭配了18MB的专用优化缓存——Adreno独立高速显存(HPM),集成于Adreno GPU平台中。

HPM为GPU提供了大容量、低延迟的直接内存访问,让基于图块的渲染、帧缓冲和计算工作负载可以留在图形子系统内部处理。更少的数据传输意味着更低的延迟、更高的效率。

对开发者而言,采用率和性能同样重要。Adreno Neural Fusion是同类中首个获得主流游戏引擎支持并已商用的移动AI超分技术。Adreno Neural Fusion目前已获得Unity和Unreal Engine两大主流游戏引擎的支持。

据了解,高通会在今年的骁龙峰会上揭晓所有支持并率先采用这一技术的游戏,其中部分将于今年实现商用。

随着未来越来越多游戏采用Adreno Neural Fusion,在AI加持下,搭载骁龙平台的设备会在游戏方面获得更好画质、更流畅游戏体验和更高能效。AI给移动游戏体验带来颠覆式升级,已成必然。

结语:旗舰芯围绕AI深度进化,高通全力冲刺Agent时代

从NPU、CPU到GPU,高通旗舰平台核心模块的诸多技术升级都直指智能体时代端侧AI落地的关键痛点,如何让AI在端侧跑的“多快好省”,高通可以说给行业抛出了新的高效解法。

在智能体时代,传感器中枢始终保持环境语音感知,SoC其余模块则按需唤醒,各司其职:Oryon CPU负责指挥、规划、推理,并协调整个工作流程,Hexagon NPU和Adreno GPU共同承担AI推理,高通的思路十分明确。

面向未来智能体时代的智能终端大战,高通已经给行业筑牢了扎实的底层算力平台,基于其上,各家大厂会亮出怎样的旗舰AI产品,端侧AI体验又会迎来怎样的革新?我们拭目以待。