
作者|王兆洋
微信|Geisterspiele
“手机哪儿都不会去(Your phone isn’t going anywhere)。”
在今年的高通骁龙峰会上,高通公司总裁兼首席执行官安蒙(Cristiano Amon)直抒胸臆。对于今天所有人都在关心的Agent浪潮如何冲击手机的话题,他给出了直接判断。

他认为,手机过去20年都在围绕App展开,现在则是Agent的时代。但Agent不会让手机不再重要,反而它只会让手机以及更多端侧设备变得更重要。
当然,这些机会属于围绕Agent重塑的设备。在今年声势浩大的骁龙峰会上,高通就想告诉全世界,它是手机和各类终端拿到Agent时代船票的绝佳伙伴,甚至是它们的一条必经之路。
1
重塑旗舰芯片
这次峰会上,高通少有的首次同时发布了两款骁龙8至尊版平台:第六代骁龙8至尊版和第六代骁龙8超级至尊版。两者都采用2纳米工艺,搭载新一代自研Oryon CPU,配备2个超级内核和6个性能内核,其中超级内核最高主频达到5GHz。高通称,这是智能手机CPU首次达到这一频率。
两款芯片的CPU架构和频率相同,GPU、NPU也采用相同的基础架构。区别在于,超级至尊版进一步支持LPDDR6内存,在GPU中加入Matrix Cores矩阵计算核心,提供更强的NPU配置,并采用新的Offset PoP封装。8K 60帧视频拍摄、4K 240帧慢动作等更高规格的影像能力,也集中在超级至尊版上。
“单一标准,已经无法定义旗舰。”高通高级副总裁兼手机业务总经理Chris Patrick说。标准旗舰、Ultra、折叠屏,对影像、性能和成本的要求各不相同。至尊版接续上一代旗舰,超级至尊版承接更多前沿能力,这个很容易让人想到必胜客披萨的中文译名,也的确像披萨一样,不同口味满足不同需求,高通由此给终端厂商留下了更细的选择空间。

两款新品共同面对的变化,则比产品分档更深。Agent要读懂用户要求、调取信息、规划步骤、调用工具,再根据执行结果继续行动。一件事可能要经过多轮推理和操作,手机需要为整段工作流程服务。
安蒙把这称为“一次对系统级设计的挑战”。从计算单元怎样分工,到数据存在哪里、如何传递,再到电池能否支撑持续运行,整个平台都要随之调整。
这个系统工程的第一步,是要让推理和执行接得起来。过去的AI算力讨论更多围绕GPU、NPU展开,但最近越来越多人意识到,Agent也在提高CPU的重要性。
模型生成计划之后,系统要执行程序、检索文件、调用服务,并调度不同计算单元。前一步没完成,后一步往往只能等,整个任务的响应速度因此也取决于CPU处理这些环节的效率。最近走红的Meta个人Agent Muse,就在专属云端虚拟机中运行浏览器、调用服务,带动了市场对服务器CPU需求的预期。模型推理之外的执行负载,也开始受到重视。
“完整的任务编排调度仍然由CPU来完成。”高通执行副总裁马德嘉(Durga Malladi)说。史无前例的5GHz的意义也就在这里:配合缓存和调度优化,让一连串操作更快衔接起来。

NPU则要处理越来越复杂的模型与上下文。超级至尊版的Hexagon NPU引入Hexagon Element Accelerator,支持最高32K Token上下文窗口,实际可用长度还取决于模型和内存配置。按高通公布的数据,在部分模型上,预填充性能较前代最高提升80%。预填充就是模型开始输出之前,先处理输入材料的阶段。Agent面对的输入可能包括邮件、文件、日程和工具返回的结果,这一步的效率,影响着它读完材料、开始行动要等多久。
GPU也有了新的分工。超级至尊版新增Matrix Cores,使AI模型可以更紧密地融入图形管线,支持Adreno Neural Fusion的超分辨率、帧生成等功能。按高通公布的数据,相比第五代骁龙8至尊版,新GPU的性能与能效分别最高提升44%和40%。
这类能力同时也向通用AI任务开放:开发者可以把模型的一部分放在NPU上,另一部分放在GPU的矩阵核心上,按照工作负载选择执行方式。资源更多了,任务分配与数据传递也就更重要。
这些计算单元还需要及时拿到数据。
这一代Oryon引入了FlexCache,让8个CPU核心访问同一个16MB共享L2缓存池,并按需分配资源。缓存是离计算核心很近的临时工作空间,用来保存近期可能反复使用的数据。Agent不断切换任务,不同核心之间也要交换数据,共享缓存能够降低这些交接的成本。
“我们不会单单依靠缓存大小来评判CPU子系统。”高通在介绍FlexCache时,重点也放在异构核心能够以低时延访问同一个缓存池。过去看芯片升级,人们习惯先数多了多少核心、多少MB缓存;现在,数据能否在不同核心之间高效流转,同样决定性能。

NPU的调整也遵循这条思路。超级至尊版将NPU的片上共享内存(SRAM)容量增加50%,让更多运算中间数据保存在片上。高通解释,模型运行时会产生大量激活值和中间结果,如果反复从外部内存搬到计算单元附近,功耗就会增加。GPU的HPM独立高速显存也是片上存储:Adreno Neural Fusion的卷积运算输出可以留在这里,减少对外部DDR内存的访问。
这些存储位置各有用途,共同目标是减少数据往返。计算单元越来越快以后,等待数据的时间和搬运数据的能耗,就会变得更加显眼。
另一个问题是容量。MoE混合专家模型每次只激活部分专家参与计算,整个模型的参数却仍然需要地方存放。手机的运行内存还得留给系统和应用,很难任由模型占满。因此,高通将UFS 5.0与闪存到内存的管理结合,让较大模型可以把权重存放在闪存、按需加载到运行内存,降低全部常驻的压力。这也意味着更多权重读取,对存储带宽和调度提出了要求。
此外,常见的Transformer模型还要用KV Cache保存此前Token的部分注意力计算结果,减少重复计算;较长的上下文通常会占用更多这类工作内存。把权重放进闪存,也不能消除这部分需求。
再往后,高通准备把HBC,也就是High Bandwidth Compute,高带宽计算,带到终端。它把堆叠式DRAM放在带有计算逻辑的裸片之上,让部分计算更靠近数据。HBM的典型方案是让高带宽内存向独立加速器供给数据,HBC则进一步调整计算发生的位置,尽量减少搬运本身。

这是一条后续技术路线,两款新芯片尚未宣布搭载。安蒙预告,下一届MWC将公布更多进展。他预计,未来某些Agent终端每天可能在本地处理多达100万个Token,同时仍要保持全天可用。上下文、推理步骤和调用次数继续增加,内存容量、带宽和能效就会越来越难绕开。
让这套系统持续工作,还要处理待命功耗和散热。
想让Agent主动提供帮助,系统就要持续了解用户的情境,又不能为了随时待命,让主要计算单元一直高负荷运转。新一代传感器中枢采用双Micro NPU架构,高通给出的代际性能提升为85%,功耗降低20%。它以低功耗处理语音、活动和环境信号,减少频繁唤醒主处理器的需要。
基于这套架构,Personal Scribe“个人记录”可以按照用户指示,为对话建立索引、区分发言者,把重要信息整理进个人知识图谱。相机也开始提供更多上下文:Spectra ISP与NPU协同,识别人脸、物体和画面中的不同区域,让视觉信息能够被AI使用。
这些信息还要在设备与云端之间流转。X105调制解调器及射频系统、面向Wi-Fi 8设计的FastConnect 8800,承担着更高吞吐量、更低时延的连接需求。眼镜采集画面,手机处理信息,复杂任务调用云端,每一段连接的质量都会影响Agent能否顺畅完成工作。
甚至连内存与处理器在封装中的相对位置,也需要改变。超级至尊版的Offset PoP重新安排两者的位置,为热量离开处理器提供更有效的通路,以改善高负载下的持续性能。
从任务编排,到数据供给,再到持续感知和运行,高通正在按Agent的工作方式重做手机平台。AI带来的新要求已经落到了整颗芯片的各个部分。

1
Agent在哪里,高通就在哪里
高通认为,Agent会让手机更加重要,背后一个重要原因是手机已经把个人信息、计算和服务连接集中到了一台随身设备上。
Chris Patrick将它的优势归纳为三点:随身、情境感知、连接。它一直跟着用户,能够获得与用户相关的信息,又连接着应用、其他设备和云端资源。高通因此将手机定义为“智能体时代的控制中心”。
一个模型可以知道世界上很多事情,但替你安排今天的生活,还得知道你在哪里、接下来要见谁、刚刚答应了什么。用户每次都重新交代一遍,助手就很难省事。设备中积累的这些信息,决定了通用模型能够在多大程度上成为个人Agent。
而人也不会整天只使用一部手机。电脑知道工作进行到哪一步,眼镜可以获得眼前的视野,耳机适合接收语音,手表贴近日常活动。不同设备各自补充信息,手机则可以提供相对充足的算力、电池和应用连接。用户少掏几次手机,背后的手机可能反而更忙。
跨设备的难点,是上下文不能随着换设备而中断。马德嘉举例,用户先拿手机工作一小时,再换电脑工作两小时,两台设备各自积累的信息,需要共同服务于同一个人。高通正在与终端厂商、云服务伙伴协作,让个人上下文跟着用户走。这需要芯片、软件和服务一起完成。

“你不应该仅仅因为从手机切换到了车内,就需要重新向系统介绍自己。”Google设备与服务负责人Rick Osterloh说。Google正在通过Gemini Intelligence,为传统操作系统增加智能层,并将这些能力扩展到手机、电脑及其他终端。与高通的合作,则要让本地模型和云端处理协同,同时满足终端的算力与散热约束。
与此同时,一部分交互也可以绕过手机。峰会第二天,高通发布第二代骁龙音频平台至尊版:相比前代,平台尺寸缩小30%,计算和AI性能提升至两倍,并集成蓝牙与超低功耗Wi-Fi,支持耳戴设备通过Wi-Fi直接连接云端服务与Agent。
配套的“骁龙畅听应用与智能体”,还让服务商能够直接面向耳戴设备部署应用,产品上市后继续增加功能。耳机由此有机会从手机的音频配件,发展出自己的服务入口。对于高通,计算发生在耳机里、手机里,或两者之间分工,都对应着它能够提供的平台能力。
眼镜需要解决的则是另一组限制:空间更小,电池更小,还得戴得舒服。高通与PrismML合作,让第一代骁龙AR1和AR1+支持多模态1比特模型,通过更紧凑的权重表示减少内存占用。以现场展示的20亿参数Bonsai视觉语言模型为例,17亿参数的语言部分采用1比特权重,3亿参数的视觉编码器仍采用4比特。实时翻译和视觉辅助等能力,也因此有机会在更小的设备上直接运行。

硬件与模型逐步具备条件之后,还要有人把它们做成用户愿意买的产品。骁龙START计划提供AR1+小型模组、眼镜端软件、手机配套应用、云端连接,以及制造与定制资源。品牌可以选择不同模型,高通则尝试用统一的记忆体系,让模型切换之后仍保有连贯的用户上下文。
英国眼镜公司INSPECS的现场展示引人注目。这家公司原有的镜架业务覆盖全球7.5万家眼镜和零售门店,与高通合作的一项产品,是具有摄像头和免手持辅助能力的安全眼镜:工人不用放下工具,就能拍摄检查画面、接受远程指导。
对高通而言,这类拥有产品经验和销售渠道的企业,都可能成为新的客户。Agent拓展到更多生活和工作场景,会带来新的终端形态,也会让原有设备需要更多计算、感知和连接能力。手机的重要性可以继续增加,高通的机会却已经不止于手机。
1
把支撑最前沿智能的计算做到最小硬件单元里
2023年,高通已经展示在终端运行70亿参数的Llama 2,围绕用户意图提供AI服务的设想也早已出现。但那一代模型与今天能支持的任务,相差很远。“我认为当时的模型能力尚不足以支撑这些构想落地。”马德嘉说。
如今模型能力进步,能够建立在其上的Agent应用才随之增加。马德嘉也将衡量端侧AI的重点放在模型质量和实际能力上,包括多轮交互的准确率、任务复杂度,以及能否在Agent工作流中发挥作用。模型进步,为高通原有的计算、内存和感知技术积累找到了更明确的用途。
在这些“家底”基础上,高通还在补强软件一层。今年7月,高通完成对Modular的收购,投入包含Mojo编程语言、MAX推理平台在内的软件栈,并继续推动它适配包括第三方芯片在内的多种硬件。安蒙的目标是,为开发者提供一种统一的方式,在不同计算环境中构建和优化AI。少一些重复适配,各种设备里的计算资源才更容易被调用。
回头看,高通一直在解决类似的问题:把先进的计算能力,连同通信、感知以及软件支持,放进尽可能小的硬件单元,让它成为人们可以随身使用的东西。早期骁龙要把手机变成一台计算机,用1GHz级处理器运行完整操作系统,同时维持全天续航;今天,这台设备又要承担持续运行的Agent。

“手机必须能够装进口袋,不能发烫,而且电池要能够支撑一整天的使用。”安蒙说。模型越能干,这些限制越需要认真处理。眼镜、耳机等更小的设备,还会把同样的难题再推高一层。
当然,平台能力需要被产品兑现。终端厂商要考虑成本,用户要考虑续航、舒适度,以及把个人信息和行动权限交给Agent之后,能不能真的省事。高通还要面对其他芯片平台和客户自研芯片的竞争。“使用智能体必须比你自己动手更简单”,安蒙给出的标准,最终也会决定这些新硬件是否有足够的购买理由。
但当Agent能够稳定接过越来越多的工作,先进计算所要进入的设备和场景也会继续增加。从用户偶尔唤起一次AI,到AI持续为用户工作,设备需要支持的计算量、数据流转和协同程度,都可能大不相同。这有可能成为高通自智能手机普及以来,最大的一次机会。

Agent会成为主角,手机仍有它的工作,高通也有机会随着这些任务走进更多设备。让先进的智能成为人们随身可用的东西,高通的好日子,还在后头。



