骁龙 8 Elite Gen 6 发布:本地可跑 300 亿参数 MoE 模型

高通在年度骁龙峰会上发布骁龙 8 Elite Gen 6 与骁龙 8 Elite Extreme Gen 6 两款旗舰处理器,主打方向是端侧 AI 算力。最硬的一个数字是,Extreme 版本能在手机本地直接运行 300 亿参数的混合专家模型。作为参照,苹果今年 6 月 WWDC 上发布过一个 200 亿参数的 MoE 模型。

300 亿参数本地跑是怎么做到的

答案在 MoE 架构上。虽然模型整体规模达到 300 亿参数,处理具体任务时系统只动态激活对应数量的参数,性能保住的同时把能耗压下来。这是端侧跑大模型的标准解法,激活参数量才是真正决定内存和功耗的变量。

两款芯片都配了全新的传感中枢,能支撑最高 2 亿参数的小型模型常驻运行。这个能力落到体验上是几件具体的事,手机可以本地跑个人语音速记员并区分不同说话人,可以基于日常使用习惯建立本地记忆,给自动化任务提供更准的建议,最终实现完整的语音输入到语音输出的智能代理体验。数据不出设备,是这套设计最直接的卖点。

项目 骁龙 8 Elite Gen 6 骁龙 8 Elite Extreme Gen 6
本地大模型 2 亿参数小模型(传感中枢) 300 亿参数 MoE
AI 加速器 全新加速器组件 更强算力配置
视频录制 未单独说明 8K 60fps、4K 240fps 慢动作
编解码器 未单独说明 高级专业视频 APV
音频 AI 增强人声、降噪、语音气泡 同左

影像和音频也顺带升级了

新 CPU 提供像素级的相机控制,优化了画面防抖和运动理解。Extreme 版本支持 8K 60fps 录制和 4K 240fps 超高清慢动作,并引入新的高级专业视频编解码器。音频方面两款芯片都能用 AI 增强人声、降低背景噪声,还搭载了高通新的语音气泡技术,通话时隔离环境杂音。

端侧这条赛道现在有多挤

把大模型塞进终端设备已经不是某一家的独角戏。站内最近写过的几条线可以对照着看,MiniCPM5-2B 把 Agentic Index 做到同级十倍电信开源的 Xing4.0-29B-A4B 用消费级显卡跑 512K 上下文Meta 的 Muse Glimmer 30B 瞄准一张消费级显卡跑满血智能体。手机芯片这次把门槛推到 300 亿参数 MoE,属于同一趋势里走得比较靠前的一档。

真正决定体验的还是模型侧适配。硬件能跑不等于有人会跑,要等高通把工具链和模型库铺开,开发者才有动力把任务往端侧迁。这部分我持观望态度,纸面算力和实际可用之间通常隔着半年到一年。

什么时候能用上

摩托罗拉在峰会期间宣布推出搭载骁龙 8 Elite Extreme Gen 6 的旗舰手机 Motorola Signature 27,预计今年内上市。这是目前已知的首批落地机型。

常见问题

300 亿参数是全部激活吗

不是。MoE 架构下处理特定任务时只动态激活对应数量的参数,整体规模 300 亿是模型总参数量,激活量远小于此,这也是能压住能耗的原因。

普通版和 Extreme 版差在哪

普通版引入新的 AI 加速器组件,以更高效率运行各类 AI 模型;Extreme 版在本地大模型上更强,能直接跑 300 亿参数 MoE,视频规格也更高,支持 8K 60fps 与 4K 240fps。

本地跑模型有什么实际好处

数据不出设备,隐私和延迟都有改善,断网也能用。高通给的场景是本地语音速记、区分说话人、基于使用习惯建立本地记忆,以及完整的语音输入输出智能代理体验。

小结

高通这次把端侧 AI 的标尺往上挪了一格,300 亿参数 MoE 这个数字在手机上确实够看。但决定成败的不是峰值算力,而是有多少应用真的愿意把推理搬到本地,以及开发者工具链跟不跟得上。今年内 Motorola Signature 27 上市后,可以拿真机实测一下这个 300 亿到底能跑出什么体验。


相关阅读