9月17日,两条消息撞在了一起。联发科发布天玑9600 Pro,采用台积电2纳米制程,支持终端本地运行30亿参数的混合专家模型;vivo 放出"口袋编程智能体"BlueCode 预览版,并透露正在预研手机端侧的蓝心30B MoE模型。
一个做芯片,一个做应用,指向的是同一件事:AI 正在从云端搬进你的口袋。
为什么"搬进手机"这件事这么重要
过去用 AI,路径是固定的:你的话上传到云端,模型在数据中心跑完,结果传回来。这条路径有三个天然代价——要联网、要等、你的数据要出门。
端侧推理把这三件事一次性改掉:不联网也能用、响应快、数据不出设备。
联发科这次提到的两个关键指标是预填充速度和单瓦算力,都大幅提升。翻译一下就是"模型开口更快、更省电"。它还加了内存动态调度,保证后台多应用不打架。
30亿参数,够干什么
必须说清楚:30亿参数不是旗舰大模型的量级,它属于"够用就好"的那一档。
它能干的活,是那些高频、简单、但很烦的事:离线翻译、输入法联想、通知摘要、语音转写、把一段话改成更得体的表达。这些事情占了你和 AI 交互的大多数次数,却最不该次次都跑一趟云。
vivo 那边的"端侧编程智能体"则是另一个方向的尝试:如果手机能理解代码、能改代码,很多轻量自动化就不需要开电脑了。
但先别急着高兴
vivo 的 BlueCode 还是预览版,30B MoE 也停留在"预研"阶段。行业里"端侧大模型"讲了三四年,真正落到日常体验的,目前还是那几个小功能。
原因不复杂:
- 手机的电量和散热有上限,跑得动和跑得久是两回事
- 端侧模型能力有限,复杂任务最后还是要回云端
- 开发者要为不同芯片分别适配,成本不低
会先被改变的三件事
1. 隐私敏感场景。健康数据、聊天记录、工作文档,能在本机处理就不出门,这是端侧最有说服力的理由。
2. 弱网和离线场景。地铁、飞机、信号差的乡镇,AI 不该因为断网就变成砖头。
3. 成本结构。每一次云端推理都在花钱,把高频小任务挪到端上,是最直接的降本方式。
芯片的纳米数和模型的参数量,最终都要落到一个问题:你能不能在地铁里,用手机把一封邮件改完发出去。
而在那之前,还有一个更实际的问题:你的手机,准备好长期为模型供电了吗?