8月22日,SuperCLUE发布OnDevice手机端侧大模型最新测评榜单,vivo蓝心BlueLM 3.5 Nano 3B以89.86分拿下综合排名第一。
而在前一天公布的AgentCLUE Mobile手机GUI Agent基准测评中,vivo蓝心小V首次参评便以92.11分登顶总榜。
两天之内,vivo蓝心在端侧大模型和手机智能体两个赛道接连拿下第一。
据悉,端侧大模型测评专门针对可直接在手机本地运行的模型,云端模型仅作参照不参与排名。
数据显示,谷歌Gemini 3.6 Flash得93.64分,豆包Doubao Seed 2.1 pro得92.99分,千问Qwen3.8 Max得92.25分。vivo这款仅3B参数的本地模型,与顶尖云端模型的分差已缩小到个位数。
端侧榜单中,Qwen3.5 9B以87.82分位列第二,Qwen3.5 4B以85.16分排第三,其余参赛模型包括GLM 4.6V Flash、Gemma 4系列等。
端侧模型的核心优势在于无需全程联网,推理在本地完成,用户输入内容不上传,隐私保护更到位。此前行业普遍认为,受手机硬件限制,本地模型效果会明显落后云端。
vivo用3B小参数跑出接近云端的分数,说明小体积模型不一定非要靠堆参数提升能力。不过面对超复杂任务,3B模型相比十几B、几十B大模型仍有能力上限。
另一场GUI Agent测评中,蓝心小V在复杂意图拆解与动态规划、多模态GUI感知与理解、跨应用全链路执行三个维度全部排名第一,得分分别为94.41分、91.69分、89.12分。
GUI Agent即手机AI助手,用户说出需求后,它能自动识别屏幕界面、点击按钮、跨APP完成整套操作,比如搜电影、订外卖、整理日程。
蓝心小V采用API调用方式,可借助云端大模型能力;其余参评产品中部分采用本地部署,数据留在本机但不依赖网络,两种方案各有取舍。






