对话 vivo 周围:模型已经够用,手机 AI 拼的是 Harness 和记忆

摘要

模型可以换,用户的记忆和习惯换不走。

头图图片来源:vivo

9 月 16 日下午,2026 vivo 开发者大会的主题演讲结束后,vivo 副总裁、OS 领域副总裁、vivo AI 全球研究院院长周围,vivo AIOS 产品总监黄梓勋,vivo AI 产品总经理关岩冰一起接受了媒体采访。一个半小时里,话题几乎都围着两件事转:原系统 7 的体验,和 vivo 的 AI 战略。

被反复提起的,不是模型参数,而是 Harness。

周围的判断很直接:今年 7 月之后,大模型在大多数生产力场景里已经基本够用,卡住体验的是模型之外的那一层——谁来找工具、调上下文、把任务真正执行完。这也解释了 vivo 为什么把力气花在 6000 多项原子能力、端侧 MoE 模型和个人上下文上。

模型可以换,用户的记忆和习惯换不走。对手机厂商来说,这可能是 AI 时代手里最硬的一张牌。

以下是采访内容,经极客公园整理。问题来自现场多家媒体。

模型之外

问:有观点认为大模型能力已经过剩,你怎么看?

周围:要分三层看。往上走的通用人工智能远没有结束,AI 的自我训练、自我进化才刚刚开始。第二层是生产力,今年 7 月之后,绝大多数生产力场景里模型能力已经基本够用了,真正的限制变成了使用者的想象力,还有 Harness 跟不上「梦想的翅膀」。第三层是手机,它是贴身设备,用户大量的碎片时间,要靠移动端的智能体任务去利用。

问:Harness 在手机上到底扮演什么角色?

周围:它是手机上的执行中枢,负责维持任务循环、寻找工具、调取上下文、执行能力。Harness 本身不挑模型,底下接哪个模型都可以换。需要长期留下来的,是执行逻辑、上下文和用户记忆。

周围:换机也是一样。模型重新下载就行,真正需要迁移的,是日积月累的感知记忆、长期习惯,以及只属于你这个人的上下文。

问:6000 多项原子能力具体指什么?

黄梓勋:原子能力就是最小的功能单元,比如笔记的写入、笔记的格式转换,七八成来自 vivo 自己的系统应用。我们要做的,是把原来「用户→App→页面→按钮→功能」这条路径,重组成「智能体→工具→功能」;使用频率高的组合,再进一步封装成 Skill。6000 多项只是起点,往后需要两三万个 Skill 和接口。

黄梓勋:原子能力七八成来自系统应用|图片来源:vivo

问:第三方应用怎么接入?为什么 vivo 对模拟点屏幕的 GUI 方案比较保守?

黄梓勋:接入格式我们不设限,MCP、A2A、命令行都可以,有的头部办公应用倾向 MCP,有的倾向别的方式。唯一的标准是对智能体工作是否友好、高效。我们优先和头部应用合作,因为用户九成的需求集中在头部。

黄梓勋:GUI 方案效率低,界面一改链路就可能断,还有安全风险,所以内部比较保守,更希望应用自己变得「Agent Ready」。长远看,交互会走向弱界面化。

周围:即使在 PC 上,除了浏览器,很多私有应用对 GUI 的支持也非常弱,因为没有必要。以后支不支持 GUI,是应用自己的事。像日历,应该直接感知系统事件去完成操作,从被动变成主动,而不是靠模拟点击。

问:为什么要把 30B 的模型放进手机?

周围:去年我们还觉得手机上跑 3B、7B 的模型,内存都很吃力。今年年初行业变了:MoE 稀疏模型不必一次加载完,可以按任务难度只调度少数专家,激活参数 1B 到 3B,动态内存只要 2GB 到 4GB,其余参数放在闪存里。12GB 内存已经是标配,拿出 3GB 左右跑 MoE 模型变成了现实。

周围:但从提出方案到对应的芯片规划落地,大约要 24 个月。我们判断到 2028 年底,端侧 MoE 模型会成熟商用。到那时旗舰机是 12GB 到 16GB 内存,留给端侧模型 4GB 以下比较合理。

问:30B 模型跑在端侧之后,云端还会介入吗?

周围:完全不会介入。

问:云端模型为什么不再强调参数量了?

周围:2024 年,70B 是云端的主流模型。但今年 5 月到 8 月,大家对模型的判断反复了好几遍。随着蒸馏技术演进,3B 的模型已经能做很多事,三年后的 3B,可能赶上今天的 70B。

问:为什么坚持自研端侧模型,而不是直接用开源模型?

周围:让我们有信心的,是在用户痛点上看到的方向。端侧模型需要手机厂商基于大量对用户的了解和数据积累去训练,还要在指令集级别做 GPU 优化。只有终端厂商和芯片厂商合作,才能把端侧做好。三五年内,终端厂商自研模型的端侧体验会是最好的。

懂你的边界

问:vivo 说的「个人化智能」,和其他 AI 助手差在哪里?

关岩冰:有两点。第一,端侧的 Harness 和 OS 完全融合,能深入调度整个系统,这是最核心的差异;第二,手机上有只属于用户个人的上下文,放在本地管理也更安全可控。

黄梓勋:我们在行业里算是比较坚定用端侧模型做这件事的。端侧模型提前把照片、文件、文本理解一遍,用户见到那个场景的时候,AI 已经把该做的做完了,用户只需要确认。这一次是 AI 走在人前面。

周围:相册就是例子。去年我们已经在 18 个模块里用上了端侧模型,它在后台默默把你的照片感知一遍。

问:能举一个具体的例子吗?

周围:比如做旅行攻略。携程也能做,普通助手需要你一条条交代条件。但小 V 长期感知下来,知道你妻子怀孕了,会建议带一把折叠小马扎方便她歇脚;知道你看过相关的电影,会推荐去巴音布鲁克。它要懂你身边的家庭关系、社会关系、个人习惯和时空。

周围:等小 V 给你做出一份超过所有家庭成员预期的攻略,你就会让它帮你做生活和工作里的各种事。它会成为你专属的个人助理。

关岩冰:主动服务,前期会更克制|图片来源:vivo

问:AI 主动服务,边界应该划在哪里?

关岩冰:这是一个行业级的难题。每个用户的需求场景都不同,这也正是要做个人化智能的原因。前期我们会更克制,再基于个人的行为习惯,逐步增加服务的深度和广度,内部有一套评价用户体验是正向还是负向的标准。

问:AI 自动执行任务时,会不会碰到 App 的权限壁垒?

关岩冰:执行任务分两类。在系统应用里执行,权限和安全更容易加固;和头部合作伙伴,则一起打磨执行的细节。行业现在还没有明确的标准,体验和安全的边界,需要时间去摸索。

问:小 V Cowork 和互联网厂商的办公智能体是什么关系?

关岩冰:定位不同。它是在手机上遥控 PC 智能体的一块面板。AI 办公的痛点是用户要反复输入背景信息,而手机上的个人上下文是最全的。未来基于手机本地的 Harness,可以让远程的工具像随身助理一样懂你。

周围:手机是 PC 的控制面板,不是重度的生产工具。但用户出门的时候,依然需要随时看智能体跑得怎么样。

问:前两年很热的「手机智能体」,为什么没有在消费端铺开?

大会主题:Agent Phone,智能体手机|图片来源:vivo

周围:不是没有走向 C 端,而是内化到了很多场景里。像点咖啡这类场景,手机智能体是立了功的。对这件事有两面的看法,我们选择搁置争议,让生态自然生长。

黄梓勋:这两年可能没再讲这个词,但思路没有变。从靠用户用语言表达来触发,变成了系统级的个人化智能,把能力内化到底层,实时去理解。

问:AI 功能以后会收费吗?

关岩冰:现在发布的产品,面向用户提供的是免费功能。一部分深度使用、流量大的用户,可以付费扩大流量包,未来几个月整个行业都会有类似的机制。但普通用户,我们还是会提供够用的免费空间。

问:原系统和蓝河操作系统,之后是什么关系?

周围:未来相当长的时间里,原系统依然是绝对主力。蓝河已经能打电话、拍照、发短信,但核心生态还没有成熟。生态的成熟,不是靠我们一家手机厂商就能实现的。

蓝河 4 先上手表,WATCH 6 首发|图片来源:vivo

问:如果大家都在做 Harness,vivo 的竞争力在哪里?

周围:产品的竞争力不在于和友商比,而在于能不能真正理解用户的痛点和场景。为什么那么多视障用户用 vivo 手机?因为我们的团队做出了让人偏爱的、不一样的产品。AI 手机也一样,过一段时间,大家会觉得:这是一台让我满意的手机。

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。