飞书、钉钉和企微一旦提供CLI,相当于主动砍头(Headless),然后,Tencent WorkBuddy可以把他们都OTT掉吗?
我对这轮办公 Agent 竞争的判断是:真正值得争夺的,不只是用户和收入,而是谁能占据真实工作的入口,并把每天发生的任务、失败和修正,转化为模型与执行系统持续进化的燃料。
腾讯 WorkBuddy 的阶段性领先,正在让市场重新估量腾讯。它的价值可能同时落在三个层面:企业 AI 入口、模型训练闭环,以及驾驭模型完成复杂任务的控制框架。
财报暂时记不下它的价值
2026 年 6 月,17 款主流桌面端 AI 办公智能体的月访问量合计超过 6000 万,WorkBuddy 以 2097 万位居第一,超过第二名 Trae 和第三名 QoderWork 之和。
花旗研报给出的数据是月活超过 2000 万、日活超过 1300 万。上线三个月,平台人均 Token 消耗增长超过十倍。
但 WorkBuddy 目前仍是投入项。腾讯披露,剔除 Hy、元宝、CodeBuddy、WorkBuddy 和 QClaw 等新 AI 产品后,2026 年第一季度经调整经营盈利为 844 亿元,同比增长 17%;计入这些投入后为 756 亿元,同比增长 9%。腾讯也明确表示,暂时没有给 WorkBuddy 设置商业化 KPI。
如果只看当期收入,它当然不够性感。但办公 Agent 的战略价值,本来就不只体现在账面收入上。一个稳定进入企业工作流的 Agent,会积累数据、操作习惯和流程依赖,其迁移成本可能比传统软件更高。
WorkBuddy首先是一台问题发现机器
姚顺雨提出,AI 下半场的难点已经从寻找方法转向寻找好问题。模型能力越来越强,稀缺的反而是高质量的情境、工具、环境和真实任务。
WorkBuddy 最重要的资产之一,就是大规模真实任务分布。用户究竟要写报告、整理文件,还是跨多个软件完成流程;哪些错误最不能接受;愿意等待多久;哪些结果看似正确却无法交付——这些问题很难由专家和榜单预先设计出来。
基准测试能说明模型不会做什么,却未必能说明企业员工每天最常做、最值得训练的事情是什么。WorkBuddy 的渗透率越高,腾讯对真实工作问题的优先级就看得越清楚。
这比单纯收集更多文本更有价值。互联网知识并不稀缺,知道下一批训练题应该从哪里来,开始变得稀缺。
干活本身正在成为训练过程
Agent 留下的不只是用户提问和模型回答,而是一整条执行轨迹:怎样拆解任务,调用了哪些工具,在哪一步循环或失败,用户是否重试,哪些内容被删除和重写,最终结果是否被采用。
完成与放弃、接受与推翻、少量修改与大幅返工,都是天然的偏好信号。它们未必能直接进入训练,但可以帮助团队归类失败模式、构造评测任务,并确定后训练的优先级。
WorkBuddy 的更新日志已经出现工具调用历史回放相关修复,这至少说明产品具备工具调用级别的轨迹记录能力。它在执行任务,也在记录任务是怎样被执行的。
这轮数据迁移很值得注意。大模型早期依赖互联网爬取,随后依赖专家标注,如今预算和注意力正在转向真实世界工作数据,以及可以反复运行的强化学习环境。
现实路径未必是把企业原始数据直接拿去训练。更可行的方式,是从真实工作中提取任务分布,再据此构造可训练、可验证、可重置的样本。即使平台拿不到用户文件,只要掌握了“题目从哪里来”,仍然可能获得很高的训练价值。
评测正在从模型跑分转向真实工作
腾讯发布的 WorkBuddy Bench 覆盖代码工程、前端开发、办公流程和安全四个工作域。它从真实代码提交、合并请求和业务场景反向构造任务,并同时使用 CodeBuddy Code 与 Claude Code 两套执行框架运行同一批任务。
这个设计的重要之处,是把模型能力和执行框架能力分开评估。同一个模型放进不同的 Agent 框架,结果可能明显不同。未来的竞争不只是“谁的模型分数高”,还包括“谁更会组织模型完成任务”。
我认为,这正是办公 Agent 的关键转折:评测不再只是实验室里的题库,而是对真实工作过程的重新建模。谁能更快把真实失败转成稳定、可复现的测试环境,谁就更接近产品反哺模型的闭环。
免费Hy3是在购买第一手经验
WorkBuddy 同时接入混元、DeepSeek、GLM、Kimi、MiniMax 等模型。Hy3 上线后限时免费,在用户自选模型中的占比超过 60%。
表面看,这是用推理算力换市场份额。更深一层看,腾讯是在用算力换混元亲自完成任务、亲自失败的机会。
第三方模型产生的轨迹可以帮助腾讯发现任务、归类错误和设计评测,却不能完全替代混元自己的探索。强化学习中,用模型当前策略亲自采集的在线数据,通常比别的模型留下的离线轨迹更直接。
所以,Hy3 的免费策略不能只用积分收入衡量。它让中国渗透率最高的办公 Agent 上,大量任务轨迹从“观察别人怎么做”变成“混元自己怎么做”。
真正的检验在免费结束之后。如果选用率明显回落,说明份额主要来自补贴;如果仍能保持高位,才说明混元形成了真实替代。如果免费继续延长,则可能意味着腾讯对任务轨迹的估值高于短期收入。
模型之外,Harness才是执行能力
同一个模型放在不同 Agent 中,完成复杂任务的效果可能完全不同。差别来自 harness:怎样拆解任务、管理上下文、调用工具、验证结果,以及出错后怎样回滚和重试。
编程 Agent 在这方面走得更早。代码有明确测试,环境容易复制,任务可以反复运行,因此更适合强化学习。办公任务则充满历史状态、组织规则和工具依赖,执行二十步以上、持续一小时以上时,更容易偏离目标、丢失上下文或陷入重复调用。
成功率低会带来反复重试,重试又抬高 Token 成本。执行质量与成本不是两个问题,而是同一个问题的两面。
WorkBuddy 的优势,是每天有大量用户在打磨这套控制系统。循环失败、工具调用错误、技能记忆混乱和人工返工,都可能成为改善 harness 的信号。但这些问题上线数月后仍然存在,也说明产品数据到模型和框架改进之间的闭环尚未完全打通。
Skill本身容易复制,调用分布不容易
WorkBuddy 的 SkillHub 收录了大量技能,也兼容其他技能体系。但 Skill 天然可移植,单纯拥有更多技能并不能构成稳固壁垒。
真正有价值的是调用分布:用户在什么任务上调用了哪个 Skill,调用频率多高,失败率如何,最终是否完成。高频 Skill 往往暴露了模型尚未内化的能力缺口。
如果把 Skill 看成模型能力的工程补丁,那么 Skill 的调用频次与失败率,就是后训练的优先级清单。可以复制的是技能文件,难以复制的是长期积累的真实使用结构。
腾讯的领先还没有变成胜局
WorkBuddy 当前并不完美。与 Codex 相比,它缺少成熟的云端异步多任务能力;与 Claude Code 相比,它在复杂代码仓库的上下文管理上还不够深入。处理复杂 Excel、专业 PPT 和长程任务时,也存在精细度不足、重复执行、偏离目标和成本不透明等问题。
腾讯已经开始收拢内部产品线。QClaw 并入 WorkBuddy 所在部门,说明办公 Agent 从多线赛马逐渐转向资源集中。但聚焦产品只是第一步,真正困难的是把产品数据转成整个腾讯都能复用的模型与工程能力。
阿里和字节也在同步收拢。阿里将 QoderWork、悟空和 MuleRun 整合为千问办公,并与钉钉打通。钉钉拥有企业流程、API 留痕和可回退状态,优势是结果更容易验证;短板是入口主要局限在企业协作系统内部。
字节则整合豆包与飞书团队。真正与 WorkBuddy 形态更接近的是 Trae Work:同样聚合多模型、主打桌面 Agent,并带有更成熟的编程 Agent 血统。它的短板是企业系统连接和治理能力较弱,优势是 harness 积累和接近 WorkBuddy 的用户渗透。
腾讯内部还有企业微信“大圆”这个变量。企业微信同时连接工作数据和客户关系,如果顺利落地,可能形成与桌面 Agent 不同的入口。WorkBuddy、企业微信和微信之间究竟如何分工,将决定腾讯能否把分散场景汇成同一套能力闭环。
我会盯住五个指标
第一,Hy3 免费结束后的选用率。它区分补贴份额和产品力份额。
第二,企业付费坐席和真实活跃企业数。个人用户提供训练信号,企业用户提供收入,两条线必须分别验证。
第三,长链路任务的完成率与返工率。它比月活更直接地反映 harness 是否进步。
第四,WorkBuddy Bench 是否出现由匿名化真实办公轨迹反向构造的任务集。这将证明产品数据真正进入评测与训练流程。
第五,WorkBuddy 积累的任务分布和执行框架能力,能否迁移到元宝、企业微信及腾讯其他产品。如果能力只能留在单一产品里,腾讯内部的产品边界反而会阻断飞轮。
办公入口可能重新定义企业软件
传统企业软件依靠界面、流程和按席位收费。Agent 一旦能够跨系统直接完成任务,软件入口和商业模式都可能被改写。
未来最先被 Agent 改造的,大概率是重复性高、流程固定、结果可验证的工作。谁能把这些工作做成稳定的可执行环境,谁就能同时获得企业入口、训练信号和商业收入。
因此,WorkBuddy 对腾讯的意义不只是多了一个 AI 应用。它可能成为一台持续发现真实问题、记录执行轨迹、构造评测环境并改善模型与 harness 的机器。
这套逻辑最终能否成立,不会由发布会、榜单或短期月活决定。真正的答案是:腾讯能不能把每天数以千万计用户制造的失败,变成下一版模型和下一版 Agent 的能力。