一个反常识的真相:Agent在真实工作场景的成功率依然很低
一个值得重视的现实是:大模型在编程任务上进步很快,但进入电商、生活服务和日常办公等真实场景后,成功率仍然不高。
这不是模型不会推理,而是会解题与会工作之间,隔着一套完全不同的能力。
真实工作不是标准题
现有榜单大多测编程、数学、浏览器操作等单项能力。这些评测很重要,却不能完整回答一个普通用户最关心的问题:把一项真实工作从头到尾交给模型,它究竟能不能完成?
真实任务往往没有整理好的输入。信息散落在邮件、表格、图片、聊天记录和不同系统里,需求还可能反复变化。模型不仅要理解,还要核对、计算、选择工具、执行操作,并保证最终状态完全正确。
现实世界评价工作的方式也很直接。漏掉一个附件、选错一个供应商、填错一次会议时间,都可能让整项任务失败。
电商评测揭示了能力落差
阿里国际站团队推出的 RealReplicaBench,包含107项真实电商任务。这些任务从约160万条完整对话中提炼工作流,再按商业价值、可复现性和结果可判定性筛选而来。
任务覆盖供应商采购、商品发布、店铺经营、订单对账、国际物流和售后争议等场景。
例如,上架一款定制瑜伽垫,不只是生成商品描述。Agent还要识别指定供应商,填写类目、销售国家和差异化价格,再从一批自动编号的照片中选出正确、清晰的商品图。
规划跨国运输路线,也不是只回答一道成本计算题。Agent需要在时限内综合保险、清关、海关担保和平台费用,选出总成本最低的路线,并在模拟货代平台完成订舱和验证。
跨平台对账则要求它清洗多个平台格式不同的订单,统一SKU和订单状态,核对发货与结算差异,最后按规定格式交付收入、成本、佣金和利润数据。
按照素材中的评测结果,排名第一的 Claude Opus 5 完成了65项任务,通过率为60.75%;多数模型没有达到50%。这与人们在编程场景中的体验形成了明显反差。
真正困难的是混乱与闭环
一项供应商采购任务很好地说明了问题。
Agent要从约300封邮件中还原一个项目的最终规格和数量,从20家供应商中找出真正合格且落地成本最低的一家。需求分散在多封邮件里,中途还发生过修改;同一家供应商可能使用不同联系人、邮箱、域名和显示名称,名字相近的公司却未必属于同一主体。
这就要求模型结合工厂地址、电话、银行收款人和出口许可证等信号交叉判断。
选出供应商之后,工作仍未结束。Agent还要给正确的报价添加标签,识别要求更换收款账户的可疑邮件,保存回复草稿,创建启动会议,并提交规定格式的JSON总结。
评测检查的是邮箱、草稿、日历和文件的最终状态。示例任务包含23组、42项结果检查,全部通过才得分。任何一处错误,整项任务就是零分。
这种规则看起来严格,却更接近商业世界。很多工作没有过程分,最后一个环节出错,就可能让前面的努力全部失效。
专用框架有用,但没有消除问题
同一组模型换到面向电商设计的 Accio 框架后,超过50%通过率的模型从2个增加到6个。这说明模型能力并不是全部,工具设计、领域知识、任务拆解和执行框架同样重要。
但框架只能缩小差距,不能把不稳定的模型直接变成可靠员工。现实应用通常还需要人和Agent协同,由人处理关键判断、异常情况和最终确认。
我认为,现阶段评估Agent,不能只问它最好的时候能做到什么,更要问它能否连续、稳定地重复做到。
稳定性比偶尔成功更重要
腾讯混元与高校合作发布的 E-Bench,模拟王者荣耀、QQ音乐和腾讯会议三个产品场景,共设置323项真实操作任务。
素材显示,表现最好的模型 Avg@3 为73.79%,但同一道题独立运行三次都成功的比例只有58.82%。参与测试的11个模型,在这一稳定性指标上都没有超过60%。
小红书发布的 VibeLifeBench 更接近日常生活,包含200项持续数周的任务,覆盖职业、健身、租房、购物和差旅等10个领域。榜首模型的 Avg@3 也只有32.5%。
这些评测的任务和指标不同,不能直接横向排名,但它们共同指出了一个问题:Agent偶尔做对,与可以放心托付,是两件事。
编程是特殊的高适配场景
素材中用于对照的 DeepSWE 包含113项真实软件工程任务。模型需要阅读开源代码仓库、定位问题、修改多个文件、运行测试并提交结果,领先模型的通过率超过70%。
编程任务虽然复杂,却具有一些天然优势:上下文相对集中,目标通常更明确,工具链比较统一,代码可以运行,结果可以测试,错误还能迭代修正。
真实工作则常常相反。信息来源杂乱,规则藏在细节里,多个系统互相牵连,错误代价也不一致。模型既要理解人的模糊表达,又要对现实后果负责。
接下来要评测整项工作
未来真正有价值的模型评测,不应只测某个能力点,而要测完整任务:能否发现信息、处理冲突、调用工具、完成交付,并在多次运行中保持稳定。
企业也需要把自己的真实工作转化成可复现、可判定的评测集。只有把日常业务中的混乱带进测试,模型和Agent框架才会朝着真正有用的方向进步。
在Agent能够稳定闭环之前,更现实的做法不是把整项工作一次性交出去,而是拆清边界:让Agent承担搜索、整理、计算和执行,让人保留高风险决策、异常处理与结果验收。
会解题证明了模型有能力,会工作则要求它在混乱中持续交付。后者才是Agent真正进入组织的门槛。