codex work负责人:基于html的web是未来识工作的标准交付产物,传统office三件套都会慢慢消亡,新体验一旦上手就回不去了
这次访谈的信息很多,但主线其实很清楚:AI Agent 正从开发者工具变成通用生产力工具,并进一步改变知识工作的组织方式。
Codex 在 OpenAI 内部的意外走红,是一个很有代表性的信号。战略、财务、营销等非开发人员也开始使用它,而且把这种能力视为一种“超能力”。这说明代码只是入口,真正有价值的是 Agent 获得了操作计算机、调用工具和生成完整产物的能力。
能力正在合流,体验仍需分层
Codex 与 ChatGPT Work 使用的是同一套底层 Harness。两者的差异主要不在能力,而在用户体验:是否展示 Git 状态,如何呈现代码差异,怎样设置沙盒,以及向用户暴露多少执行过程。
我认为这个判断很重要。未来的 AI 产品不会再按照“程序员工具”“财务工具”“营销工具”被严格分割。底层能力会逐渐统一,产品需要做的,是根据不同任务给出合适的界面、默认设置和安全边界。
OpenAI 最初也可以把 Codex 和 Work 做成两个彼此独立的产品,最后却选择合并。原因不是产品线管理,而是职业边界本身正在消失。写代码、做战略、设计活动、分析数据和制作内容,越来越可能由同一个人在 AI 的帮助下完成。
因此,产品可以建议用户采用哪种工作模式,却不应按照原有职业身份限制用户能做什么。
产品的关键不是能力,而是让人知道怎么用
通用模型像一个百宝箱,可以接受几乎任何任务。这既是优势,也是障碍:用户面对一个无所不能的黑盒,往往反而不知道从哪里开始。
企业引入 AI 时尤其如此。大家都知道自己拥有大量数据,也愿意投入预算,但一旦追问到底希望解决什么问题,答案就会非常分散。
所以,前沿模型的能力并不会自动转化为生产力。产品必须主动理解具体任务,提供清晰入口,让用户看得见执行过程,并能在关键节点核验和纠偏。
这也是为什么默认配置如此重要。访谈给普通用户的建议很直接:先使用默认设置,只有在成本、速度或结果质量不满足要求时,再调整推理强度或采用多智能体模式。
复杂性应该由系统吸收,而不是转交给用户。一个产品如果要求普通人先理解模型档位、推理参数和 Agent 架构,才能开始工作,它还没有完成真正的产品化。
网站可能成为知识工作的标准交付物
访谈中最值得关注的产品判断,是网站正在从开发工具变成知识工作的标准交付物。
过去,月度报告通常由电子表格、文档和幻灯片组成。现在,OpenAI 内部已经出现直接用网站完成报告和协作的团队。网页的信息容量更大,可以同时承载数据、叙事、交互和视觉重点,也不容易受传统办公软件固定结构的限制。
PPT 的基本单位是一页,表格的基本单位是单元格,文档的基本单位是段落。网站没有这么强的形式约束。重要内容可以成为首页主视觉,数据可以被交互式探索,读者也可以按照自己的问题进入不同层次。
过去网站的上限很高,但制作门槛也很高。AI 把自然语言变成网页后,这个门槛正在快速下降。人们不再需要先学习前端技术,只需要表达自己想交付什么、希望对方如何理解和使用。
所以我更愿意把这件事理解为交付形态的升级,而不只是 Office 软件的替代。传统三件套不会因为格式过时而消失,而会因为无法承载更高带宽、更强交互的工作成果,逐渐退到次要位置。
AI 产品要用成果教育用户
当一个产品可以“创造产品”时,界面设计面临新的矛盾:能力几乎没有上限,但入口必须足够简单。
解决办法不是把所有功能和参数平铺出来,而是给用户留出表达目标、检查工具调用和核验成果的空间。新的能力也不应主要依靠教程来介绍,而应通过具体成果让用户直接看到。
一个可以预览、交互和分享的网站,比一段关于“AI 能做网站”的功能说明更有说服力。眼见为实,本身就是最有效的用户教育。
但共享完整工作上下文也会带来新的安全问题。Agent 接入插件、本地文件和个人记忆之后,掌握的信息可能非常私密。过去由人承担的信息转述和权限判断,不能未经设计就全部交给 AI。
能力统一的同时,访问控制、上下文边界和分享机制必须更加精细。
通才会增加,专长不会消失
AI 正在模糊工程师、产品经理、设计师和运营人员之间的分工。一个人可以在不精通所有专业工具的情况下,完成过去需要多人协作的工作。
这并不意味着专业能力不再重要。更可能出现的是更多 T 型人才:横向上拥有借助 AI 完成多种任务的能力,纵向上仍然保留自己长期深耕的专业领域。
团队规模也未必因此缩小。单项工作的成本下降之后,团队往往会扩大目标,尝试更多过去无法承担的事情。效率提高带来的不只是节省人力,也可能是野心和探索边界同步增长。
当执行能力越来越普及,真正稀缺的东西就会转向创意与品味。大家都能构建产品之后,差距不再主要来自“能不能做”,而来自“做什么”“为什么做”以及“什么值得被保留”。
好的想法也不会由模型凭空生成。它通常来自真实的用户接触、对摩擦和痛点的观察,以及对反馈的持续响应。AI 可以缩短从想法到产品的距离,却不能替代对真实需求的理解。
不要用忙碌衡量生产力
AI 时代最容易失真的,是生产力指标。
代码行数、提交次数、PR 数量和 Token 消耗量,都只能说明发生了多少活动,不能说明取得了多少进展。AI 让生成内容和发起尝试变得极其容易,也让制造“非常忙”的表象变得更容易。
真正值得衡量的,是团队有没有更高质量、更高频率地完成有效试错:提出想法,快速构建,获得反馈,修正假设,然后决定继续、调整或停止。
这里既要看频次,也要看质量。没有明确目标的高速迭代,只是更快地绕圈。管理者最危险的误判,就是把折腾当成推进,把产出数量当成目标达成。
OpenAI 也承认,目前还没有完全解决生产力的统一量化问题。不同用户的目标差异太大,很难用一个通用指标判断 AI 是否真正帮上了忙。
但对具体团队来说,不能因此放弃衡量。团队必须清楚定义什么是实质进展,并让所有试验都回到这个目标上。
我对这次访谈的总体判断是:AI Agent 带来的变化,不只是让原有工作做得更快。它正在同时改写工具边界、职业边界、成果形态和管理指标。
未来真正拉开差距的,也不会是谁调用了更多模型,而是谁能提出更值得解决的问题,形成更好的判断,并以更快的有效循环把判断变成现实。