前沿模型拿走 80% 的收入,开源与低价模型处理 80% 的 token
这句话很像一个 AI 时代的二八定律:
前沿模型拿走 80% 的收入,开源与低价模型处理 80% 的 token。
它真正重要的地方,不在 80% 这个数字是否精确。
而在于它把模型市场拆成了两个完全不同的量纲:收入和 token。
过去我们讨论模型,习惯问一个问题:谁更聪明?
接下来更关键的问题会变成:什么任务值得用最聪明的模型?
高价值任务才看得到模型上限
参考文章用 Fable 5 的评价分化,讲了一个很重要的现象。
同一个模型,有人觉得它已经接近 project owner:会补上下文、拆任务、调用工具、推进流程、自己验证。
也有人觉得它没有带来底层智能质变,只是更贵、更复杂。
这两种体感并不矛盾。
如果任务只是改格式、写普通代码、做生活规划,旧模型和低价模型已经够用。你把最强模型放进去,也很难看出差异。
但如果任务变成大型系统改造、反编译、自动研究、安全攻防、复杂 workflow 搭建,模型就不再是一个“回答器”。
它要自己找上下文,自己做计划,自己调用工具,自己在错误里爬出来。
这时候,模型上限才会显影。
前沿模型的溢价,不来自“所有任务都强一点”。
而来自“少数任务只有它能稳定推进”。
收入在塔尖,token 在塔基
模型市场可能会出现一个很反直觉的结构:
最贵的模型,不一定处理最多 token。
处理最多 token 的模型,也不一定赚最多钱。
塔尖任务的特征,是单次任务价值很高。
一个投资决策、一次核心基础设施重构、一个企业关键流程的自动化、一个能影响研发效率的 internal research loop,额外几百美元、几千美元的 token 成本,并不是主要矛盾。
真正的矛盾是:它能不能做成,结果能不能验收,错误能不能被控制。
塔基任务则完全不同。
它们数量巨大,边际价值较低,结构相对清楚,很多 step 只需要 GPT-4 级别甚至更低的智能。
客服、信息抽取、表格处理、批量内容生成、普通代码修改、企业 workflow 里的中低难度步骤,都会吞掉大量 token。
这就是“收入”和“token”的分叉。
收入流向稀缺的智能上限。
token 流向便宜、稳定、可批量化的智能供给。
低价模型不是低端市场
很多人会把低价模型理解成“低端替代品”。
这个判断太粗。
低价模型真正的机会,是成为企业智能系统里的劳动密集层。
一个 long horizon 任务表面上很复杂,但拆开以后,里面可能有大量简单动作:读文件、改字段、跑测试、整理日志、生成中间摘要、检查格式、填充模板。
这些动作不一定需要最强模型。
如果每一步都用前沿模型,成本结构会很快失控。
如果把其中 80% 的步骤交给开源模型、国产模型、本地小模型或低价 API,系统总成本才有机会下降一个量级。
所以低价模型不是在“替代前沿模型”。
它是在吸收前沿模型释放出来的任务规模。
模型越强,能自动化的任务越多;任务越多,越需要便宜模型承接中间环节。
这是一个典型的杰文斯悖论:单位 token 变便宜以后,总 token 消耗反而可能更大。
真正值钱的是智能分配权
如果这个结构成立,最关键的位置未必只在模型公司。
还在 harness 层。
因为用户真正需要的,不是手动判断每一步该用哪个模型。
用户需要的是:我把目标、边界、上下文、预算和验收标准交给系统,系统自动决定哪里该用前沿模型,哪里该用低价模型,哪里该让人介入。
这就是模型路由从“成本优化”升级为“智能分配”。
普通 routing 只看价格和延迟。
真正有价值的 routing,要理解任务目标、上下文厚度、失败代价、可验收程度、用户偏好、模型池能力和企业预算。
它本质上是在回答一个问题:
这一点智能,应该花在哪里?
Coding agent 之所以会最先跑出来,是因为它有天然闭环。
它能读仓库,能改代码,能跑测试,能看日志,能知道自己有没有做成。
很多 vertical agent 还停留在一次 API call 的世界里,不知道任务 ROI,也不知道失败代价,更不知道这一步到底该用哪个模型。
所以未来的竞争,不只是 model scaling。
也是 allocation scaling。
Tokenmaxxing 会让位于 Valuemaxxing
参考文章里还有一个词很重要:Tokenmaxxing。
企业刚开始用 AI 时,容易把 token 用量当成 AI 转型指标。
谁用得多,谁就更 AI-native。
这很容易变成 reward hacking。
就像云计算时代,query 越来越多,Snowflake 账单越来越高,最后企业必须问:这些 query 到底支撑了什么业务价值?
AI 时代也会走到同一步。
dashboard 不能只看 token 花了多少。
还要看 token 流向哪里:哪些人、哪些 workflow、哪些 practice group、哪些任务消耗了 token,它们有没有流向更高价值的工作。
从 tokenmaxxing 到 valuemaxxing,是企业 AI 预算成熟的标志。
也只有到这一步,前沿模型和低价模型的分工才会变得清楚。
不是所有 token 都值得省。
也不是所有任务都值得贵。
对企业来说,问题不是买哪个模型
最后落到企业,问题会从“买哪个模型”变成“怎么组织智能”。
前沿模型负责突破边界。
低价模型负责规模化执行。
人负责定义目标、提供现实感、判断风险、验收结果。
系统负责维护上下文、拆分任务、调度模型、记录状态、复盘价值。
这其实和智能组织的公式是一致的。
算力不是只买 GPU,也包括 builder 和 agent。
算量不是泛泛的数据量,而是外部市场情报和内部企业知识形成的 context。
算法也不是某个工具,而是组织把使命、文化、流程、知识系统和协作机制连起来,让生产力持续释放、自我修复、自我进化。
模型市场的二八结构,只是外部供给侧的变化。
真正的组织差距,会出现在内部需求侧:谁能把任务定义清楚,把上下文沉淀下来,把验收标准写出来,把高价智能用在刀刃上。
结尾
前沿模型拿走 80% 的收入,开源与低价模型处理 80% 的 token。
这不是一句关于模型价格的判断。
它是一句关于智能分工的判断。
未来的 AI 公司,不会只问“哪个模型最强”。
未来的 AI 组织,也不会只问“我们用了多少 token”。
更重要的问题是:
我们有没有能力,把最贵的智能用在最值钱的任务上?
把最便宜的智能铺到最大规模的流程里?
把每一次 token 消耗,都变成可复盘、可迁移、可积累的组织能力?
如果答案是有,模型价格下降就不是利润压力。
而是智能扩张的入口。
参考
- 《深度讨论 Fable 5:模型收入分化,RSI,Tokenmaxxing 减速|Best Ideas》,海外独角兽,2026年6月23日。https://mp.weixin.qq.com/s/EjcQ1x-uGodUKHdSmsZ4rw