今年 2 月 6 日,可能是人类最后一次在 AI 服务中消耗了比 AI Agent 更多的 token。 OpenRouter 数据显示,此后 Agent 的 token 使用量超过人类,并在约半年内增长至原来的 14 倍,人类当然并没有减少使用 AI,只是越来越多 token 的触发指令被交给了 Agent 代劳
我认为,新一代 Mac 最值得关注的不是某一项性能提升,而是苹果开始按照 AI 工作负载重新定义电脑。
过去,电脑等待人敲下指令。现在,Agent 可以在后台连续读取上下文、调用工具、执行任务。机器仍然属于人,但真正高频使用它的,正在越来越多地变成 Agent。
Mac mini 不再只是入门电脑
新款 Mac mini 提供 M6 和 M5 Pro 两个版本,起售价分别为 6999 元和 12999 元。它仍然体积小、功耗低,却已经不再只是进入 macOS 生态的便宜选择。
M6 版从 16GB 统一内存起步,最高支持 32GB,内存带宽达到每秒 170GB。苹果给出的数据是,与上一代 M4 版相比,CPU 性能最高提升 40%,图形性能最高达到两倍,AI 性能最高达到四倍。
更重要的变化是,M6 的每个 GPU 核心都加入了神经网络加速器,并配备两组 16 核神经网络引擎。这些设计明显指向大模型提示词处理、智能编码、图像生成和轻量级 Agent,而不只是传统办公与影音应用。
M5 Pro 版进一步把统一内存提高到 64GB,带宽提高到每秒 307GB。它既能容纳更大的模型,也能处理复杂三维场景、视频素材和科研数据。苹果甚至把它描述为适合 Agent 或创意工作流的安静常驻设备。
这句话改变了 Mac mini 的产品含义:它既是一台个人电脑,也是一台可以长期连接数据、应用和 Agent 的小型 AI 节点。
Mac Studio 把桌面电脑变成集群
Mac Studio 面向更高强度的模型推理、训练和创意工作,提供 M5 Max 与 M5 Ultra 两种版本,起售价分别为 19999 元和 46999 元。
M5 Max 最高支持 128GB 统一内存和每秒 614GB 的带宽。M5 Ultra 则通过 UltraFusion 连接四个晶粒,最高配备 36 核 CPU、80 核 GPU、512GB 统一内存和每秒 1.2TB 的内存带宽。
512GB 统一内存意味着,桌面设备可以在本地容纳大型数据集以及数百亿乃至数千亿参数的模型。它处理的已不只是个人应用,而是过去通常属于服务器的工作负载。
更值得注意的是多机协同。新款 Mac Studio 可以通过 Thunderbolt 5 和远程直接内存访问技术组成低延迟网络。苹果公布的数据表明,四机集群的推理性能最高可以达到单机的三倍。
苹果还展示过四台 Mac Studio 联合运行万亿参数开放权重模型。按照 FP16 精度计算,这种模型仅权重就理论上需要约 2TB 内存,单机很难承载,多机集群却可以同时扩展计算、内存和带宽。
桌面集群当然不能简单等同于数据中心。实际表现仍然取决于模型精度、内存配置、通信速度和模型架构。但个人电脑开始从单机走向集群,本身就是一次重要的产品逻辑变化。
Agent 需要的不是一次推理
人使用 AI,通常是提出问题并等待回答。Agent 的工作方式不同,它要持续保留文件、历史记录、应用权限、模型状态和任务上下文,还要知道任务进行到了哪里,下一步可以调用什么资源。
因此,一台面向 Agent 的电脑,不能只看峰值算力。它还需要足够大的内存、持续运行的能力、本地数据访问、系统权限管理,以及模型和应用之间稳定的调度环境。
这正是 Mac 的价值所在。它可以访问用户的本地文件和系统应用,也可以把敏感数据留在设备内。统一内存容纳模型,Apple Silicon 提供计算能力,Core AI、Core ML、Metal 和 MLX 等框架调度硬件,操作系统和应用向 Agent 提供数据与工具。
这些能力组合起来,构成的不是一个更快的问答终端,而是一套覆盖上下文、权限、状态和执行过程的本地 AI 环境。
统一内存成为新的产品尺度
传统电脑中,CPU 使用系统内存,独立 GPU 使用显存。模型权重和计算数据需要在两类内存之间传输。独立显卡即使峰值算力很强,也会受到消费级显存容量的限制。
Apple Silicon 让 CPU、GPU、神经网络引擎和其他模块共享同一个物理内存池。模型权重、输入数据和中间结果不必重复保存,也减少了数据搬运。
这使 Mac 的产品分层出现了新的解释:M6 对应日常 AI 工具、智能编码和轻量级 Agent;M5 Pro 承载更复杂的模型与内容处理;M5 Max 进入专业 AI 开发、图像视频生成和大型数据集处理;M5 Ultra 则面向前沿模型推理、本地训练和多机协同。
过去,mini、Pro、Max 和 Ultra 主要代表用户的预算与专业程度。现在,它们也开始代表一台机器能够承载的 AI 工作负载等级。
电脑开始同时服务两类用户
OpenRouter 的数据反映出一个明显趋势:Agent 触发的 token 使用量已经超过人类直接触发的使用量,并在大约半年内增长到原来的 14 倍。这不是人类减少了 AI 使用,而是越来越多操作被交给 Agent 代劳。
当指令的主要发起者发生变化,电脑的设计目标也必须随之改变。性能不再只服务于缩短人的等待时间,还要支持 Agent 长时间运行、维护状态并连续完成任务。
在我看来,这才是新一代 Mac 涨价和性能升级背后的主线。苹果不是简单地给桌面电脑换了一批更快的芯片,而是在为一种新的使用关系准备硬件:电脑仍然服务于人,但越来越多具体工作,将由驻留其中的 Agent 完成。