llya首个模型曝光,基于TTT(Test-Time Training,测试时训练)
这次关于SSI首个模型的消息,目前仍是一则没有实锤的匿名爆料。它真正值得关注的,不是模型会不会在8月亮相,而是它指向了一条不同于继续堆大模型、扩上下文的路线:让模型在使用过程中继续学习。
据爆料,SSI正在探索一个基于TTT,也就是测试时训练的小型推理引擎。模型先用专门整理的数据学习“如何学习”,再在解决问题时更新部分权重。爆料者还称,当前版本已经就绪,下一代规模将扩大10倍,但具体发布时间仍不确定。
我的判断是,这件事可以保持期待,但不能把传闻当成果。真正有价值的,是传闻背后的技术方向与SSI此前释放的信号能够相互印证。
从无所不知转向持续成长
Ilya此前谈到,人并不是生来就掌握所有工作的“通用智能”。人的关键能力,是进入真实环境以后持续学习,在试错中掌握编程、医学和各种新工作。
按照这个思路,超级智能不应该只是一台预训练结束后就定型的机器。它更像一个聪明但知识有限的少年,真正的优势不是已经知道多少,而是能否快速学会新的事情。
这实际上把AI竞争的重点,从“训练出一个知道更多的模型”,转向“训练出一个更会学习的模型”。模型要掌握的不只是具体技能,还包括学习新技能的方法。
TTT改变的是模型自身
传统模型把训练和推理分成两个阶段。训练结束后,参数基本固定;到了推理阶段,模型只能利用上下文窗口里的信息完成任务。
TTT试图打破这条边界。模型在解决眼前问题时,继续利用当前数据训练自己,根据预测误差调整内部状态,甚至更新部分参数。
原文提到的TTT-E2E研究,把长上下文重新解释为持续学习问题。传统做法是把前文留在上下文窗口中,需要时再回头查找;新的思路则是把读到的内容当作训练材料,将信息压入模型权重。
两者的差别很实质。上下文窗口像一张不断加长的小抄,TTT则试图让一次经历真正改变模型。下一次面对相似问题时,它已经不是原来的自己。
它和Agent脚手架不是一回事
Agent Harness和Context Engineering主要依靠外部系统增强模型:提供更多上下文、连接更多工具、设计更完整的工作流程。
这些方法能够明显提高任务完成能力,但模型本身并没有因此改变。它离开这套脚手架后,原有能力仍然大致不变。
TTT走得更深一步。它关注的不是怎样把外部资源组织得更好,而是模型能否把任务中的新经验转化为自身能力。
我认为,两条路线不是简单替代关系。外部脚手架解决的是眼前如何把事情做成,持续学习解决的是做过以后能不能真正成长。
最大障碍不是学习,而是安全
模型能够在部署后修改自己,也意味着它可能学错、学偏,或者在学习新能力时忘掉原有能力。
这不是一个附带问题,而是持续学习能否落地的核心。一个参数固定的模型,至少还能在上线前集中测试;一个持续变化的模型,则需要面对能力和行为边界不断漂移的问题。
原文用微软聊天机器人Tay的经历说明外部诱导的风险。Tay与TTT不是同一种技术,但它暴露了一个共同难题:当系统从真实环境中吸收信息时,怎样阻止恶意输入和错误经验改变它。
因此,“学会学习”只完成了一半。更难的另一半,是让模型知道什么值得学习、什么不能学习,以及学错之后怎样识别和修复。
这也使SSI名称中的“Safe”变得重要。如果SSI研究的确指向部署后的持续学习,那么安全就不是最后增加的一层护栏,而必须成为学习机制本身的一部分。
三条线索仍然不是证据
这则爆料之所以受到关注,是因为它与几条公开线索形成了呼应。
第一,Ilya反复强调持续学习,认为预训练不应该是智能成长的终点。这与TTT希望模型在部署后继续改变自己的方向一致。
第二,原文称英伟达与SSI已经展开长期战略合作,并将帮助SSI把算力提高一个数量级。英伟达的公告还提到,SSI过去两年一直在推进一条高度保密的新研究路线。
第三,TTT近两年的研究进展,确实为持续学习提供了更具体的技术路径。它不再只是关于未来智能的抽象设想,而开始进入长上下文和推理机制的实际探索。
但线索能够解释为什么传闻听起来合理,不能证明传闻就是真的。模型是否存在、效果如何、安全问题是否解决、能否扩展到更大规模,都还需要正式发布和可验证结果。
SSI真正可能改变的竞争尺度
Ilya长期受到关注,不只是因为他的履历,而是因为他曾多次在一条技术路线成为共识之前就参与其中。从深度学习、序列建模到大模型和推理模型,他的判断因此被市场赋予了很高权重。
SSI成立后长期不发模型、不做产品、不公开论文,只反复谈泛化、持续学习和预训练时代的边界。如今,TTT传闻把这些零散信息拼成了一个可能的方向。
如果传闻最终成立,SSI要做的可能不是另一个参数更多、知识更多的GPT,而是一种能够在行动中继续更新自己的模型。
我更关心的也不是它第一次发布时能否超过谁,而是它能否证明三件事:小模型可以通过学习能力弥补训练规模,测试时更新可以稳定扩展,持续成长能够与安全约束同时成立。
这三件事如果成立,AI竞争衡量的就不再只是模型出厂时有多强,还要看它进入真实世界以后,能以多快的速度、在多可靠的边界内成为一个不同的自己。