RSI 又火了,这篇有料
过去几个月,市场对 AI 资本开支的主流判断逐渐收敛:除 Coding 外,缺乏下一个能支撑万亿级收入的应用,但近期一系列事件表明,真正决定训练侧开支节奏的变量,可能并非当期应用商业化进度,而是前沿实验室是否仍认为「下一代模型或研究流程值得大规模投入」。RSI(递归自我改进)正在从概念变成有组织、有时间表、有专人负责的执行事项。
一、RSI(递归自我改进)开始进入资源配置
第一,NVIDIA 与 Ilya 的 SSI 的合作。2026 年 7 月 27 日,NVIDIA 与 Safe Superintelligence Inc.(SSI)联合宣布长期战略合作。NVIDIA 对 SSI 进行 “重大投资”(彭博援引知情人士报道约 50 亿美元),并给予下一代 Vera Rubin 平台的访问权。双方明确,SSI 未来 12 个月算力将提升一个数量级(10×)。这里的 10× 指的是 SSI 总可用训练算力,由硬件代际、集群规模扩张与战略伙伴优先供应权共同构成。对体量远小于 OpenAI、Anthropic、xAI 的纯研究实验室而言,这个幅度仍然实质。
更关键的是 Ilya 本人的表态。公告里他说:“We have research that is worth scaling up.” 这和他过去两年的说法不太不一样 ——2024 年 NeurIPS 上他曾断言预训练(按现有方式)会结束。2025 年 11 月又系统提出行业正从 Scaling 时代转向 Research 时代。八个月后转而说研究已值得大规模扩张,变化本身值得注意。SSI 几乎不发论文、不推产品,NVIDIA 却选择投入并开放最先进硬件,至少说明在芯片侧看来,这个方向已经值得继续加码。
第二,OpenAI 对 RSI 的组织确认。翁荔(Lilian Weng)曾任 OpenAI 安全研究副总裁,后参与创办 Thinking Machines。2026 年 7 月 27 日前后,她发布离职声明,称过去七个月经历严重病痛,并表示下一站希望找职责更明确的岗位、不再做联创。约 48 小时后,OpenAI 发言人向媒体确认,她将回归并领导一个聚焦「RSI」的团队,目标是用 AI 加速设计、训练、评估下一代模型的整套流程。
她于 2026 年 7 月 4 日在个人博客发表长文。文章的核心判断很直接:现阶段想让 AI 自我改进,最现实的入口不是让模型直接改自己的权重,而是先把模型外面的「脚手架」做好。她把这层脚手架叫做 Harness—— 负责安排模型怎么规划、怎么调用工具、怎么记住上下文、怎么存中间结果、怎么判断好坏。她打了个比方:今天 Agent 应用之所以相对靠谱,靠的往往不是基座模型突然变强,而是这层外围系统被认真工程化过了,就像操作系统之于硬件。
在她看来,可以先从几件事入手:
把任务拆成「计划 — 执行 — 观察 — 改进」的循环,让模型能多轮迭代。
把上下文管理得更好,避免长对话里关键信息丢失;
用自动流程去生成和筛选训练数据,甚至尝试让系统自己完成从提想法、写代码、跑实验到写结论的研究闭环。
再进一步,让这套外围系统本身也能被搜索和优化,而不是全靠人工设计。
与此同时,她也指出了现实难点:评价标准在需要「品味」和长期判断时仍然很弱,优化过程容易钻空子、过拟合已知信号,长任务里记忆容易乱,而且关键节点目前还离不开人来把关。她的总体判断是,先把这层外围系统做成可以持续改进的「元方法」,部分能力以后或许会内化进模型,但与外部工具和真实环境的接口仍会保留。
OpenAI 首席科学家 Jakub Pachocki 在 2026 年 3 月接受 MIT Technology Review 采访时,把「全自动 AI 研究员」定为公司未来几年的 North Star,并给出两个时间节点:2026 年 9 月达到能独立处理部分研究问题、连续工作数天的「AI 研究实习生」水平;2028 年迈向能自己提出假设、设计实验并得出结论的全自动研究系统。这是公开目标,不是已经实现的能力,但为后续判断 OpenAI 的 RSI 进展提供了明确坐标。
这两件事的共同点,是头部机构已经开始为 RSI 配置负责人、资本和训练资源。它们还不能证明 RSI 已经跑通,但足以说明这不再只是远期叙事。
二、两条不同的 RSI 路径
Ilya/SSI 与 Lilian/OpenAI 的路径存在清晰差异。
Ilya 一侧更强调底层研究方向的突破。SSI 作为纯研究实验室,唯一目标是安全超级智能,公开技术细节极少。「Research is worth scaling」的表态,暗示其可能找到了新的、能让规模重新产生非线性收益的算法或训练范式。就投资链条而言,这条路线押注的是算力优势能否先转化为研究速度,再转化为模型能力。
Lilian 一侧则明确从工程层切入。她把近阶段 RSI 的现实入口定为 Harness:先把模型外面的规划、工具调用、记忆和评价系统做好,并让这套系统本身也能被持续优化,而不是一上来就让模型改自己的权重。OpenAI 的时间表也更具体 ——2026 年 9 月「研究实习生」、2028 年全自动多 Agent 系统 —— 可验证性相对更高。
两者并不矛盾。完整的自我改进循环,既需要真正值得扩展的新研究方向,也需要高效、可自动优化的研究与实验流水线。没有好的外围系统,再好的方向也难以快速验证;没有方向突破,只优化外围,天花板仍受限于现有范式。当前公开信息下,Lilian 的路径更可观察,Ilya 的路径更高维但更不透明。
三、真正的约束仍然存在
无论哪条路径,都绕不开数据与评价层面的硬约束。根据笔者近期的调研,标准化 SFT 数据已经可以批量合成 —— 指令遵循、格式变换、正反样本构造等边界清晰的任务,国内模型公司确有进展。但这只解决了第一层问题。一旦进入强化学习和长程任务,稀缺的变为高价值轨迹、失败后的恢复路径,以及能在复杂环境中稳定判断好坏的评价器。
模型最容易重复自己已经会的行为,真正有增量的低概率路径往往淹没在大量无效错误里。笔者调研中的一个直观感受是:有时一天生成上千条数据,也未必能找到一对真正适合比较的样本。长程任务里,最缺的往往不是又一条正确答案,而是出错之后怎么办 —— 退回哪一步、换什么方法、继续还是停止。这类恢复数据很难预先合成,真实交互中的失败与反馈,目前仍是纯合成流程最难覆盖的部分。即便有了完整轨迹,判断哪些行为值得强化也高度依赖经验;格式完整的错误回答,仍有可能骗过评价器。
展示一套数据生成流程已经不够。更关键的是,系统能否持续找到模型原本不倾向于走、但结果更好的轨迹,能否在出错后恢复,以及评价器能否稳定分辨好坏。没有这些证据,「掌握合成数据方法」只能说明追赶条件改善,不能说明复杂任务的数据闭环已经跑通。
四、对训练侧 CapEx 与投资的含义
上述变化对资本开支逻辑有三点影响。
第一,训练侧需求的韧性可能强于「应用决定投资」的简单推导。只要头部实验室仍认为下一代模型或研究流程值得大规模投入,集群就不会轻易按短期收入节奏收缩。SSI 拿到约 50 亿美元量级投资与 10× 算力、OpenAI 为自动化研究配置专人并公开 2026/2028 时间表,都是现实注脚。笔者的调研也提示,理想数据不足时,扩大规模通常仍能改善效果,后来者仍有机会缩小差距。
第二,竞争维度在切换。以前更多比预训练规模、后训练数据量和产品速度;现在「谁能更快把研发流程自动化」「谁能把单位算力转化成更高有效能力」的权重在上升。训练效率、运行编排层工程能力,以及高价值轨迹与评价能力,正在成为新的差异化来源。
第三,基础设施环节的客户结构在分化。除云厂商的推理需求外,与纯研究型或强研究导向实验室的深度绑定 —— 资金、优先硬件、早期研究洞察 —— 可能构成下一阶段更有辨识度的叙事。Vera Rubin 从 2026 年下半年放量,各实验室的实际采购与开支指引值得跟踪。
综合来看,RSI 正在从概念走向有负责人、有时间表、有资源的执行阶段。Ilya 与 Lilian 代表两条重心不同、可能互补的路径:一个偏研究方向与 scaling 的重新有效,一个偏外围系统的工程化。真正的约束目前更多落在高价值数据与评价质量上。合成数据改善了追赶条件,但还不足以说明复杂任务的数据闭环已经打通。对投资而言,这在一定程度上支持训练侧开支可能比主流叙事更有韧性,尤其是深度参与前沿训练需求的基础设施环节。
可以优先跟踪:OpenAI 下半年是否给出可观察的阶段性进展;SSI 是否释放技术信号;Rubin 部署与训练集群开支指引;以及轨迹质量、评价和 Harness 优化方面的公开进展。