这并非对若干孤立论文的简单汇总,而是季向阳课题组在通往 AGI 的道路上、贯穿多项成果的一条研究主线。我们的洞见指向一项历经数年发展而来的系统性成果,并通过条件式交互(conditional interaction)提供了一种新的扩展(scaling)视角。从奠定理论基础的 Nature Communications 工作,到在 ICML、KDD、ICLR 等机器学习会议上相继发表的一系列成果,我们提出的模型预测采样已逐步成长为一个横跨“具身决策—大模型后训练”的方法体系。
无论是训练一个大模型,还是训练一个能完成复杂任务的机器人,主要瓶颈往往不在算力本身,而在于“该选择哪些任务,或者如何聪明地引导交互——数据与模型之间、agent 与环境之间”。
这里的“交互”是贯穿全文的核心概念。在大模型中,把一段序列(sequence)输入模型、令其逐步产生下一个 token,本身就是模型与数据的一次交互;在强化学习中,对一个 prompt 反复采样以生成多条 rollout,是更密集的交互;在具身智能中,agent 在环境里执行动作并观察反馈,则是与物理世界的交互——这里的交互不只是与物理环境的互动,也包括对外部工具的调用(tool use / function calling)。每一种交互都有代价:大模型的一次前向或采样会消耗显存与算力,而 agent 的一次环境交互则要耗费时间、损耗硬件,有时还伴随安全风险。当训练规模扩大时,交互的总成本往往成为比单纯堆叠算力更现实的约束。
直觉上,人类学习从不是“均匀刷题”——我们会在弱项上多花时间,在已掌握的内容上少下功夫。然而当下主流的模型训练大多仍按“均匀采样”推进:每轮随机取一批任务、更新模型、循环往复。这导致简单样本被反复消耗算力,而尾部与分布外(OOD)的关键任务长期被欠采样。
进一步看,随着训练规模扩大,这一问题会集中表现为尖锐的交互瓶颈:要判断“该练哪道题”,通常得先评估每个任务有多难——而这种评估本身就是一次昂贵、甚至带风险的交互。这一痛点在两类正快速扩展(scaling)的场景中以不同形态出现,构成了 MPTS 系列工作的两条核心动机。
在推理大模型的强化学习微调(RLFT)中,每一步都要让模型针对一批 prompt 生成大量 rollout,再据此估计优势并更新策略。瓶颈在于:过易或过难的 prompt 几乎不产生有用的梯度信号,却照样占用推理算力。这意味着相当一部分算力被花在低信息量的 rollout 上,构成大模型后训练中一项容易被忽视的开销。而若想以“先评估、再筛选”来规避它,又不得不先把这些 rollout 跑一遍,从而陷入循环依赖。
痛点:低信息量 rollout 消耗算力对具身智能体而言,评估一个任务有多难,往往意味着真实地与环境交互一遍。但物理世界中的交互受制于硬约束:耗时、损耗硬件,还可能带来安全风险——例如机器人摔倒、机械臂碰撞、自动驾驶遭遇极端路况。在这类场景中,试错的代价不仅是时间与算力,还可能是难以恢复的物理后果。规模越大、任务越多,靠穷举式交互来排定难度就越不现实。
痛点:环境交互昂贵且有风险MPTS 系列工作正是针对这两类扩展(scaling)痛点:与其付出高昂代价去评估每个任务,不如训练一个轻量模型去预测评估结果,从而减少低信息量的 rollout 与高风险的环境试错。其背后,是一套以预测为核心的采样思路。
清华大学自动化系季向阳教授课题组给出的答案,是模型预测任务采样(Model Predictive Task Sampling, MPTS)。
MPTS 的核心洞见来自一个与神经科学的类比:人脑是节能的——它无需真正经历一件事,便能估计其难度,而是从过往经验中构建内部模型,在脑中“模拟”结果,再决定是否值得投入注意力。
MPTS 用生成式模型刻画学习的“分段优化过程”,并通过后验推断预测每个任务的适应风险(adaptation risk)——即该任务对当前模型有多难。这一轻量的“风险预测模型(RPM)”在线更新,摊销了逐个评估任务的高昂代价,并在理论上可近似真实的任务难度排序。
值得强调的是,MPTS 提供的是一个可预测的难度信号,而非固定的采样策略——“选取哪一档难度”完全交由上层的优先采样准则决定,因而能即插即用地服务于多种目标。在追求鲁棒性的场景中,可接入风险敏感的鲁棒优化准则(如 CVaR),使采样偏向高风险的尾部任务;在追求加速的场景中,可接入课程学习式的准则,按“中等难度优先”组织 prompt——过易或过难的 prompt 几乎不产生有用梯度,而成功率居中的题目信息量最大。同一个预测内核,配以不同的获取准则,便能分别服务于“更鲁棒”与“更快”这两个不同目标。
整个框架可无缝支持零样本(zero-shot)、少样本(few-shot)以及快速微调等多种设定,同样适用于基础模型的预训练与元学习,以及机器人策略的领域随机化(domain randomization)与元强化学习。
实验结果表明,MPTS 在大模型微调与具身 / 序贯决策任务上均优于已有方法:对高风险尾部任务与 OOD 任务的适应鲁棒性有所提升,学习效率也有所改善——用更少的样本与交互,达到相当或更好的泛化。
贝叶斯脑的研究根脉很深,处在机器学习、实验心理学与贝叶斯统计的交汇处。早在 19 世纪 60 年代,赫尔曼·亥姆霍兹(Hermann Helmholtz)在实验心理学中的工作,便以概率估计的方式刻画了大脑从感觉数据中提取知觉信息的能力。其基本思想至今仍是整条线索的内核:神经系统需要把纷杂的感觉数据组织成对外部世界的近似内部模型,并据此指导高效而鲁棒的决策。
进入 20 世纪 90 年代,Geoffrey Hinton 与 Karl Friston 等研究者开始把自由能(free energy)引入这一图景——将其作为一个可计算的度量,用以衡量世界的真实特征与神经网络模型所捕获的特征表征之间的差异。Friston 此后给出的综合,把贝叶斯脑的运作机理统一到自由能最小化这一一般原理之下:在形式上,行动与感知都被视为抑制自由能的结果,从而分别导向感知推断与主动推断(active inference),并把贝叶斯脑推向一种更具身、更行为化的理解。借助变分贝叶斯(variational Bayes),可以刻画大脑如何利用感觉信息持续更新其对世界的内部模型,以最小化感觉输入与其预测之间的差异——从神经生物学的角度看,这可被理解为预测编码(predictive coding),或更一般地说,贝叶斯滤波。
正是受贝叶斯脑这一思想的启发,本工作把“生成式建模、仿真预测、主动选择”的框架应用于大模型微调与具身智能体的自适应强化学习,提出了 MPTS。它有两点主要贡献:其一,表明学习过程中的优化进程可以通过生成式建模进行粗粒度预测——任务难度不必只在事后昂贵地度量,也可以被提前估计;其二,提供了一种即插即用、对样本自适应的鲁棒性增强方式,缓解了显存与算力等效率瓶颈,并在部分场景中带来训练加速。
把这段思想史落到机器学习的训练循环中,会发现当下主流做法恰恰是“非贝叶斯”的。均匀采样是一种纯粹被动的姿态:系统对“哪些经验更有价值”不持任何信念,每轮只在随机一批上更新——结果是已掌握的简单样本被反复消耗算力,而尾部与分布外的关键任务长期被欠采样。优先采样方向虽对,却落入另一个陷阱:要排定难度,就得先评估每个任务。这相当于“为了决定该看哪里,先把每个地方都仔细看一遍”,与大脑的节能原则背道而驰。
MPTS 可以理解为把亥姆霍兹—Friston 这条线索落到工程实现:让学习循环本身带有主动推断的意味。它的四个环节大致对应贝叶斯脑的相关概念——
用一个轻量生成模型刻画“任务空间上的适应风险分布”,不仅给出点估计,还量化不确定性。
风险预测模型把逐任务评估的代价摊销掉,直接通过后验推断预测难度,无需逐个试错。
“选取哪一批任务来学习”成为一个主动决策,目标是最小化期望适应风险、逼近鲁棒目标 CVaR。
真实风险信号回流,通过流式变分推断更新模型信念——这是“用预测误差修正生成模型”的机器学习版本。
MPTS 的意义不止于单一方法,更在于它对应着一个相当通用的问题:在迭代优化过程中,如何高效地选出“值得交互、值得学习”的样本? 由于这一问题相当普适,围绕它展开的工作并非彼此孤立,而是共享同一个理论内核、在不同领域分别落地。横跨两大领域,季向阳课题组已在 Nature Communications、T-PAMI、ICML、KDD、ICLR 等顶级期刊与会议上相继发表了相关成果。
领域一:具身智能体在随机化环境中的鲁棒快速适应。 该领域以发表于 Nature Communications 的 MPTS 为理论基础,把后验预测、批次多样性以及对抗式显式任务分布生成引入序贯决策,使智能体在物理交互昂贵且有风险的前提下,依然能稳健而快速地适应新环境。
领域二:让推理大模型的强化学习后训练与监督微调更高效。 该领域把“以预测代替评估”的思想引入 RLVR 与 SFT 全流程,用轻量预测模型在线估计 prompt 难度,省下大量无信息量的 rollout。其代表是 MoPPS——最早实现 RLVR 训练加速的预测式采样算法之一。
把两大领域与作为理论基础的期刊工作放在一起看,会浮现出一个相当清晰的结构:底层是统一的模型预测采样原理,共同内核是“以预测代替昂贵评估”,其上分出两支——具身决策中的鲁棒适应与推理大模型的高效后训练——由同一思想串联,从环境交互到 prompt 交互、从鲁棒到加速。这种以一个原理统摄多种场景的组织方式,使这些工作更像一个连贯的体系,而非彼此独立的尝试。
这条研究主线的影响已不限于课题组自身的论文。在学界,该系列工作获得了图灵奖得主 Yann LeCun 与 Yoshua Bengio 的积极评价,并被数十位 ACM / IEEE Fellow 在各自研究中引用——对一项聚焦于“如何主动感知实现高智力密度交互”的方法而言,这样的关注度值得一提。
在产业界,相关方法也获得了一定采用。其中的 MoPPS 作为最早实现 RLVR 训练加速的预测式采样算法之一,已被 Meta、Apple、阿里千问(Qwen)、阿里 Roll、腾讯混元等团队采用为基线之一。一个来自学界的采样算法被纳入企业的训练流程,说明这一思路在工程实践中具备可用性。
随着大模型训练成本上升、推理模型 RL 微调对算力的消耗增大,“该选择哪些任务或交互场景”的价值也随之提高。
MPTS 及其系列工作提供的,并非针对单一场景的技巧,而是一套有理论支撑、可跨场景迁移的主动采样思路:以轻量预测模型代替昂贵评估,通过后验推断量化不确定性,再以可配置的获取准则(鲁棒场景偏向高风险尾部、RLVR 加速场景偏向中等难度)逼近预设的自适应优化目标。同一内核能在具身决策与大模型后训练之间通用,正反映出它瞄准的是这些问题的共性部分。
这对两类应用都成立——无论是微调 DeepSeek / Qwen 这样的推理模型,还是在仿真或真实环境中训练机器人的操作策略,核心问题结构都相近:评估代价高,而难度信息又不可或缺。
从更一般的角度看,随着训练成本受到更多关注,让系统对“哪些经验更值得计算”持有可更新的判断,并据此主动选择与什么交互,是一条值得持续探索的方向。这也与贝叶斯脑的基本思想一致:以预测代替穷举,以观测修正信念——可以把学习过程本身理解为一种主动推断。这一思路可追溯到亥姆霍兹关于“知觉即概率推断”的设想。
本文涉及的季向阳教授课题组成果一览(按理论基础、具身决策、大模型后训练分组)。
本文内容基于公开论文及项目主页整理。文中涉及的学界评价与产业界采用情况,请以课题组可提供的原始凭据为准。
本工作感谢课题组成员——主要包括 Cheems Wang、Yun Qu、Yixiu Mao、Heming Zou、Lizhou Cai 与 Yuhang Jiang——在过去两年里、于通往 AGI 的道路上,在计算和样本高效的通用人工智能技术探索中所作的贡献。