研究速递 2026 年 6 月
大模型 · 具身智能 · 高效训练

让大模型和机器人“聪明地交互”——清华大学季向阳团队的系统性研究探索

训练大模型与具身智能体时,主要成本往往不在原始算力,而在 prompt 与模型之间、agent 与环境之间的交互。如何更高效地组织这些交互,已成为当前备受关注的问题。季向阳教授课题组从贝叶斯脑的视角出发,沿一条统一主线提出了构建于预测采样之上的主动认知(active-cognition)框架,并在大模型与具身智能体等多种场景中加以验证。
清华大学自动化系 季向阳教授课题组

这并非对若干孤立论文的简单汇总,而是季向阳课题组在通往 AGI 的道路上、贯穿多项成果的一条研究主线。我们的洞见指向一项历经数年发展而来的系统性成果,并通过条件式交互(conditional interaction)提供了一种新的扩展(scaling)视角。从奠定理论基础的 Nature Communications 工作,到在 ICML、KDD、ICLR 等机器学习会议上相继发表的一系列成果,我们提出的模型预测采样已逐步成长为一个横跨“具身决策—大模型后训练”的方法体系。

无论是训练一个大模型,还是训练一个能完成复杂任务的机器人,主要瓶颈往往不在算力本身,而在于“该选择哪些任务,或者如何聪明地引导交互——数据与模型之间、agent 与环境之间”。

这里的“交互”是贯穿全文的核心概念。在大模型中,把一段序列(sequence)输入模型、令其逐步产生下一个 token,本身就是模型与数据的一次交互;在强化学习中,对一个 prompt 反复采样以生成多条 rollout,是更密集的交互;在具身智能中,agent 在环境里执行动作并观察反馈,则是与物理世界的交互——这里的交互不只是与物理环境的互动,也包括对外部工具的调用(tool use / function calling)。每一种交互都有代价:大模型的一次前向或采样会消耗显存与算力,而 agent 的一次环境交互则要耗费时间、损耗硬件,有时还伴随安全风险。当训练规模扩大时,交互的总成本往往成为比单纯堆叠算力更现实的约束。

大模型:下一个 token → 输入一段序列, 输出下一个 token 代价:算力 + 显存 强化学习:rollout prompt 采样多条 rollout 代价:大量前向计算 agent ⇄ 环境 Agent 环境 行动 → 观测 → 重复 代价:耗时、损耗、风险
训练中的三类“交互”,以及各自的代价。

直觉上,人类学习从不是“均匀刷题”——我们会在弱项上多花时间,在已掌握的内容上少下功夫。然而当下主流的模型训练大多仍按“均匀采样”推进:每轮随机取一批任务、更新模型、循环往复。这导致简单样本被反复消耗算力,而尾部与分布外(OOD)的关键任务长期被欠采样。

进一步看,随着训练规模扩大,这一问题会集中表现为尖锐的交互瓶颈:要判断“该练哪道题”,通常得先评估每个任务有多难——而这种评估本身就是一次昂贵、甚至带风险的交互。这一痛点在两类正快速扩展(scaling)的场景中以不同形态出现,构成了 MPTS 系列工作的两条核心动机。

01 大模型微调 / 强化学习微调LLM Fine-tuning & RL Fine-tuning

在推理大模型的强化学习微调(RLFT)中,每一步都要让模型针对一批 prompt 生成大量 rollout,再据此估计优势并更新策略。瓶颈在于:过易或过难的 prompt 几乎不产生有用的梯度信号,却照样占用推理算力。这意味着相当一部分算力被花在低信息量的 rollout 上,构成大模型后训练中一项容易被忽视的开销。而若想以“先评估、再筛选”来规避它,又不得不先把这些 rollout 跑一遍,从而陷入循环依赖。

痛点:低信息量 rollout 消耗算力
02 具身智能体的自适应强化学习Adaptive RL for Embodied Agents

对具身智能体而言,评估一个任务有多难,往往意味着真实地与环境交互一遍。但物理世界中的交互受制于硬约束:耗时、损耗硬件,还可能带来安全风险——例如机器人摔倒、机械臂碰撞、自动驾驶遭遇极端路况。在这类场景中,试错的代价不仅是时间与算力,还可能是难以恢复的物理后果。规模越大、任务越多,靠穷举式交互来排定难度就越不现实。

痛点:环境交互昂贵且有风险
两条主线指向同一个矛盾:评估任务难度的代价,在大模型场景表现为可观的算力开销,在具身场景表现为昂贵且有风险的物理交互。评估成本越高、规模越大,这一瓶颈就越突出。

MPTS 系列工作正是针对这两类扩展(scaling)痛点:与其付出高昂代价去评估每个任务,不如训练一个轻量模型去预测评估结果,从而减少低信息量的 rollout 与高风险的环境试错。其背后,是一套以预测为核心的采样思路。

MPTS:用“预测”代替“评估”

清华大学自动化系季向阳教授课题组给出的答案,是模型预测任务采样(Model Predictive Task Sampling, MPTS)。

将模型预测任务采样作为预评估模块嵌入自适应学习流程
将模型预测任务采样作为预评估模块(Pre-evaluation Module)嵌入自适应学习流程。

MPTS 的核心洞见来自一个与神经科学的类比:人脑是节能的——它无需真正经历一件事,便能估计其难度,而是从过往经验中构建内部模型,在脑中“模拟”结果,再决定是否值得投入注意力。

MPTS 用生成式模型刻画学习的“分段优化过程”,并通过后验推断预测每个任务的适应风险(adaptation risk)——即该任务对当前模型有多难。这一轻量的“风险预测模型(RPM)”在线更新,摊销了逐个评估任务的高昂代价,并在理论上可近似真实的任务难度排序。

模型预测任务采样实现条件式交互:在线预测信息量最大的任务子集
模型预测任务采样实现条件式交互:在线预测信息量最大的任务子集,用于查询与优化。
候选任务集合
→
RPM 预测难度
→
按采样准则选取
→
更新学习器
→
在线更新 RPM
基线 — 评估 任务 完整评估 逐个任务跑一遍 难度排序 高成本 MPTS — 预测 任务 RPM 轻量模型 预测排序 低成本
同样得到难度排序,成本却相差悬殊:逐个评估每个任务,还是用轻量模型预测结果。

值得强调的是,MPTS 提供的是一个可预测的难度信号,而非固定的采样策略——“选取哪一档难度”完全交由上层的优先采样准则决定,因而能即插即用地服务于多种目标。在追求鲁棒性的场景中,可接入风险敏感的鲁棒优化准则(如 CVaR),使采样偏向高风险的尾部任务;在追求加速的场景中,可接入课程学习式的准则,按“中等难度优先”组织 prompt——过易或过难的 prompt 几乎不产生有用梯度,而成功率居中的题目信息量最大。同一个预测内核,配以不同的获取准则,便能分别服务于“更鲁棒”与“更快”这两个不同目标。

整个框架可无缝支持零样本(zero-shot)、少样本(few-shot)以及快速微调等多种设定,同样适用于基础模型的预训练与元学习,以及机器人策略的领域随机化(domain randomization)与元强化学习。

实验结果表明,MPTS 在大模型微调与具身 / 序贯决策任务上均优于已有方法:对高风险尾部任务与 OOD 任务的适应鲁棒性有所提升,学习效率也有所改善——用更少的样本与交互,达到相当或更好的泛化。

“MPTS 的思路:与其付出代价去评估每个任务,不如训练一个模型来预测评估结果。”
理论溯源 · 从亥姆霍兹到 MPTS

贝叶斯脑:一条跨越一个半世纪的思想线索

MPTS 的思想有迹可循。它把一条贯穿实验心理学、贝叶斯统计与机器学习的线索,落到了大模型与具身智能体的训练循环之中。

贝叶斯脑的研究根脉很深,处在机器学习、实验心理学与贝叶斯统计的交汇处。早在 19 世纪 60 年代,赫尔曼·亥姆霍兹(Hermann Helmholtz)在实验心理学中的工作,便以概率估计的方式刻画了大脑从感觉数据中提取知觉信息的能力。其基本思想至今仍是整条线索的内核:神经系统需要把纷杂的感觉数据组织成对外部世界的近似内部模型,并据此指导高效而鲁棒的决策。

19 世纪 60 年代 · 亥姆霍兹
知觉即无意识的概率推断
大脑从感觉数据中提取信息,本质上是概率估计——把知觉组织成对外部世界的近似内部模型。
20 世纪 90 年代 · Hinton 与 Friston
自由能:一种可计算的差异度量
引入自由能,用以度量世界的真实特征与神经网络模型所捕获表征之间的差异。
Friston 的综合
感知与行动皆在最小化自由能
行动与感知都被视为抑制自由能的结果,分别导向感知推断与主动推断;变分贝叶斯方法刻画了预测编码与贝叶斯滤波的机理。
本工作 · MPTS
生成式建模 + 仿真预测 + 主动选择
将该框架落地于大模型微调与具身智能体的自适应强化学习,提出模型预测任务采样。

进入 20 世纪 90 年代,Geoffrey Hinton 与 Karl Friston 等研究者开始把自由能(free energy)引入这一图景——将其作为一个可计算的度量,用以衡量世界的真实特征与神经网络模型所捕获的特征表征之间的差异。Friston 此后给出的综合,把贝叶斯脑的运作机理统一到自由能最小化这一一般原理之下:在形式上,行动与感知都被视为抑制自由能的结果,从而分别导向感知推断与主动推断(active inference),并把贝叶斯脑推向一种更具身、更行为化的理解。借助变分贝叶斯(variational Bayes),可以刻画大脑如何利用感觉信息持续更新其对世界的内部模型,以最小化感觉输入与其预测之间的差异——从神经生物学的角度看,这可被理解为预测编码(predictive coding),或更一般地说,贝叶斯滤波。

正是受贝叶斯脑这一思想的启发,本工作把“生成式建模、仿真预测、主动选择”的框架应用于大模型微调与具身智能体的自适应强化学习,提出了 MPTS。它有两点主要贡献:其一,表明学习过程中的优化进程可以通过生成式建模进行粗粒度预测——任务难度不必只在事后昂贵地度量,也可以被提前估计;其二,提供了一种即插即用、对样本自适应的鲁棒性增强方式,缓解了显存与算力等效率瓶颈,并在部分场景中带来训练加速。

研究意义:为基础模型的预训练、元训练与主动微调提供了效率优化路径,也为面向现实鲁棒性的部署与训练加速提供了指导。

范式:从“评估世界”到“预测世界”

把这段思想史落到机器学习的训练循环中,会发现当下主流做法恰恰是“非贝叶斯”的。均匀采样是一种纯粹被动的姿态:系统对“哪些经验更有价值”不持任何信念,每轮只在随机一批上更新——结果是已掌握的简单样本被反复消耗算力,而尾部与分布外的关键任务长期被欠采样。优先采样方向虽对,却落入另一个陷阱:要排定难度,就得先评估每个任务。这相当于“为了决定该看哪里,先把每个地方都仔细看一遍”,与大脑的节能原则背道而驰。

MPTS 可以理解为把亥姆霍兹—Friston 这条线索落到工程实现:让学习循环本身带有主动推断的意味。它的四个环节大致对应贝叶斯脑的相关概念——

内部生成模型→生成式信念

对学习过程持有信念

用一个轻量生成模型刻画“任务空间上的适应风险分布”,不仅给出点估计,还量化不确定性。

预测编码→摊销推断

以预测代替昂贵评估

风险预测模型把逐任务评估的代价摊销掉,直接通过后验推断预测难度,无需逐个试错。

主动推断→采样即行动

由推断驱动的选择

“选取哪一批任务来学习”成为一个主动决策,目标是最小化期望适应风险、逼近鲁棒目标 CVaR。

自由能最小化→误差驱动更新

闭环在此闭合

真实风险信号回流,通过流式变分推断更新模型信念——这是“用预测误差修正生成模型”的机器学习版本。

风险预测模型作为世界模型,引导条件式交互
风险预测模型作为世界模型,引导条件式交互。本图在主动推断理论框架下解释模型预测任务采样。[图片来源:本团队 Nature Communications 论文]

体系化成果:一条主线,两大领域的突破

MPTS 的意义不止于单一方法,更在于它对应着一个相当通用的问题:在迭代优化过程中,如何高效地选出“值得交互、值得学习”的样本? 由于这一问题相当普适,围绕它展开的工作并非彼此孤立,而是共享同一个理论内核、在不同领域分别落地。横跨两大领域,季向阳课题组已在 Nature Communications、T-PAMI、ICML、KDD、ICLR 等顶级期刊与会议上相继发表了相关成果。

模型预测采样 预测,而非评估 领域一 · 鲁棒快速适应 随机化环境中的具身智能体 领域二 · 高效后训练 推理大模型的 RL 后训练 / SFT Nature Communications ICML-25 KDD-25 KDD-26 ICLR-26 ICML-26 ICML-26 同一条原理——“以预测代替昂贵评估”——分叉为两大领域。
整条工作如一棵树:根部是统一原理,两大领域是分支,各篇论文是叶子。

领域一:具身智能体在随机化环境中的鲁棒快速适应。 该领域以发表于 Nature Communications 的 MPTS 为理论基础,把后验预测、批次多样性以及对抗式显式任务分布生成引入序贯决策,使智能体在物理交互昂贵且有风险的前提下,依然能稳健而快速地适应新环境。

Nature Communications
Model Predictive Task Sampling for Efficient and Robust Adaptation
MPTS:模型预测任务采样,奠定该领域的理论基础
ICML-25
Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments
后验 + 多样性协同的任务采样 → 随机化环境中的自适应决策者
KDD-25
Robust Fast Adaptation from Adversarially Explicit Task Distribution Generation
对抗式显式任务分布生成 → 鲁棒快速适应

领域二:让推理大模型的强化学习后训练与监督微调更高效。 该领域把“以预测代替评估”的思想引入 RLVR 与 SFT 全流程,用轻量预测模型在线估计 prompt 难度,省下大量无信息量的 rollout。其代表是 MoPPS——最早实现 RLVR 训练加速的预测式采样算法之一。

KDD-26
Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models?
即 MoPPS:在线预测 prompt 难度 → 加速推理模型的 RL 微调
ICLR-26
Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models
动力学预测采样 → 大推理模型的主动强化学习微调
ICML-26
Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models
小型可泛化的 prompt 预测模型引导大推理模型的高效后训练
ICML-26
Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning
效用-多样性感知的在线批次选择 → 大模型监督微调

把两大领域与作为理论基础的期刊工作放在一起看,会浮现出一个相当清晰的结构:底层是统一的模型预测采样原理,共同内核是“以预测代替昂贵评估”,其上分出两支——具身决策中的鲁棒适应与推理大模型的高效后训练——由同一思想串联,从环境交互到 prompt 交互、从鲁棒到加速。这种以一个原理统摄多种场景的组织方式,使这些工作更像一个连贯的体系,而非彼此独立的尝试。

来自学界与产业界的关注

这条研究主线的影响已不限于课题组自身的论文。在学界,该系列工作获得了图灵奖得主 Yann LeCun 与 Yoshua Bengio 的积极评价,并被数十位 ACM / IEEE Fellow 在各自研究中引用——对一项聚焦于“如何主动感知实现高智力密度交互”的方法而言,这样的关注度值得一提。

在产业界,相关方法也获得了一定采用。其中的 MoPPS 作为最早实现 RLVR 训练加速的预测式采样算法之一,已被 Meta、Apple、阿里千问(Qwen)、阿里 Roll、腾讯混元等团队采用为基线之一。一个来自学界的采样算法被纳入企业的训练流程,说明这一思路在工程实践中具备可用性。

意义:训练效率正变得越来越重要

随着大模型训练成本上升、推理模型 RL 微调对算力的消耗增大,“该选择哪些任务或交互场景”的价值也随之提高。

MPTS 及其系列工作提供的,并非针对单一场景的技巧,而是一套有理论支撑、可跨场景迁移的主动采样思路:以轻量预测模型代替昂贵评估,通过后验推断量化不确定性,再以可配置的获取准则(鲁棒场景偏向高风险尾部、RLVR 加速场景偏向中等难度)逼近预设的自适应优化目标。同一内核能在具身决策与大模型后训练之间通用,正反映出它瞄准的是这些问题的共性部分。

这对两类应用都成立——无论是微调 DeepSeek / Qwen 这样的推理模型,还是在仿真或真实环境中训练机器人的操作策略,核心问题结构都相近:评估代价高,而难度信息又不可或缺。

从更一般的角度看,随着训练成本受到更多关注,让系统对“哪些经验更值得计算”持有可更新的判断,并据此主动选择与什么交互,是一条值得持续探索的方向。这也与贝叶斯脑的基本思想一致:以预测代替穷举,以观测修正信念——可以把学习过程本身理解为一种主动推断。这一思路可追溯到亥姆霍兹关于“知觉即概率推断”的设想。

大模型训练 RL 微调 具身智能 主动学习 贝叶斯脑 主动推断 自由能原理 课程学习 数据选择 推理模型 领域随机化 清华大学 Nature Communications

课题组相关成果

本文涉及的季向阳教授课题组成果一览(按理论基础、具身决策、大模型后训练分组)。

  1. Nature Communications Model Predictive Task Sampling for Efficient and Robust Adaptation. 模型预测任务采样的理论基础工作(发表于 Nature Communications;nature.com/articles/s41467-026-74004-0)。
  2. ICML-25 Fast and Robust: Task Sampling with Posterior and Diversity Synergies for Adaptive Decision-Makers in Randomized Environments. 后验与多样性协同的任务采样,面向随机化环境中的自适应决策者。
  3. KDD-25 Robust Fast Adaptation from Adversarially Explicit Task Distribution Generation. 基于对抗式显式任务分布生成的鲁棒快速适应。
  4. KDD-26 Can Prompt Difficulty be Online Predicted for Accelerating RL Finetuning of Reasoning Models? 即 MoPPS:在线预测 prompt 难度以加速推理模型的 RL 微调(arXiv:2507.04632)。
  5. ICLR-26 Dynamics-Predictive Sampling for Active RL Finetuning of Large Reasoning Models. 动力学预测采样,用于大推理模型的主动强化学习微调。
  6. ICML-26 Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models. 小型可泛化的 prompt 预测模型引导大推理模型的高效后训练。
  7. ICML-26 Utility-Diversity Aware Online Batch Selection for LLM Supervised Fine-tuning. 效用-多样性感知的在线批次选择,用于大模型监督微调。
  8. arXiv RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning. 面向大模型推理的分组优先离策略优化,剔除无效样本以提升 RLVR 效率。
  9. arXiv Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex. 列表式策略优化:把分组 RLVR 视作大模型响应单纯形上的目标投影。
  10. arXiv TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning. 面向高效智能体强化学习的统一 rollout 预算分配框架(arXiv:2606.11119)。
  11. NeurIPS-25 FlyLoRA: Boosting Task Decoupling and Parameter Efficiency via Implicit Rank-Wise Mixture-of-Experts. 通过隐式按秩混合专家提升任务解耦与参数效率的高效微调方法。

本文内容基于公开论文及项目主页整理。文中涉及的学界评价与产业界采用情况,请以课题组可提供的原始凭据为准。

致谢

本工作感谢课题组成员——主要包括 Cheems Wang、Yun Qu、Yixiu Mao、Heming Zou、Lizhou Cai 与 Yuhang Jiang——在过去两年里、于通往 AGI 的道路上,在计算和样本高效的通用人工智能技术探索中所作的贡献。