《npj Robotics》:还在疯狂堆数据?北航、NTU联合提出PhyFilter,让机器人在有限数据下学会举一反三

机器之心
 来自北京

图片

智能的本质为「学习不确定性」,核心在于干扰观测、学习与利用。要让机器人在不确定环境下像生物一样「举一反三」,主流答案是把数据堆到大模型的量级。但真机数据的采集成本,让这条路在机器人领域几乎无法复制。

北京航空航天大学郭雷院士团队、北京航天控制仪器研究所王巍院士团队与新加坡南洋理工大学 MARS 团队在 Nature npj Robotics 提出 PhyFilter:把神经网络的学习误差看作一个可以被「滤掉」的低频信号,借助机器人自身的实时状态反馈与已知的物理微分结构,在线修正学习输出。

它是一个即插即用、与具体模型无关的轻量模块,滤波参数还能自动学习、无需手工整定。在四足机器人、无人机、空中作业机械臂与加速度感知四类系统上,仅在平地仿真中训练的策略可以直接跨越石板路、草地、沙地与碎石路,空中机械臂能在 5 m/s 风扰下完成厘米级抓放。

研究表明,物理滤波式的反馈机制,可以成为「堆数据」之外的另一条泛化路径。

论文:https://www.nature.com/articles/s44182-026-00114-y

DOI:10.1038/s44182-026-00114-y

Website:https://scoardyy.github.io/PhyFilter/

Code:https://github.com/JIAjindou/PhyFilter

背景:机器人的泛化,只能靠堆数据吗?

过去十年,大语言模型在海量语料、大规模网络与算力的加持下取得了惊人进展,也让 scaling data 成为通往通用智能的默认路径。但当智能需要落到物理实体上时,这条路径立刻遇到阻力:机器人训练所需的数据必须在物理世界中采集。

一条路是人工遥操作,然而要获得 LLM 量级(数千亿 token)的人类演示,在技术上困难、耗时且昂贵,即便是特斯拉这样的大规模工业化尝试,也仍然卡在采集吞吐与可扩展性上;另一条路是依靠仿真引擎(Isaac Lab、MuJoCo)与视频生成模型(Sora、Cosmos)合成数据,虽然在部分任务上确有收益,但仍受制于 sim-to-real 差距、高昂的计算开销,以及跨平台数据格式、软件与硬件接口缺乏标准化的问题。

研究团队把视角转向生物:生物强大的泛化能力并不只来自「规模化」。大量证据表明,先天或后天获得的物理结构本身就在促进生物对未见环境的适应 —— 皮层的运动响应由前馈信号、反馈回路与先验驱动共同支配,并动态演化以最小化全局能量函数;斑马鱼幼体则会把与生俱来的物理积分结构与实时状态反馈整合进不断更新的小脑内部模型,从而对不可预测的视觉扰动做出有效响应。

这引出了本文要回答的问题:与数字世界中的 LLM 不同,真实机器人本就拥有结构良好的物理先验和来自环境交互的实时反馈,能否把这些「现成的」物理结构利用起来,去改善机器人学习的泛化能力?

核心方法:

把「学习残差」当作可以被滤掉的信号

PhyFilter 的出发点是一个被以往工作忽视的量 —— 学习残差。

对于真实映射与学习得到的模型,二者之差即为学习残差,它来自未见场景中的传感噪声、外部扰动或未建模交互,正是泛化失效的根源。

直觉上,只要能实时知道学习残差,把模型输出进行修正即可;但部署阶段没有标签,学习残差无法直接瞬间获得。生物同样无法「瞬间理解|陌生环境,而是经历一个适应过程。

图 1 | PhyFilter 框架。a 学习输出经物理信息滤波器增强;b PhyFilter 的具体实现;c 四类代表性验证平台:四足运动、无人机飞行、空中作业机械臂与加速度感知。

受人类视觉与听觉感知系统中普遍存在的低通滤波特性启发,团队把目标写成一个高阶低通滤波形式。若滤波形式能实现,学习残差的低频特征就能被收敛地捕捉并及时补偿;低通滤波器的收敛过程,本身就可以被视为机器人在未见场景中的一次自适应。

真正的技术难点在于学习残差不可测。团队的做法是引入机器人自身的实时状态反馈与先验的微分方程结构,把原本需要高阶导数与学习残差的形式,等价重写为只依赖可测量信号的实现,从而彻底避开了对标称模型的直接高阶微分。

由此得到的 PhyFilter 具有几个关键特性:

其一,即插即用。与以往需要重新训练被改造网络的 physics-informed 方法不同,PhyFilter 是一个模型无关的轻量模块,可直接部署在已训练好的模型上;

其二,可退化、可扩展。在一阶滤波器设定下,该实现会退化为纯粹的反馈式扰动观测器,而高阶形式则能处理超出一阶情形的复杂残差;

其三,参数可自动学习。滤波参数原本要靠成熟但繁琐的极点配置手工整定,阶次一高就极不直观。团队把滤波参数重新解释为一个动力系统的控制输入,把整定问题转化为最优控制问题,再用 Lagrange 乘子法配合伴随法(反向模式微分)解析地计算梯度,配合 Adam、小批量与早停进行优化。实验显示,自动学到的参数与人工精心调出的参数基本一致。

计算开销方面,在无人机飞行与空中作业机械臂实验中,PhyFilter 在 STM32F765 微控制器上以 500 Hz 实时运行,证明其适用于资源受限的轻量平台。

评估:四类真实机器人系统

团队在四足运动、无人机机动飞行、空中作业机械臂与加速度感知四个代表性场景中验证了 PhyFilter,其中前者属于强化学习(RL),后三者属于监督学习(SL),覆盖了当前机器人学习的两条主流范式。

四足运动:只在平地仿真训练,直接跨越四种真实地形。

为了突出泛化能力,仿真训练环境只包含平地,且仅使用标准参数随机化。结果显示,在五个随机种子下,加入 PhyFilter 的策略最大训练回报一致高于基线,步态也更协调 —— 这说明一个鲁棒的底层控制器可以显著提升上层 RL 策略的训练效率。

泛化测试中,机器人被要求以训练集之外的 2.83 m/s 高速运动,并承受 15%~60% 机身重量(11.86 kg)的额外负载,最高超出训练上限 137.33%。在楼梯、水平粗糙路、坡面粗糙路、波浪地面与碎石路五类未见场景中,PhyFilter 的通过成功率分别为 70%、80%、50%、80%、40%,而基线为 0%、0%、10%、20%、0%,结合了自适应控制的 RL2AC 为 0%、20%、10%、50%、0%。

图 2 | 四足真机实验。策略仅在仿真平地训练、无任何部署后调参,直接测试石板路、草地、沙地与碎石路(左:基线,右:PhyFilter)。

真机部署同样不做任何调参。基线策略在沙地与碎石路上迅速失稳倾覆,而 PhyFilter 引导的策略在全部地形上稳定行走。一个更有意思的发现是:即使在部署时把修正项关闭,该策略依然能成功迁移到各类真实地形 —— 这说明 PhyFilter 塑造出的是一个本质上更优的策略,而不只是在运行时 "打补丁"。

无人机机动飞行:即插即用地补上泛化短板。

在监督学习场景中,团队把 PhyFilter 叠加在之前 SEER-I 之上。SEER-I 通过离线基函数学习结合在线自适应控制,能有效捕捉无人机的质量不确定性,但一旦引入风扰这类不同性质的未知扰动,其跟踪性能就明显退化。

在 2 m/s 圆轨迹跟踪任务中,加入 PhyFilter 后,平均绝对跟踪误差相比 SEER-I 降低 30.22%,相比基线降低 50.17%。进一步的不确定性估计对比显示,SEER-I 只能捕捉质量不确定性,而 PhyFilter 能同时辨识风致扰动与固有动力学不确定性。

图 3 | 无人机实验结果。训练阶段只考虑质量不确定性,测试阶段额外引入风扰。

空中作业机械臂:5 m/s 风扰下的厘米级抓放。

空中作业机械臂需要在强耦合动力学与外部扰动下实现高精度末端控制。团队设计了一项应急救援风格的取放任务:机械臂需从三脚架上精确取下药品并放入指定区域,最大允许跟踪误差仅 2.5 cm。实验中用一台 380 W 风扇制造最高 5 m/s 的风速,并额外引入 0.3 kg 的未建模负载。

结果显示,基线与 SEER-I 都因未见风扰与质量不确定性而抓取失败,只有 PhyFilter 完成了全部四个阶段,跟踪误差相比基线在均值与方差上分别改善了 23.99% 与 55.04%。

图 4 | 空中作业机械臂实验。a–c 基线、SEER-I 与 PhyFilter 的取放执行过程;e–f 三维跟踪性能与误差对比。

加速度感知:分布漂移下依然可靠的神经微分器。

对无人机这类缺乏高精度感知硬件的轻量平台,加速度估计尤为困难。团队用真实飞行数据训练一个两隐层神经网络,把历史速度映射为加速度,训练集速度为 0~2 m/s,测试集为 0~3 m/s。纯学习模型在测试集上出现明显的泛化失效,而引入运动学结构知识的 PhyFilter 精度最高,优于鲁棒微分器(RD)、跟踪微分器(TD)与离散微分器(DD)等经过精心调参的经典基线,并在 0.002~0.018 s 的采样间隔范围内保持一致优势。

图 5 | 加速度感知实验。e 滤波阶次与极点的消融,星号为自动学习得到的参数;g 不同采样间隔下的 RMSE 对比。

把四个案例放在一起看,结论相当清晰:为了弥合 sim-to-real 差距,现有主流范式依赖域随机化 —— 本质上是在众多随机环境中追求平均性能,用精度换鲁棒性,与经典鲁棒控制的思路相似。而 PhyFilter 不需要过度的域随机化,就能在同一个框架内统一泛化与精度:当机器人进入训练分布之外的场景时,PhyFilter 被激活以增强泛化;而在残差本就很小的熟悉工况中,干预会自适应地衰减,从而保留原有精度。这也意味着训练阶段可以省下大量为构造有效随机化参数而付出的工程调参成本。

提升空间与发展潜力

该工作存在三点局限,它们同时也是后续的研究方向。

其一,目前 PhyFilter 只增强学习的「输出」。更聪明的做法,是把滤波过程中获得的知识反过来用于精化原网络的参数或结构,持续学习(continual learning)可能是实现这一目标的可行路径。

其二,参数自动学习算法虽然可靠,但每一次迭代都需要一次完整的前向轨迹 rollout,这限制了它在大规模数据上的效率,截断式或并行化 rollout 是值得探索的改进方向。

其三,学习残差 中除了神经网络预测误差,还可能混合其他不确定性 —— 例如四足案例中的建模失配。如何把这些成分解耦开来(例如借助元学习),仍是开放问题。

总体而言,PhyFilter 提供了一个与 "数据规模化" 互补的思路:机器人不是缺少物理先验的图像生成器,它本来就拥有结构良好的动力学模型和源源不断的实时反馈。把这些既有的物理结构用起来,也许比无止境地扩充数据集更接近生物式泛化的本质。

主要作者信息

贾金豆(Project leader):新加坡南洋理工大学 MARS Lab 博士后,研究方向包括 VLA、WAM、PINN 等。在顶级 AI、机器人、控制期刊会议上以第一 / 共一作者发表多篇论文(IJRR、TRO、ICLR、RAL、CoRL、ICRA、RSS 等)。

主页:https://jiajindou.github.io/

郭克信(通讯作者):北京航空航天大学航空科学与工程学院教授,博士生导师,国家级青年人才,主要从事无人飞行器智能自主控制、多无人系统协同控制、卫星拒止下无人系统定位、空中灵巧操控等方向的理论与应用研究。在 IJRR、IEEE 汇刊 (包括 IEEE T-RO、T-Cyber、T-AES、T-IE、T-II、T-ASE、RA-L)、ICLR、ICRA、AIAA JGCD 等顶会和期刊发表多篇论文。

主页:https://shi.buaa.edu.cn/guokexin1

杨剑飞(通讯作者):新加坡南洋理工大学机械与宇航学院和电子与电气工程学院双聘助理教授,博士生导师,MARS Lab 负责人,主要研究方向为多模态人工智能与机器人。在顶级 AI 会议与期刊上发表多篇论文(IJRR, NeurIPS, ICLR, CVPR, CoRL, ICCV, ECCV, ACL, AAAI, MobiCom, IROS, IJCV, TIP, TNNLS, TMC, IOT-J, TCYBE、RSS 等)。

主页:https://marsyang.site/

图片

© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻