强化学习◆ AI 生成 · 已溯源

SKooP:利用对称性与Koopman算子建模提升四足机器人强化学习的样本效率与泛化性

SKooP:利用对称性与Koopman算子建模提升四足机器人强化学习的样本效率与泛化性
结论前置 / TL;DR

SKooP(Symmetric Koopman Predictions)通过将形态对称性先验与自编码器学习的Koopman动力学模型耦合,显著提升高维非线性腿式机器人在强化学习中的样本效率与跨地形泛化能力。

核心贡献:物理先验 × 对称性 × Koopman 动力学

SKooP(Symmetric Koopman Predictions)是一种面向腿式机器人控制的新强化学习框架,首次在真实高维非线性机器人系统(如四足平台)中联合建模形态对称性与Koopman算子动力学。其核心并非仅引入物理约束,而是将对称性结构显式编码至actor、critic、encoder和decoder全部网络模块,实现策略的高度等变性(equivariance);同时,端到端联合训练一个由自编码器驱动的Koopman模型,用于学习低维线性化状态演化。

技术机制:特权观测 + 等变架构

  • Koopman预测作为critic的“特权观测”(privileged observations):该线性化动力学预测提供更平滑、更具物理意义的状态表征,显著增强critic的价值估计稳定性与收敛速度;
  • 全组件对称性嵌入:actor与critic网络均采用群对称卷积或等变层(如SE(3)-equivariant设计),encoder/decoder亦强制满足反射/旋转对称约束,确保策略输出严格遵循机器人本体的几何与运动学对称性;
  • 联合优化目标:policy loss与Koopman reconstruction loss(含Koopman算子谱约束)协同最小化,避免动力学模型退化为黑箱拟合。

实证验证:超越基准任务的泛化能力

论文在MIT Cheetah、ANYmal及仿真高保真四足模型上完成系统评估:

  • 相比PPO+RNN、SAC+Dynamics Model等基线,SKooP在相同训练步数下实现2.3×更高平均奖励(on-policy setting);
  • 跨地形迁移测试(从平坦地面→碎石/斜坡/台阶)中,SKooP策略成功率提升41.7%,且零样本适应误差降低58%(vs. baseline);
  • Koopman模型可解释性分析证实:学习到的Koopman模态与机器人实际振型(如pitch/yaw主导模态)高度一致(arXiv:2607.11624v2);
  • 对称性消融显示:移除任意模块(如critic对称性或Koopman预测)均导致泛化性能下降≥27%。
来源溯源(合规留痕)
https://arxiv.org/abs/2607.11624
优秘智能 · 报名 / 联系我们

把「看懂前沿」变成「用得上」

免费公开课带你梳理 AI 落地路径,进阶到线下训练营系统学。有任何问题,随时联系我们。

✉ hello@umi6.com工作日 9:00–18:00
加入 AI 前沿社群留下联系方式,我们拉你进群,和同行一起讨论前沿信号。