浙江大学学报(工学版), 2026, 60(9): 1862-1871 doi: 10.3785/j.issn.1008-973X.2026.09.003

机械工程

融合几何约束特征提取与多奖励协同优化的仿生步态控制

连远锋,, 范树玉, 张本哲, 王森

1. 中国石油大学(北京) 人工智能学院,北京 102249

2. 中国石油大学(北京) 石油数据挖掘北京市重点实验室,北京 102249

Bio-inspired gait control integrating geometric constraint feature extraction and multi-reward cooperative optimization

LIAN Yuanfeng,, FAN Shuyu, ZHANG Benzhe, WANG Sen

1. College of Artificial Intelligence, China University of Petroleum, Beijing 102249, China

2. Beijing Key Laboratory of Petroleum Data Mining, China University of Petroleum, Beijing 102249, China

收稿日期: 2025-08-14  

Received: 2025-08-14  

作者简介 About authors

连远锋(1977—),男,教授,从事图像处理、虚拟现实、机器视觉、数字孪生、深度学习、具身智能和油气多模态大模型研究.orcid.org/0000-0002-1801-2507.E-mail:lianyuanfeng@cup.edu.cn , E-mail:lianyuanfeng@cup.edu.cn

摘要

针对四足机器人在复杂地形中运动稳定性与环境适应性不足的问题,提出融合几何约束特征提取与多奖励协同优化的仿生步态控制方法. 构建基于动态时间规整(DTW)与卷积处理的仿生步态编码器模块,通过逆运动学解算、关节速度微分计算来提取时空关联的步态特征. 结合微分运动学驱动的几何约束机制,将任务空间轨迹与关节力矩的耦合映射嵌入近端策略优化(PPO)网络来提升关节运动协调性与采样效率.设计融合能效因子与李雅普诺夫稳定性的分层奖励函数,通过指数型能效奖励和稳定性奖励实现仿生步态的多目标协同控制. 实验结果表明,所提方法在仿真环境中的碰撞平均值、适应性损失等优于对比算法,且有效改善了关节触地现象. 在真机复杂地形部署测试中,该方法有效提升了四足机器人的运动稳定性与环境适应性.

关键词: 步态特征提取 ; 几何约束 ; 分层奖励机制 ; 深度强化学习 ; 近端策略优化

Abstract

A new bio-inspired gait control method was proposed to address the challenges of insufficient locomotion stability and environmental adaptability of quadruped robots in complex terrains. A bio-inspired gait encoder module based on dynamic time warping (DTW) and convolutional processing was constructed to extract spatiotemporally correlated gait features through inverse kinematics solution and joint velocity differentiation calculation. A geometric constraint mechanism driven by differential kinematics was incorporated, and the coupled mapping between task-space trajectories and joint torques was embedded into the proximal policy optimization (PPO) network to enhance the joint motion coordination and the sampling efficiency. A hierarchical reward function combining energy efficiency factors and the Lyapunov stability was designed, the and multi-objective collaborative control of bio-inspired gaits was achieved via exponential energy efficiency rewards and stability rewards. The experimental results demonstrated that the proposed method outperformed the comparative algorithms in terms of indicators such as average collision value and adaptive loss function in the simulation environment, and effectively mitigated the joint ground contact phenomenon. This method significantly enhanced the motion stability and the environmental adaptability of the quadruped robot in the deployment test of the real robot in complex terrains.

Keywords: gait feature extraction ; geometric constraint ; hierarchical reward mechanism ; deep reinforcement learning ; proximal policy optimization

PDF (4099KB) 元数据 多维度评价 相关文章 导出 EndNote| Ris| Bibtex  收藏本文

本文引用格式

连远锋, 范树玉, 张本哲, 王森. 融合几何约束特征提取与多奖励协同优化的仿生步态控制. 浙江大学学报(工学版)[J], 2026, 60(9): 1862-1871 doi:10.3785/j.issn.1008-973X.2026.09.003

LIAN Yuanfeng, FAN Shuyu, ZHANG Benzhe, WANG Sen. Bio-inspired gait control integrating geometric constraint feature extraction and multi-reward cooperative optimization. Journal of Zhejiang University(Engineering Science)[J], 2026, 60(9): 1862-1871 doi:10.3785/j.issn.1008-973X.2026.09.003

四足机器人在野外搜救、特种作业及军事侦察等领域展现出广泛的应用前景[1]. 相较于其他机器人在地形适应性等方面的局限性[2-4],四足机器人通过优化腿部运动学构型与驱动系统,其负载能力、运动灵活性及环境适应性得到了显著提升. 然而,在崎岖地形等复杂环境中,四足机器人仍然存在运动稳定性差与适应性不足的问题[5]. 因此,四足机器人步态控制方法的研究具有重要意义. 经典机器人控制算法,如中央模式发生器(central pattern generator, CPG)[6]、模型预测控制(model predictive control, MPC)[7-8]等,利用人为调制的节律信号或依赖于预先建立的模型和优化算法,实现四足机器人的稳定行走. 但是这些方法中的控制器性能依赖专业知识,易受环境影响,须频繁手动调整参数,且无法实现仿生意义上的参考轨迹,限制了四足机器人在复杂环境下的应用和推广[9-10].

深度强化学习(deep reinforcement learning, DRL)[11]通过融合深度学习的表征能力与强化学习的序列决策机制,在复杂环境建模与智能决策领域取得了较大进展[12-16],在四足机器人步态研究中也得到了广泛应用[17-18]. Haarnoja等[19]利用改进的软演员-批评家(soft actor-critic, SAC)算法在Minitaur四足机器人上进行训练,实现了多种运动步态的控制. Fuchioka[20]提出OPT-Mimic框架,通过轨迹优化生成动态行为参考轨迹,实现了四足机器人高动态行为的仿真到实物迁移. Iscen等[21]提出策略调整轨迹生成器(policies modulating trajectory generator, PMTG)架构,由轨迹生成器提供先验知识,结合强化学习与课程学习方法进行轨迹调整,实现了四足机器人的鲁棒性行走. Schulman等[22]提出近端策略优化(proximal policy optimization, PPO)算法,通过剪切目标函数,限制策略更新幅度,并结合策略梯度和信任区域优化策略,适用于离散和连续动作空间的复杂任务. Rudin等[23]在PPO算法的基础上提出legged_gym控制框架,用于四足机器人在复杂地形中的自适应步态生成与全身平衡控制. Margolis等[24]提出walk-these-ways框架,实现了四足机器人在多样化环境中运动性能的提升. 尽管上述方法能够提高四足机器人的地形适应性与运动稳定性,但是仍然存在目标收敛不可控[25]和多目标优化冲突[26]等问题. 如何有效整合物理约束与任务目标,已成为提升机器人运动稳定性的关键[27].

步态识别作为生物特征识别的重要分支,从早期的视频图像处理逐步迈向由深度学习驱动的智能化阶段[28-29]. 随着深度学习技术的发展,基于卷积神经网络(CNN)[30]的模型在步态识别领域得到了广泛应用. Lal等[31]提出优化的轻量级自定义二维卷积神经网络模型,在4类步态模式分类任务中取得了较高的准确率,但是模型对步态速度变化的鲁棒性仍须改进. Wang等[32]提出EV-Gait框架,设计专用于异步事件数据的深度神经网络来实现步态识别,但是该网络在复杂动态场景中的识别性能存在不足. Ye等[33]利用自监督大模型提取通用视觉特征,通过无监督表征转换模块降低对上游任务的依赖,但是依赖于高算力,且隐式特征的可解释性仍须增强. Fan等[34]通过焦点卷积和微动作捕捉模块处理局部特征,然而该方法在复杂背景下容易失效. Gao等[35]基于骨架数据,结合时空图卷积与低秩分解方法优化关节特征,增强对遮挡物体的识别鲁棒性,但是受限于传统姿态估计工具的精度. DeepLabCut[36]作为基于深度神经网络的无标记姿态估计技术,运用迁移学习来实现2D和3D姿态的精准估计,以少量的训练数据获得出色的结果,适用于动物行为学、运动科学等领域的姿态估计[37-40]. 因此,利用DeepLabCut提取四足动物运动关键节点的二维坐标,设计仿生步态编码器来生成关节运动时序数据,进而为仿生步态奖励函数提供动力学参考轨迹数据.

针对以上问题,提出融合几何约束特征提取与多奖励协同优化的仿生步态控制方法. 构建结合动态时间规整(dynamic time warping, DTW)方法和卷积处理的仿生步态编码器模块,有效保留生物运动特性. 构建微分运动学驱动的双重几何约束机制,通过运动学可行域建模以及关节-任务空间耦合映射,提升PPO算法的策略优化效率和目标收敛可控性. 设计融合能效因子与李雅普诺夫稳定性判据的分层奖励机制,实现能量最优与动态平衡的仿生步态多目标协同优化. 实验结果表明,该方法有效提升了四足机器人的运动稳定性和环境适应性.

1. 仿生步态控制方法

本研究方法的整体架构如图1所示,包含仿生步态特征提取、强化学习仿真训练与部署调试3个阶段. 首先,在姿态估计模型对动物运动视频进行关键节点识别之后,仿生步态编码器从中提取步态特征和关键运动模式. 其次,在强化学习仿真训练阶段,引入双重几何约束机制,同时设计能量效率与稳定性奖励函数,实现多目标协同优化. 最后,将训练所得的控制策略部署至四足机器人平台,通过多地形测试实验验证方法的有效性.

图 1

图 1   仿生步态控制方法框架

Fig.1   Framework of bio-inspired gait control method


1.1. 仿生步态编码器

仿生步态编码器结构如图1所示. 先获取四足动物运动视频的帧尺寸,对数据进行归一化处理,再进行特征提取和特征升维,形成高维特征信息. 特征提取包含逆运动学解算、关节速度计算和动态时间规整等步骤. 在进行逆运动学解算时,根据关节位置数据求解关节角度. 后腿髋关节角度$ {\theta _{{\text{hip}}}} $的计算公式为

$ {\theta _{{\text{hip}}}} = \arctan\; ({y_{{\text{knee}}}} - {y_{{\text{hip}}}},{x_{{\text{knee}}}} - {x_{{\text{hip}}}}). $

式中:$ {x_{{\text{hip}}}} $$ {y_{{\text{hip}}}} $为髋关节二维坐标,$ {x_{{\text{knee}}}} $$ {y_{{\text{knee}}}} $为膝关节二维坐标.

图2所示,计算所得的角度将被限制在$ ( - {30^ \circ },{30^ \circ }) $内,以符合四足动物后腿髋关节的生理活动范围. 同理,根据式(1)计算前腿髋关节角度,并通过检查前膝足端高度是否低于地面来判断膝关节角度是否有效.

图 2

图 2   几何约束关系示意图

Fig.2   Schematic diagram of geometric constraint relationship


在计算关节速度时,通过计算关节角度$ \theta $的时间导数,得到关节速度:

$ v_{{\mathrm{joint}}} = \frac{{\theta (t+\Delta t/2) - \theta (t - \Delta t/2)}}{{\Delta t}}. $

式中:$ \Delta t $为时间间隔.

在进行动态时间规整处理时,将不同长度的时间序列对齐,每隔$ n $个点采样,形成参考序列数据集. 然后将特征序列分割为$ m $个子序列,对每个子序列与参考序列进行DTW对齐并拼接.

完成特征提取处理后,采用卷积操作对特征空间进行升维,卷积操作的公式为

$ {{\boldsymbol{y}}_i} = \sum\limits_{j = 1}^{{c_{{\text{in}}}}} {{w_{ij}}} {{\boldsymbol{x}}_j}+{{\boldsymbol{b}}_i};\;\;\; i = 1,2, \cdots ,{c_{{\text{out}}}}. $

式中:cin为卷积层的输入通道数,cout为输出通道数,$ w_{ij}^{} $为卷积核权重,$ {\boldsymbol{b}}_{i} $为偏置项,$ {{\boldsymbol{x}}_j} $为输入特征,$ {{\boldsymbol{y}}_i} $为输出特征.

1.2. 奖励函数设计

受薛均晓等[41]设计的强化学习奖励函数的启发,提出融合仿生步态、能效和稳定性的奖励函数,用于生成四足机器人在复杂地形上的运动控制策略. 奖励函数通过结合DTW算法、功率消耗估计以及李雅普诺夫稳定性优化算法,实现高效且稳定的仿生运动控制.

1.2.1. 仿生步态奖励函数

PPO是基于策略梯度的强化学习算法,属于Actor-Critic架构的变体. 在该算法中,Actor网络负责优化策略,损失函数通过clip剪裁策略限制更新幅度,约束策略变化,从而提高策略优化的稳定性,为更优动作的选择提供支持. 损失函数公式为

$\left. \begin{split} &{L}_{\text{act}}={E}_{t}\left[\mathrm{min}\;({r}_{t}({\boldsymbol{\theta}} ){\hat{{{A}}}}_{t},\text{clip}\;({r}_{t}({\boldsymbol{\theta}} ),1-\epsilon ,1+\epsilon ){\hat{{{A}}}}_{t})\right],\\& {r_t}({\boldsymbol{\theta }}) = \dfrac{{{{{\pi}} _{\boldsymbol{\theta }}}({{\boldsymbol{a}}_t}\mid {{\boldsymbol{s}}_t})}}{{{{{\pi}} _{{\text{old}}}}({{\boldsymbol{a}}_t}\mid {{\boldsymbol{s}}_t})}}.\end{split}\right\}$

式中:$ {r_t}({\boldsymbol{\theta }}) $为策略更新的概率比值;$ {\boldsymbol{\theta }} $为Actor网络的参数;$ {\hat{{ A}}_t} $为优势函数,表示在状态$ {{\boldsymbol{s}}_t} $下采取动作$ {{\boldsymbol{a}}_t} $的优势;$ t $为时间变量;$ \epsilon $为剪裁的超参数.

Critic网络的目标是估计状态值函数$ V\left({{\boldsymbol{s}}_t} \right) $,并使其尽可能地接近真实回报$ {V_t} $. PPO中通常使用均方误差损失来优化Critic网络:

$ {L_{{\text{crit}}}} = {E_t}\left[ {{{\left( {{{V}}({{\boldsymbol{s}}_t}) - {{{V}}_t}} \right)}^2}} \right]. $

图3所示,在PPO算法中,奖励函数定义了环境对智能体行为的反馈机制,通过影响回报$ {V_t} $和优势函数来指导策略和价值函数的优化,从而直接影响智能体的学习目标.

图 3

图 3   PPO算法应用流程

Fig.3   Application flow of PPO algorithm


所设计的仿生步态奖励函数通过多阶段计算引导智能体学习符合生物学与力学规律的步态. 通过DTW算法对当前步态与参考模板的时间序列进行非线性对齐,进而处理非线性伸缩和时间轴差异问题,提升相似性度量的准确性. 对于参考特征序列$ {{\boldsymbol{f}}_{{\text{ref}}}} $,每间隔$ \lambda $帧进行1次下采样,生成模板$ {{\boldsymbol{f}}_{{\text{tem}}}} $,并通过动态规划逐帧计算累积欧氏距离矩阵中的元素:

$ \begin{split} D(t,k)=&\Vert {{\boldsymbol{f}}}_{\text{raw}}(t)-{{\boldsymbol{f}}}_{\text{tem}}(k){\Vert}_{2}+{\mathrm{min}}\left(D(t-1,k\right),\\& D\left(t-1,k-1\right),\;D\left(t-1,k+1)\right).\end{split} $

式中:$ {{\boldsymbol{f}}_{{\text{raw}}}} $为原始步态特征序列. 基于式(6),DTW距离取路径末端的最小累积距离均值,以避免单一路径的偶然性偏差. 最小累积距离均值的计算公式为

$ {d_{{\text{dtw}}}} = \frac{1}{K}\sum\limits_{k = 1}^K D (t,k). $

最后,基于DTW距离构造指数型奖励函数:

$ {r_{{\text{gait}}}} = \exp \left( { - \frac{{{d_{{\text{dtw}}}}}}{\sigma }} \right). $

通过调节$ \sigma $控制奖励对距离变化的敏感度. 当$ \sigma $值较小时,增强奖励区分度以精细化匹配参考步态;反之,如果$ \sigma $值较大,则提供平缓优化信号以支持仿真训练初期的探索行为.奖励函数采用指数形式,以便于优化策略梯度算法的稳定性,避免因奖励函数不连续导致的训练震荡.

1.2.2. 能效奖励函数与李雅普诺夫稳定性奖励

为了提高四足机器人运动的稳定性,提出结合能效和稳定性的奖励函数. 该函数分别利用功率消耗估计和李雅普诺夫稳定性方法衡量机器人的能效和稳定性,并将其转换为奖励值,以引导机器人在复杂地形上实现高效、稳定的运动. 能效奖励函数通过估计机器人运动过程中的功率消耗,引导机器人高效运动. 功率消耗$ P $的计算公式为

$ P = \sum\limits_{i = 1}^N | {\tau _i}| \cdot |{\dot q_i}|. $

式中:$ N $为关节数量,$ {\tau _i} $为第$ i $个关节的力矩,$ {\dot q_i} $为第$ i $个关节的速度. 通过累加所有关节的力矩和速度的绝对值乘积,得到机器人的功率消耗.

为了将功率消耗转换为奖励值,采用指数衰减函数,将功率消耗映射到[0, 1.0]内. 奖励值通过下式计算得到:

$ {r_{\text{e}}} = \exp \left( { - \frac{P}{{10.0}}} \right). $

奖励函数采用指数形式,引入非线性惩罚机制以量化评估不同能量消耗水平下的动作性能. 同时将功率消耗$ P $映射到奖励值,使得功率消耗越小,奖励值越高,从而鼓励机器人采用节能方式运动.

李雅普诺夫稳定性奖励函数通过构造李雅普诺夫函数来衡量机器人的稳定性. 四足机器人的质心速度和高度偏差能够表征机器人的动态平衡能力和在高度方向上的静态稳定能力. 为了同时规范机器人的动态行为和维持稳定的平衡姿态,增强四足机器人在复杂环境中的适应性,将李雅普诺夫函数$ V_{{\mathrm{L}}} $定义为

$ V_{{\mathrm{L}}} = \sum\limits_{i = 1}^3 {{{\left( {{{\dot x}_i}} \right)}^2}} +{\left( {h - {h_{{\text{tgt}}}}} \right)^2}. $

式中:$ {\dot x_i} $为质心在$ i $轴上的速度,$ h $为当前基座高度,$ {h_{{\text{tgt}}}} $为目标高度. 奖励值为

$ {r_{\text{s}}} = \frac{1}{{1+V_{{\mathrm{L}}}}}. $

将李雅普诺夫函数值$ V_{{\mathrm{L}}} $映射到奖励值,如果机器人状态越稳定,则奖励值越高.

2. 实验结果与讨论

2.1. 实验对象与参数

在Isaac Gym环境中进行模拟实验,并在实地场景中进行实验验证. 四足机器人的型号为Unitree Go2,采用12个自由度的构型设计,每条腿部配置3个驱动关节,分别对应髋关节(控制腿部横向摆动)、髋关节(控制腿部前后摆动)及膝关节,其机身运动空间范围为[−48º, 48º],大腿运动空间为[−200º, 90º],小腿运动空间为[−156º, 48º]. 仿真实验中部署1 024个四足机器人,迭代5 000次. 强化学习网络采用Actor-Critic架构,其策略网络和价值网络均为3层全连接结构;使用ELU激活函数,初始探索噪声标准差设为1.0. 在仿生步态编码器中,将卷积核大小设置为1,对每个时间步的特征进行处理. 该设计旨在保留时间独立性,同时通过特征升维增强模型对步态动态关键模式的捕捉能力. 在训练过程中,将每10步作为1个回合(episode),并在每个回合结束时进行评估.

2.2. 仿真训练过程与实验结果

训练过程中四足机器人的行走步态如图4所示,其中(a)~(c)对应训练初期的步态,(d)~(f)为训练末期的步态.

图 4

图 4   四足机器人步态学习过程图

Fig.4   Gait learning process of quadruped robot


四足机器人在强化学习训练过程中与环境碰撞频率的变化趋势见图5. 在初始阶段,碰撞平均值$ \bar c $较大,表明机器人的步态控制能力较差,与环境发生碰撞的频率较高. 随着训练的进行,碰撞平均值逐渐降低并趋于稳定,表明四足机器人学会了更稳定的姿态控制策略. 结合仿生步态奖励、稳定性奖励和能效奖励指标,这种趋势反映了机器人在模仿自然步态、保持稳定和提高能效方面的综合进步. 最终稳定的碰撞平均值表明机器人已经具备较好的姿态控制能力,能够在复杂环境中保持平衡并高效运动.

图 5

图 5   四足机器人的多维度性能指标变化图

Fig.5   Variation graph of multi-dimensional performance metrics of quadruped robot


强化学习仿真训练过程中适应性损失$ {\bar l_{{\text{adapt}}}} $和总奖励平均值$ {\bar r_{{\text{tot}}}} $的变化如图5所示. 适应性损失用于衡量模型在面对新任务时的预测性能与理想性能之间的差距,从而指导模型快速调整策略以应对不同环境. 随着训练迭代次数的增加,适应性损失均值呈现下降趋势并逐渐趋于稳定. 总奖励平均值为每个训练回合中所有奖励项总和的平均值,是评估和优化强化学习模型性能的重要参考指标. 随着训练的进行,总奖励平均值逐渐增大,表明机器人在不断改进行为策略,最终达到更高的性能水平. 该指标综合反映了机器人在步态相似度、能量效率、稳定性等多方面的表现. 仿生步态奖励均值$ {\bar r_{{\text{gait}}}} $、能效奖励均值$ {\bar r_{\text{e}}} $与李雅普诺夫稳定性奖励均值$ {\bar r_{{\text{stab}}}} $在仿真训练过程中逐渐趋于稳定,表明机器人在仿真环境中实现了稳定和高效的仿生运动.

图6所示,在四足机器人强化学习训练中,关键运动性能奖励指标反映了机器人在不同训练阶段的运动性能和学习进展,为训练策略的优化提供了直观依据. 这些指标的稳定趋势表明四足机器人在强化学习训练后已经达到较高的性能水平,具备良好的学习收敛性、泛化能力和鲁棒性.

图 6

图 6   四足机器人关键运动性能奖励指标变化图

Fig.6   Variation graph of key kinematic performance reward metrics of quadruped robot


2.3. 仿真平台对比实验

为了验证所提方法的有效性,将其强化学习训练结果与walk-these-ways-go2、SAC方法进行对比,如图7所示. 可以看出,借助仿生步态等奖励函数的设计,机器人避免了运动关节触地的问题,运动稳定性得到了明显改善.

图 7

图 7   采用不同算法的四足机器人运动性能仿真对比

Fig.7   Simulation comparison of locomotion performance of quadruped robot using different algorithms


对训练过程中不同方法的碰撞平均值、适应性损失均值和总奖励平均值进行对比分析,如图8所示. 可以看出,所提方法的碰撞平均值随着训练迭代次数的增加而逐渐下降并趋于稳定,表明该方法具有较高的学习能力和稳定性. 此外,适应性损失均值在训练初期快速下降并趋于稳定,同时总奖励平均值逐渐提高并稳定在较高水平. 适应性损失与奖励的协同变化表明,通过改进奖励函数,智能体在学习过程中能够更有效地调整策略,从而提高稳定性和优化效率.

图 8

图 8   采用不同算法的四足机器人在仿真训练中的碰撞均值、适应性损失及总奖励均值对比

Fig.8   Comparison of mean collision, adaptive loss, and mean total reward in simulation training of quadruped robot using different algorithms


图9展示了采用不同方法时四足机器人的关键运动性能奖励指标. 经所提方法改进后,四足机器人强化学习策略的收敛速度和多目标冲突现象得到了改善. 在线速度奖励均值$\overline v $方面,所提方法的线速度快速上升并趋于稳定,表明其在运动控制中的加速度和稳定性优于对比方法. 此外,角速度奖励均值$\overline\omega $、动作速率奖励均值$\overline{r_{{\mathrm{a}}}} $等结果显示,所提方法的指标波动较小且收敛性更好,进一步验证了其姿态控制性能的提升.

图 9

图 9   采用不同算法的四足机器人的关键运动性能奖励指标对比图

Fig.9   Comparison graph of key kinematic performance reward metrics of quadruped robot using different algorithms


2.4. 四足机器人真机部署对比实验

在仿真平台验证所提方法的有效性后,为了进一步验证其实际效果,将经过强化学习训练的策略模型部署到四足机器人中进行对比测试. 图1011中的测试结果表明,所提方法在姿态控制、能耗优化和动态适应性方面优于其他方法,进一步证明了该方法在实际应用中的可靠性. 经所提方法改进后,四足机器人在沙地和荒地等复杂地形中具有运动稳定性与环境适应性.

图 10

图 10   沙地场景下采用不同算法的四足机器人的运动性能对比

Fig.10   Comparison of locomotion performance of quadruped robot using different algorithms in sandy terrain scenario


图 11

图 11   荒地场景下采用不同算法的四足机器人的运动性能对比

Fig.11   Comparison of locomotion performance of quadruped robot using different algorithms in uncultivated terrain scenarios


2.5. 仿真计算效率对比实验

为了对比四足机器人仿真训练中不同算法的效率,选取平均迭代时间$ {t_{\text{e}}} $作为量化指标,用于衡量算法完成单次迭代的平均时长,以反映仿真计算效率. 如表1所示,所提方法的单次迭代耗时略高于其他算法,但是通过引入仿生步态及其他奖励函数,使四足机器人在仿真训练过程中的平均碰撞次数$ {c_{\text{e}}} $显著降低,表明运动稳定性和鲁棒性得到了有效提升.

表 1   四足机器人仿真训练中不同算法的计算效率与碰撞性能对比

Tab.1  Comparison of computational efficiency and collision performance of different algorithms in quadruped robot simulation training

算法名称$ {t_{\text{e}}} $/s$ {c_{\text{e}}} $
walk-these-ways-go26.117.51
SAC6.059.19
所提方法6.833.76

新窗口打开| 下载CSV


3. 结 语

提出融合几何约束特征提取与多奖励协同优化的仿生步态控制方法. 为了提升四足机器人在复杂地形中的运动稳定性和环境适应性,首先通过基于DTW与卷积处理的仿生步态编码器提取时空关联的步态特征,保留生物运动的几何关系特性. 其次,引入微分运动学驱动的几何约束机制,结合关节角度生理范围限制,提升关节运动协调性与采样效率. 最后,设计融合能效因子与李雅普诺夫稳定性的分层奖励函数,通过指数型能效奖励和稳定性奖励,实现能量效率与动态平衡目标的多目标协同优化. 实验结果表明,所提方法显著提升了四足机器人在复杂地形中的运动稳定性与环境适应性,具有较强的鲁棒性. 尽管所提方法在仿生步态控制方面取得了较好表现,但是仍然存在一定的局限性. 在极端复杂地形中,由于地形变化的不可预测性,机器人可能面临适应性不足的问题. 在未来工作中,将结合仿生动作捕捉与几何约束建模技术,并结合动作大模型,以实现更高质量的仿生步态控制.

参考文献

谭民, 王硕

机器人技术研究进展

[J]. 自动化学报, 2013, 39 (7): 963- 972

[本文引用: 1]

TAN Min, WANG Shuo

Research progress on robotics

[J]. Acta Automatica Sinica, 2013, 39 (7): 963- 972

[本文引用: 1]

贾庆轩, 袁博楠, 陈钢, 等

关节锁定空间机械臂负载操作能力评估与轨迹规划

[J]. 控制与决策, 2020, 35 (1): 243- 249

[本文引用: 1]

JIA Qingxuan, YUAN Bonan, CHEN Gang, et al

Load carrying capacity evaluation and task trajectory planning of space manipulator with the locked joint

[J]. Control and Decision, 2020, 35 (1): 243- 249

[本文引用: 1]

尤波, 曲伟健, 李佳钰

面向双操作者的六足机器人共享遥操作

[J]. 控制与决策, 2022, 37 (11): 2769- 2778

YOU Bo, QU Weijian, LI Jiayu

Shared teleoperation of hexapod robot for dual operators

[J]. Control and Decision, 2022, 37 (11): 2769- 2778

郭非, 汪首坤, 王军政

轮足复合移动机器人运动规划发展现状及关键技术分析

[J]. 控制与决策, 2022, 37 (6): 1433- 1444

[本文引用: 1]

GUO Fei, WANG Shoukun, WANG Junzheng

Development status and key technology analysis for motion planning of wheel-legged hybrid mobile robot

[J]. Control and Decision, 2022, 37 (6): 1433- 1444

[本文引用: 1]

GUO H, ZHU J, CHEN Y

E-LOAM: LiDAR odometry and mapping with expanded local structural information

[J]. IEEE Transactions on Intelligent Vehicles, 2023, 8 (2): 1911- 1921

DOI:10.1109/TIV.2022.3151665      [本文引用: 1]

ASADI F, KHORRAM M, MOOSAVIAN S A A. CPG-based gait transition of a quadruped robot [C]// Proceedings of the 3rd RSI International Conference on Robotics and Mechatronics. Tehran: IEEE, 2015: 210–215.

[本文引用: 1]

DING Y, PANDALA A, LI C, et al

Representation-free model predictive control for dynamic motions in quadrupeds

[J]. IEEE Transactions on Robotics, 2021, 37 (4): 1154- 1171

DOI:10.1109/TRO.2020.3046415      [本文引用: 1]

汪首坤, 刘大江, 郭非, 等

基于动力学模型预测控制的Stewart型轮足腿控制方法

[J]. 北京理工大学学报, 2021, 41 (4): 418- 424

[本文引用: 1]

WANG Shoukun, LIU Dajiang, GUO Fei, et al

Stewart type wheel-foot leg control method based on dynamics and model predictive control

[J]. Transactions of Beijing Institute of Technology, 2021, 41 (4): 418- 424

[本文引用: 1]

朱晓庆, 陈江涛, 张思远, 等

基于深度仲裁策略的四足机器人步态学习

[J]. 北京理工大学学报, 2023, 43 (11): 1197- 1204

[本文引用: 1]

ZHU Xiaoqing, CHEN Jiangtao, ZHANG Siyuan, et al

Gait learning of quadruped robot based on deep arbitration strategy

[J]. Transactions of Beijing Institute of Technology, 2023, 43 (11): 1197- 1204

[本文引用: 1]

张思远, 朱晓庆, 阮晓钢, 等

基于环境反馈机制的四足机器人运动技能学习

[J]. 控制与决策, 2024, 39 (5): 1461- 1468

[本文引用: 1]

ZHANG Siyuan, ZHU Xiaoqing, RUAN Xiaogang, et al

Motor skill learning of quadruped robot based on environmental feedback mechanism

[J]. Control and Decision, 2024, 39 (5): 1461- 1468

[本文引用: 1]

BUTYREV L, EDELHÄUβER T, MUTSCHLER C. Deep reinforcement learning for motion planning of mobile robots [EB/OL]. (2019-12-19) [2025-04-04]. https://arxiv.org/abs/1912.09260.

[本文引用: 1]

XIONG J, WANG Q, YANG Z, et al. Parametrized deep Q-networks learning: reinforcement learning with discrete-continuous hybrid action space [EB/OL]. (2018-10-10) [2025-04-04]. https://arxiv.org/abs/1810.06394.

[本文引用: 1]

VAN HASSELT H, GUEZ A, SILVER D. Deep reinforcement learning with double Q-Learning [C]// Thirtieth AAAI Conference on Artificial Intelligence. Phoenix: AAAI Press, 2016: 2094–2100.

WANG Z, SCHAUL T, HESSEL M, et al. Dueling network architectures for deep reinforcement learning [C]// Proceedings of the 33rd International Conference on Machine Learning. New York: JMLR, 2016: 1995–2003.

MNIH V, BADIA A P, MIRZA M, et al. Asynchronous methods for deep reinforcement learning [C]// Proceedings of the 33rd International Conference on Machine Learning. New York: JMLR, 2016: 1928–1937.

LILLICRAP T P, HUNT J J, PRITZEL A, et al. Continuous control with deep reinforcement learning [EB/OL]. (2019-07-05) [2025-04-04]. https://arxiv.org/abs/1509.02971.

[本文引用: 1]

GANGAPURWALA S, GEISERT M, ORSOLINO R, et al

RLOC: terrain-aware legged locomotion using reinforcement learning and optimal control

[J]. IEEE Transactions on Robotics, 2022, 38 (5): 2908- 2927

DOI:10.1109/TRO.2022.3172469      [本文引用: 1]

董豪, 杨静, 李少波, 等

基于深度强化学习的机器人运动控制研究进展

[J]. 控制与决策, 2022, 37 (2): 278- 292

[本文引用: 1]

DONG Hao, YANG Jing, LI Shaobo, et al

Research progress of robot motion control based on deep reinforcement learning

[J]. Control and Decision, 2022, 37 (2): 278- 292

[本文引用: 1]

HAARNOJA T, HA S, ZHOU A, et al. Learning to walk via deep reinforcement learning [C]// Robotics: Science and Systems XV. Freiburg im Breisgau: RSS Foundation, 2019.

[本文引用: 1]

FUCHIOKA Y. Imitating optimized trajectories for dynamic quadruped behaviors [D]. Vancouver: University of British Columbia, 2023.

[本文引用: 1]

ISCEN A, CALUWAERTS K, TAN J, et al. Policies modulating trajectory generators [C]// Proceedings of the 2nd Conference on Robot Learning. Zurich: PMLR, 2018: 916–926.

[本文引用: 1]

SCHULMAN J, WOLSKI F, DHARIWAL P, et al. Proximal policy optimization algorithms [EB/OL]. (2017-08-28) [2025-04-04]. https://arxiv.org/abs/1707.06347.

[本文引用: 1]

RUDIN N, HOELLER D, REIST P, et al. Learning to walk in minutes using massively parallel deep reinforcement learning [C]// Proceedings of the 5th Conference on Robot Learning. London: PMLR, 2021: 91–100.

[本文引用: 1]

MARGOLIS G B, AGRAWAL P. Walk these ways: tuning robot control for generalization with multiplicity of behavior [C]// Proceedings of the 6th Conference on Robot Learning. Auckland: PMLR, 2022: 22–31.

[本文引用: 1]

朱晓庆, 刘鑫源, 阮晓钢, 等

融合元学习和PPO算法的四足机器人运动技能学习方法

[J]. 控制理论与应用, 2024, 41 (1): 155- 162

[本文引用: 1]

ZHU Xiaoqing, LIU Xinyuan, RUAN Xiaogang, et al

A quadruped robot kinematic skill learning method integrating meta-learning and PPO algorithms

[J]. Control Theory & Applications, 2024, 41 (1): 155- 162

[本文引用: 1]

罗彪, 胡天萌, 周育豪, 等

多智能体强化学习控制与决策研究综述

[J]. 自动化学报, 2025, 51 (3): 510- 539

[本文引用: 1]

LUO Biao, HU Tianmeng, ZHOU Yuhao, et al

Survey on multi-agent reinforcement learning for control and decision-making

[J]. Acta Automatica Sinica, 2025, 51 (3): 510- 539

[本文引用: 1]

LIN S, QIAO G, TAI Y, et al. HWC-Loco: a hierarchical whole-body control approach to robust humanoid locomotion [EB/OL]. (2025-05-18) [2025-06-08]. https://arxiv.org/abs/2503.00923.

[本文引用: 1]

WAN C, WANG L, PHOHA V V

A survey on gait recognition

[J]. ACM Computing Surveys, 2018, 51 (5): 89

[本文引用: 1]

史晓国, 云静, 张钰莹, 等

步态识别研究综述

[J]. 计算机工程与应用, 2025, 61 (14): 65- 87

[本文引用: 1]

SHI Xiaoguo, YUN Jing, ZHANG Yuying, et al

Review of gait recognition research

[J]. Computer Engineering and Applications, 2025, 61 (14): 65- 87

[本文引用: 1]

ALOTAIBI M, MAHMOOD A

Improved gait recognition based on specialized deep convolutional neural network

[J]. Computer Vision and Image Understanding, 2017, 164: 103- 110

DOI:10.1016/j.cviu.2017.10.004      [本文引用: 1]

LAL A, NITHYAKANI P. Gait speed based individual recognition model using deep 2-D convolutional neural network [C]// Proceedings of the International Conference on Computer Communication and Informatics. Coimbatore: IEEE, 2023: 1–6.

[本文引用: 1]

WANG Y, DU B, SHEN Y, et al. EV-gait: event-based robust gait recognition using dynamic vision sensors [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Long Beach: IEEE, 2019: 6351–6360.

[本文引用: 1]

YE D, FAN C, MA J, et al. BigGait: learning gait representation you want by large vision models [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2024: 200–210.

[本文引用: 1]

FAN C, PENG Y, CAO C, et al. GaitPart: temporal part-based model for gait recognition [C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. Seattle: IEEE, 2020: 14213–14221.

[本文引用: 1]

GAO S, YUN J, ZHAO Y, et al

Gait-D: skeleton-based gait feature decomposition for gait recognition

[J]. IET Computer Vision, 2022, 16 (2): 111- 125

DOI:10.1049/cvi2.12070      [本文引用: 1]

MATHIS A, MAMIDANNA P, CURY K M, et al

DeepLabCut: markerless pose estimation of user-defined body parts with deep learning

[J]. Nature Neuroscience, 2018, 21 (9): 1281- 1289

DOI:10.1038/s41593-018-0209-y      [本文引用: 1]

NATH T, MATHIS A, CHEN A C, et al

Using DeepLabCut for 3D markerless pose estimation across species and behaviors

[J]. Nature Protocols, 2019, 14 (7): 2152- 2176

DOI:10.1038/s41596-019-0176-0      [本文引用: 1]

LAUER J, ZHOU M, YE S, et al

Multi-animal pose estimation, identification and tracking with DeepLabCut

[J]. Nature Methods, 2022, 19 (4): 496- 504

DOI:10.1038/s41592-022-01443-0     

YE S, FILIPPOVA A, LAUER J, et al

SuperAnimal pretrained pose estimation models for behavioral analysis

[J]. Nature Communications, 2024, 15: 5165

DOI:10.1038/s41467-024-48792-2     

MATHIS A, BIASI T, SCHNEIDER S, et al. Pretraining boosts out-of-domain robustness for pose estimation [C]// Proceedings of the IEEE Winter Conference on Applications of Computer Vision. Waikoloa: IEEE, 2021: 1858–1867.

[本文引用: 1]

薛均晓, 陈金浦, 董博威, 等. 基于深度确定性策略梯度算法的航空母舰舰载机导引路径规划与仿真[J/OL]. 计算机辅助设计与图形学学报, 2025: 1–14. (2025-02-07) [2025-04-04]. https://kns.cnki.net/kcms/detail/detail.aspx?dbcode=CJFQ&dbname=CJFD&filename=JSJF2025020600B.

[本文引用: 1]

XUE Junxiao, CHEN Jinpu, DONG Bowei, et al. Guidance path planning and simulation of aircraft carrier based on depth deterministic strategy gradient algorithm [J/OL]. Journal of Computer-Aided Design & Computer Graphics, 2025: 1–14. (2025-02-07) [2025-04-04]. https://kns.cnki.net/kcms/detail/detail.aspx?dbcode=CJFQ&dbname=CJFD&filename=JSJF2025020600B.

[本文引用: 1]

/