动态环境无人机导航的安全分层强化学习框架 |
||||||||||||||||||||||||||||||||||||||||||||||||||||
| 商益铭,杜昌平,杨睿,方天睿,杜泽安,郑耀 | ||||||||||||||||||||||||||||||||||||||||||||||||||||
|
Safe hierarchical reinforcement learning framework for dynamic UAV navigation |
||||||||||||||||||||||||||||||||||||||||||||||||||||
| Yiming SHANG,Changping DU,Rui YANG,Tianrui FANG,Ze’an DU,Yao ZHENG | ||||||||||||||||||||||||||||||||||||||||||||||||||||
| 表 2 自适应奖励塑形下的权重分配 | ||||||||||||||||||||||||||||||||||||||||||||||||||||
| Tab.2 Weight distribution under adaptive reward shaping | ||||||||||||||||||||||||||||||||||||||||||||||||||||
|
||||||||||||||||||||||||||||||||||||||||||||||||||||