随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊

Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
表 2 实验任务场景关键参数
Tab.2 Key parameters of the experimental task scenarios
任务描述动作空间状态空间最大步长
Cartpole平衡车2维离散4维500
Acrobot两关节连杆3维离散6维500
Hopper跳跃机器人3维连续11维1000
Walker行走机器人6维连续17维1000