随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊
Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
表 2
实验任务场景关键参数
Tab.2
Key parameters of the experimental task scenarios
任务
描述
动作空间
状态空间
最大步长
Cartpole
平衡车
2维离散
4维
500
Acrobot
两关节连杆
3维离散
6维
500
Hopper
跳跃机器人
3维连续
11维
1000
Walker
行走机器人
6维连续
17维
1000