随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊
Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
图 2
5种算法在连续任务上的奖励曲线
Fig.2
Reward curves of 5 algorithms on continuous tasks