随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊

Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
图 3 不同批量下SVRRM-PG在Cartpole上的平均回报
Fig.3 Average returns of SVRRM-PG on Cartpole under different batches