随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊

Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
表 5 不同批量下的平均回报
Tab.5 Average returns under different batches
$ Q $-$ B $R
0$ \sim $30003000$ \sim $10000
20-5155.87190.79
50-5155.87191.28
50-10137.84191.63
100-5157.91193.57
100-10139.50192.69
100-20108.91193.71
150-5157.01189.44
150-10140.52191.80
150-20110.50191.77