随机方差缩减的递归动量策略梯度方法
辛垚辉,李永强,冯宇,胡磊

Stochastic variance-reduced recursive momentum policy gradient method
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
表 4 5种实验算法在不同阶段的方差
Tab.4 Variance of five experimental algorithms at different stages
算法AcrobotCartpoleHopperWalker
0~30%30%~100%0~30%30%~100%0~30%30%~100%0~30%30%~100%
GPOMDP6383.36762.243726.2583.8073250.8637910.807108.043110.71
STORM-PG5577.74296.932025.4467.3580832.2520085.554739.302500.16
PAGE-PG5178.15247.353472.70104.6057135.1325513.845098.692666.30
SHARP4634.38308.802542.07152.4145235.574477.664100.442607.13
SVRRM-PG3531.65163.941817.9953.9038120.922744.553205.001836.84