随机方差缩减的递归动量策略梯度方法
|
|
辛垚辉,李永强,冯宇,胡磊
|
Stochastic variance-reduced recursive momentum policy gradient method
|
|
Yaohui XIN,Yongqiang LI,Yu FENG,Lei HU
|
|
| 表 4 5种实验算法在不同阶段的方差 |
| Tab.4 Variance of five experimental algorithms at different stages |
|
| 算法 | Acrobot | | Cartpole | | Hopper | | Walker | | 0~30% | 30%~100% | | 0~30% | 30%~100% | | 0~30% | 30%~100% | | 0~30% | 30%~100% | | GPOMDP | 6383.36 | 762.24 | | 3726.25 | 83.80 | | 73250.86 | 37910.80 | | 7108.04 | 3110.71 | | STORM-PG | 5577.74 | 296.93 | | 2025.44 | 67.35 | | 80832.25 | 20085.55 | | 4739.30 | 2500.16 | | PAGE-PG | 5178.15 | 247.35 | | 3472.70 | 104.60 | | 57135.13 | 25513.84 | | 5098.69 | 2666.30 | | SHARP | 4634.38 | 308.80 | | 2542.07 | 152.41 | | 45235.57 | 4477.66 | | 4100.44 | 2607.13 | | SVRRM-PG | 3531.65 | 163.94 | | 1817.99 | 53.90 | | 38120.92 | 2744.55 | | 3205.00 | 1836.84 |
|
|
|