集成多智能体强化学习和最大压强控制的混行交叉口协同控制
曹宁博,万启超,赵利英,李梓萌,黄宝林

Collaborative control of mixed traffic intersections integrating multi-agent reinforcement learning and maximum pressure control
Ningbo CAO,Qichao WAN,Liying ZHAO,Zimeng LI,Baolin HUANG
表 4 训练参数表
Tab.4 Description of training parameters
参数数值参数数值参数数值参数数值
$ {w_{\mathrm{s}}} $0.5$ {k_{{\text{acc}}}} $/(s2·m−1)0.1$ {k_{{\text{flow}}}} $0.1$ {C_{{\text{re}}{{\text{d}}^\prime }}} $40
$ {C_{{\text{col}}}} $−1 000$ {a_{{\text{th}}}} $/(m·s2)2$ {w_{{\mathrm{s}}'}} $0.4$ {k_{{\text{gree}}{{\text{n}}^\prime }}} $/(s·m−1)0.04
$ {k_{{\text{dist}}}} $/m−210$ {k_{{\text{jerk}}}} $/(s4·m−1)0.2$ {C_{{\text{co}}{{\text{l}}^\prime }}} $−1 000$ {k_{{\text{sudde}}{{\text{n}}^\prime }}} $/(s2·m−1)0.05
$ {d_{{\text{min}}}} $/m1$ {k_\delta } $0.05$ {k_{{\text{dis}}{{\text{t}}^\prime }}} $/m−25$ {w_{\mathrm{h}}} $0.15
$ \epsilon $/m0.1$ {\delta _{\max }} $/radπ/4$ {d_{{{\min }^\prime }}} $/m1$ \lambda $0.3
$ {k_{{\text{ped}}}} $/m−320$ {w_{\mathrm{p}}} $0.05$ {d_{{\text{saf}}{{\text{e}}^\prime }}} $/m1.5$ {k_{{\text{run - yellow}}}} $1
$ {d_{{\text{ped\_safe}}}} $/m3$ {C_{{\text{ped}}}} $−500$ {w_{{\mathrm{e}}'}} $0.3$ {k_{{\text{stop - green}}}} $0.5
$ {d_{{\text{ped\_min}}}} $/m0.5$ {k_{{\text{yield}}}} $5$ {k_{{\mathrm{v}}'}} $/(s·m−1)0.12$ {k_{{\text{honk - ped}}}} $0.3
$ {t_{{\text{react}}}} $/s1.5$ {k_{{\text{honk}}}} $1$ {v_{{\text{pref}}}} $/(m·s−1)限速×1.15$ {k_{{\text{distract}}}} $0.1
$ {d_0} $/m2$ {k_{{\text{pred}}}} $/m−20.5$ {k_{{\text{pro}}{{\text{g}}^\prime }}} $/m−10.01$ {w_{\Pr }} $1
$ {w_{\mathrm{e}}} $0.3$ {d_{{\text{cross\_safe}}}} $/m10$ {k_{{\text{delay}}}} $/s−10.02$ {w_{{\text{phase - change}}}} $0.5
$ {k_{\mathrm{v}}} $/(s·m−1)0.1$ {w_{\mathrm{l}}} $0.05$ {k_{{\text{detour}}}} $/m−10.001$ {w_{{\text{throughput}}}} $1.2
$ {v_{{\text{target}}}} $/(m·s−1)限速$ {C_{{\text{red}}}} $50$ {w_{{\mathrm{c}}'}} $0.05$ {w_{{\text{emergency}}}} $0.3
$ {k_{{\text{prog}}}} $/m−10.01$ {v_{\max }} $/(m·s−1)40$ k_{{\text{acc}}}^{'} $/(s2·m−1)0.05$ {w_{{\text{queue}}}} $0.8
$ {k_{{\text{idle}}}} $/s−10.05$ {k_{{\text{green}}}} $/(s·m−1)0.05$ {a_{{\text{t}}{{\text{h}}^\prime }}} $/(m·s−2)3$ {w_{{\text{wait}}}} $0.3
$ {v_{\min }} $/(m·s−1)2$ {v_{{\text{lim}}}} $/(m·s−1)限速$ k_{{\text{jerk}}}^{'} $/(s4·m−1)0.1$ w_{{\text{phase - change}}}^{'} $0.4
$ {k_{{\text{route}}}} $/ m−10.001$ {k_{{\text{yellow}}}} $/(s2·m−1)0.1$ {k_{\delta '}} $0.03$ \gamma $0.99
$ {w_{\mathrm{r}}} $0.1$ {k_{{\text{antic}}}} $0.2$ {w_{{\mathrm{p}}'}} $0.05学习率0.000 01
$ {k_{{\text{lane}}}} $/ m−10.1$ {w_{{\mathrm{co}}}} $0.05$ {C_{{\text{pe}}{{\text{d}}^\prime }}} $−500总训练回合数1 500
$ {k_{{\text{signal}}}} $0.5$ {k_{{\text{v2x}}}} $2$ {k_{{\text{hon}}{{\text{k}}^\prime }}} $0.5$ \epsilon $0.2
$ {k_{{\text{illegal}}}} $1$ {k_{{\text{cross}}}} $1$ {k_{{\text{ped}}\_{\text{avoid}}}} $2SGD迭代次数5
$ {w_{\mathrm{c}}} $0.05$ {k_{{\text{block}}}} $1$ {w_{{\mathrm{l}}'}} $0.05$ B $100