多智能体的离散图博弈求解方法基于强化学习
发布时间
阅读量:
阅读量
记录对Frank L. Lewis等人在自动控制领域权威期刊automatica上发表的论文《多智能体离散时间图游戏与强化学习解决方案》进行复现的过程。
1、理论部分
针对包含N个离散多智能体的系统,各成员的动态特性可表示为
x_i(k+1) = Ax_i(k) + B_iu_i(k) \\ x_0(k+1) = Ax_0(k) \tag{1.1} $$其中,$x_0$代表领导者的行为特征,其余成员则为跟随者。 定义第$i$个智能体的邻居跟踪误差为
\epsilon_i(k) = \sum_{j \in N_i}e_{ij}(x_j(k)- x_i(k))+g_i(x_0(k)-x_i(k))\tag{1.2}
$$其中,e_{ij}表示第j个个体向第i个个体传递信息时所采用的权重系数,而g_i则是领导者对第i个个体传递信息时所采用的权重系数。
由此可得第i个智能体邻居跟踪误差的动态特性表达式为
\epsilon_i(k+1) = \epsilon_i(k)-(d_i+g_i)B_iu_{ik}+\sum_{j \in N_i}e_{ij}B_ju_{jk}\tag{1.3} $$其中,$d_i=$$\sum_{j \in N_i}e_{ij}$。 定义第$i$个智能体在$k$时刻的价值函数为 $V_i(\
全部评论 (0)
还没有任何评论哟~
