北京大学人工智能研究院邓小铁教授、杨耀东助理教授在多人随机博弈的纳什均衡计算复杂度研究中取得重要进展
2024/04/12
近日,北京大学人工智能研究院多智能体中心邓小铁教授团队与杨耀东助理教授团队在National Science Review上发表论文“On the Complexity of Computing Markov Perfect Equilibrium in General-Sum Stochastic Games”。该工作引入了近似马尔科夫完美纳什均衡(Markov Perfect Nash Equilibrium,MPE)作为多人一般和随机博弈(Multi-player General-Sum Stochastic Games)计算问题的解概念,并证明了该解概念的PPAD-Complete复杂度。其解概念保留了马尔科夫性质,为多智能体学习算法由静态双人博弈成功扩展到动态多人随机博弈奠定了计算复杂度理论基础,为分布式人工智能、多智能体系统研究开辟了新的路径与思路。
未来的AI会是什么样子?牛津大学计算机科学系主任迈克尔·伍尔德里奇(Michael Wooldridge)于2019年在T-EDGE全球创新大会上表示:“人工智能未来发展的趋势会是多智能体,AI之间能实现智能互联。就像人生活在充满丰富社交的社会当中,AI也可以学会人类的社交方式,并与其他智能体达成协同。”多智能体是由多个AI作为个体而构成的有机统一整体。近年来,伴随着深度学习、强化学习算法与大数据技术的发展,多智能体研究领域迎来了新的机遇,尤其是多智能体系统的动态演化更是成为社会、经济、军事等领域重点关注的方向。但多智能体系统中庞大的智能体数量、复杂的交互行为、异构且多样的策略选择为博弈均衡点的求解带来了极大困难。
随机博弈(也称马尔科夫博弈)作为一种重要的博弈形式,是描述多智能体交互的核心数学模型,为研究多智能体学习、博弈与最优决策奠定了理论框架。具体来说,随机博弈是一种由多个参与者进行的具有状态转移概率的动态博弈过程,每个参与者独立地在每一轮博弈中决定自己的策略,根据当前状态与动作获得本轮奖励,下个阶段的状态根据状态转移概率以及所有玩家的动作发生转移,不断重复。在具体场景中,智能体(玩家)通常表现为合作、竞争或合作与竞争相交叠,分别对应于共有奖励函数、零和奖励函数与一般和奖励函数。
如图1所示,随机博弈可以应用于广泛的领域,包括经济学、计算机科学和工程学等。在经济学中,它可用于研究拍卖机制、议价策略等许多涉及竞争和不确定性的问题。在计算机科学中,它可用于研究如何在不确定环境中设计多智能体的决策算法。在工程中,它可用于分析具有随机组件的系统的性能,例如通信网络和智慧电网。

图1. 随机博弈的应用场景
随着时间的推移,所有玩家均存在动态发展到其策略选择稳定的极限状态,此状态下所有玩家都没有动机去通过更改策略选择来获得更大奖励,即达到了纳什均衡。在纳什均衡中,每个参与者都不会认为自己可以通过改变当前策略来改善自己的收益,所以是一种不涉及预测的稳态。因此,建立稳态的描述均衡解的概念对智能体最优策略的选择至关重要。基于此,本文进一步提出了MPE的解概念,该解概念相比于传统纳什均衡的特点是它能有效表达多玩家在一般和随机博弈中的动态行为过程。具体来说,MPE是一种更具体的纳什均衡,适用于这样一种场景:玩家在博弈每个阶段的决策仅取决于博弈的当前状态,也就是玩家的策略必须是“无记忆的”,即不能依赖于博弈的历史决策与状态,而只能依赖于当前状态。这一解概念为研究分布式AI,多智能体学习算法提供了便利,例如在多智能体强化学习(Multi-agent Reinforcement Learning)中,随机博弈中的MPE解概念能够扩展到包括多智能体多轮策略交互的各类动态场景,可用于研究多人动态博弈中的最优决策与均衡点。
然而,现有对多智能体博弈均衡策略的求解需要较强的假设条件,许多求解算法受限于处理二人零和博弈或多人纯合作博弈,对于一般和博弈,即同时存在竞争与合作的博弈,求解需要较强的额外假设。在面向大规模且合作与竞争相交叠的动态多智能体交互的场景中,求解均衡策略对智能体建模、准确地选择策略与其他智能体交互协调至关重要,是实现能泛化、可扩展的通用人工智能的关键。
在随机博弈中确定MPE的复杂性是求解均衡策略的基础,由于一般和动态博弈求解具有很高的复杂性,因此求解一般和随机博弈中MPE的计算复杂度同样面临巨大挑战。已有研究表明,在无界(infinite-horizon)随机博弈中求解MPE至少是PPAD困难的。PPAD(“有向图的多项式校验参数”)在计算机科学中代表了一个复杂度类,它由Christos Papadimitriou于1994年引入,通常被用于刻画博弈论中均衡点计算的复杂度。PPAD是一个介于P和NP当中的复杂度类,PPAD问题是否存在多项式时间解法与P是否等于NP相似,是一个悬而未决的难题。

图2. 复杂度包含关系的大致示意图(不严格)
邓小铁教授曾在2006年证明了单一状态下双人一般博弈(normal-form game)的纳什均衡计算是PPAD-complete。此工作也荣获了当年FOCS的最佳论文奖。而在本工作中,邓小铁团队与杨耀东团队进一步证明了多人随机博弈中纳什均衡的计算“相当于”单一状态双人纳什均衡的计算,如图3所示,即他们证明了多人一般和随机博弈中近似MPE的计算复杂度也是PPAD-complete的。也就是说双人单步纳什均衡的计算与多人随机博弈的MPE计算具有相同的复杂度。


图3. 双人一般博弈(左)和多人随机博弈(右)
证明多人随机博弈的纳什均衡计算复杂度具有深远意义。近年来,强化学习领域有多种多人随机博弈的学习与求解算法尝试以单轮一般博弈求解算法作为算法的组成模块。本工作通过揭示多人随机博弈与单轮一般博弈的深刻联系与等价性,为这类算法提供了计算复杂度方向的理论保证,同时启发人们更好地从单轮一般博弈的求解出发设计高效的多智能体强化学习算法。它为研究多智能体动态决策开辟了新的理论保障,对研究多智能体交互与学习机制具有关键价值,是近年来博弈论与多智能体系统研究方向上的重要理论突破。
文章来源北京大学新闻网,分享只为学术交流,如涉及侵权问题请联系我们,我们将及时修改或删除。
-
2026年第十六届电力与能源系统国际 110
-
2026年10月优质国际学术会议推荐 448
-
2026年智能科学与信息物理技术国际 157
-
第五届传感、测量、通信与物联网技术国 548
-
2026年第三届计算机网络与云计算国 3097
-
2026资源、化学化工与应用材料国际 4170
-
2026年图像处理与数字创意设计国际 3855
-
2026年机械工程,新能源与电气技术 8936
-
2026年材料科学、低碳技术与动力工 4359
-
2026智能驾驶、智能传感与无人系统 09-28
-
2026生命健康、精准营养与食品安全 09-28
-
第二届信息学、生物医学与系统生物学国 09-28
-
2026环境资源、清洁能源与可持续发 09-28
-
第三届纺织科学、材料工程与智能制造国 09-28
-
第二届林业工程、环境科学与可持续发展 09-28
-
2026 JCR影响因子正式发布2049
-
中国科协发布2025年《重要学术2146
-
2026年新锐分区(原中科院期刊10945
-
2025年两院院士增选有效候选人6679
-
好学术:科研网址导航|学术头条分9207
-
2025年国际期刊预警名单发布!9157
-
2025年中科院期刊分区表重磅发30335
-
吉林大学校长张希:学术会议中的提10134
-
清华大学2026年CCF计算经济09-28
-
北京清华长庚医院黄天荫团队合作构09-28
-
中国农业大学资环学院刘学军教授团09-28
-
中国科大实现液晶向列比特的可重构09-28
-
研究提出丽江云杉复合体分类界定新09-28
-
新型多孔压电陶瓷研制取得进展09-28
-
研究揭示二倍半萜衍生物治疗溃疡性09-28
-
西安浐灞生态区管委会 8781

-
博宁物资经销处 18729

-
华中科技大学同济医学院附属协和医 22069

-
上海亚化工程咨询有限公司 18916

-
百奥泰国际会议(大连)有限公司 24561

-
QQ 8791

-
Faculty of Music 8837

-
上海茂发会展服务有限公司 23916

-
ASTIRC 2938

-
辽宁省医学会学术部 18754

-
新疆大学 化学化工学院 23916

-
KLSD 21851

-
河南纳智博研会议服务有限公司 8765

-
新疆燕泰会议服务有限公司 18776

-
百奥泰集团 2768

-
北京易世众教育科技中心 18594

-
IAASE 23682

-
大连理工大学 23762

-
中国能源环保产业协会 3078

-
百奥泰国际会议(大连)有限公司 2682





















1257







































