阅读背景:

非完全信息博弈中的虚拟遗憾最小化(CFR)算法(附实现代码)_孤寂不及清夜长_cfr算法

来源:互联网 

一,简介

       前几年,AlphaGo兴起了机器学习的热潮。在围棋这种完全信息的零和博弈中,作为算法需要解决的仅仅只是如何搜索大规模博弈树的问题,但是在德州扑克这种非完全信息博弈的问题中往往还藏有欺骗诈唬等等手段。而且对比围棋每次下棋有限的策略(19*19个交叉点)德州扑克的策略几乎是无限的,专业选手往往押注在1000到十几万甚至百万美元,中间押注10000$和10500$也存在差距。所以由于德州扑克的种种特性,在AlphaGo 4:1战胜李世石的时候,同期的德州扑克还只能解决两人有限注的问题。       前几年,AlphaGo兴起了机器学习的热潮。在围棋这种完全信息的零




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: