阅读背景:

强化学习系列<5>Policy Gradients

来源:互联网 
Policy Gradients  进行某一种的反向传递. 这种反向传递的目的是让这次被选中的行为更有可能在下次发生. 但是我们要通过 reward 进行某一种的反向传递. 这种反向传递的目的是让这次被选中的行为更


你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: