Policy Gradients 进行某一种的反向传递. 这种反向传递的目的是让这次被选中的行为更有可能在下次发生. 但是我们要通过 reward 进行某一种的反向传递. 这种反向传递的目的是让这次被选中的行为更 你的当前访问异常,请进行认证后继续阅读剩余内容。 提交