阅读背景:

《reinforcement learning:an introduction》第四章《Dynamic Programming》总结

来源:互联网 

注意,这一章讲的内容都是model-based的,即需要知道π(a|s)、P(s'|s,a)、R(s'|s,即需要知道π(a|s)、P(s'|s,a)、R(


你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: