阅读背景:

深度强化学习汇总

来源:互联网 

DQN:

两个重要的突破:
1. experience reply: 把每步agent经历状态,奖励,动作储存到经验池里,然后mini-batch采样来更新网络,这样可以打破样本之间的强依赖,稳定网络的更新 1. experience reply: 把每步a




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: