DQN:
两个重要的突破:
1. experience reply: 把每步agent经历状态,奖励,动作储存到经验池里,然后mini-batch采样来更新网络,这样可以打破样本之间的强依赖,稳定网络的更新 1. experience reply: 把每步a
两个重要的突破:
1. experience reply: 把每步agent经历状态,奖励,动作储存到经验池里,然后mini-batch采样来更新网络,这样可以打破样本之间的强依赖,稳定网络的更新 1. experience reply: 把每步a