阅读背景:

强化学习—DQN算法原理详解

来源:互联网 

强化学习—DQN算法原理详解

一、 概述

强化学习算法可以分为三大类:value based, policy based 和 actor critic。常见的是以DQN为代表的value based算法,这种算法中只有一个值函数网络,没有policy网络,以及以DDPG,TRPO为代表的actor-critic算法,这种算法中既有值函数网络,又有policy网络。强化学习算法可以分为三大类:




你的当前访问异常,请进行认证后继续阅读剩余内容。

分享到: