从前面的讨论中,应该清楚的是,强化学习很大程度上依赖于状态的概念。他既作为对策略和值函数的输入,也作为模型的输入和输出。非正式地,我们可以把状态看作是传达给代理的某种特定时期“环境如何”的信号。状态的形式定义在第3章中给出的马尔可夫决策过程的框架中给出的。然而,更普遍的是,我们鼓励读者遵循非正式的含义,并将状态视为代理对其环境所能获得的任何信息。实际上,我们假设状态信号是由某些预处理系统产生的,而预处理系统是代理环境的一部分。在本书中,我们没有讨论构造、改变或学习状态信号的问题。我们采取这种做法不是因为我们认为状态不重要,而是为了充分关注决策问题。换言之,我们主要关心的不是设计状态信号,而是设计行为函数以应对各种状态。(我们在第17.3章的最后节章中简单介绍了状态的设计和建设)。 从前面的讨论中,应该清楚的是,强化学习很大程度上依赖于状态的概念。他既作为对策略和值函