前文介绍了函数近似来预测V函数,但是还没涉及到行动和控制,这篇文章就来谈谈用近似Q函数来控制和行动。
回顾前文动态规划(DP)解决MDP我们用迭代+Greedy的方法寻找最优策略
同样的,在使用近似函数之后,也可以使用类似的方法
分为两个步骤
第一步,进行策略评估,当然这里是用近似函数,将w带入
第二步,策略改善,及用Ɛ-greedy的方法行动并调整参数w,如何行动就要涉及到Q函数了,这个会在后文介绍。
与DP不同的地方是,由于是采用近似函数,所以一开始并不能达到最优q函数q,只能在不断迭代qw之后最终接近q
与V函数一样,Q函数也可以有近似函数的表达方式
最小化均方差(损失函数):
同样的可以用特征向量的线性函数(线性组合)来作为Q函数的近似函数:
此时,与V函数一样
TD算法在更新参数时不遵循任何目标函数的梯度是导致它在离线策略或使用非线性近似函数可能会发散的原因,我们可以通过修改TD算法使得它遵循Projected Bellman Error的梯度进而收敛,这就是Gradient TD 的算法,但是课程中并没详细讲解该算法的原理。
之前的那篇文章是从应用的角度介绍了DQN,下一篇文章将会从理论的角度介绍批方法(Batch Methods)以及利用批方法实现DQN解决非线性近似函数对控制学习无法收敛的问题。