Q学习是一种无模型的强化学习算法,用于学习在特定状态下采取特定动作的长期价值。它无需环境转移概率或奖励的显式模型,就能寻找最优决策规则。克里斯托弗·沃特金斯于1989年提出这一方法,沃特金斯与彼得·戴扬于1992年给出了详细的收敛性证明。该方法将基于经验的学习与动态规划联系起来:通过观测到的状态转移,逐步改进对最优动作价值的估计。(gatsby.ucl.ac.uk)
数学框架
标准框架是马尔可夫决策过程(MDP)。在时刻 ,智能体观测状态 ,选择动作 ,获得奖励 ,并到达状态 。马尔可夫性质意味着,下一状态和奖励的分布取决于当前状态与动作,而非完整的交互历史。(arxiv.org)
动作价值函数 表示:在状态 下采取动作 ,随后遵循策略 时,折扣累积奖励的期望值。Q学习估计的是最优函数 。一旦知道该函数,在每个状态下选择使 最大的动作,就能得到最优策略。(gatsby.ucl.ac.uk)
当折扣因子满足 时,最优动作价值满足贝尔曼最优方程:
更新规则
对于每次观测到的转移 ,单步Q学习更新相应的条目:
其中, 是学习率。方括号内的量是时序差分误差,即由即时奖励和估计的未来价值构成的目标值与当前估计值之差。这属于自举,因为已有的预测构成了学习目标的一部分。如果此次转移使任务在终止状态结束,未来价值项就为零。(incompleteideas.net)
在表格形式中,每个状态—动作对都单独存储一个值。实现时,先初始化这张表,再反复选择动作、观测结果并执行更新。与基于模型的价值迭代不同,它使用采样得到的结果,而不是利用已知的转移概率,对所有可能的后继状态显式求取加权平均。(gatsby.ucl.ac.uk)
举例来说,假设当前估计值为 ,奖励为 ,下一状态的最大估计值为 ,且 、。目标值为 ,因此更新后的值为 。这一次更新使估计值向观测到的目标值靠近,但并不能确定该动作的真实价值。
离策略学习与探索
Q学习是一种离策略学习方法:生成经验的策略不必是更新目标所对应的贪心策略。智能体可以采取探索性动作,同时学习后续采用最优选择时的价值。不过,要使学习有效,仍须充分覆盖各个状态—动作对。(incompleteideas.net)
一种常见的行为规则是采用ε-贪心策略选择动作。智能体以概率 随机选择动作,否则选择估计价值最高的动作。这种规则用于处理获取信息与利用现有知识之间的探索与利用权衡。(incompleteideas.net)
相关算法SARSA则使用实际选定的下一动作的价值,其目标值为 。因此,SARSA学习的是其行为策略的价值,其中也包括探索性动作;而Q学习通过取最大值来定义贪心目标,该目标与实际采取的下一动作无关。(incompleteideas.net)
收敛性及其适用范围
在有限、平稳的MDP中,若奖励有界、折扣因子小于一,并满足适当的采样和步长条件,表格型Q学习以概率一收敛到 。每个状态—动作对都必须被访问无穷多次。对于每一对,其依次使用的学习率 必须满足
这些随机逼近条件既保证了足够的累积调整量,又逐渐减弱采样噪声的影响。(arxiv.org)
该定理是渐近意义上的结论,并不保证有限次数的训练会产生最优策略。其表格形式的假设也不能自动推广到任意函数逼近方法。共享参数可能使一次更新影响多个状态—动作对的估计值,从而改变学习的动态特性。(gatsby.ucl.ac.uk)
深度Q学习及其变体
对于大型观测空间,深度Q网络(DQN)使用人工神经网络而非表格来表示动作价值。姆尼赫及其同事展示了如何利用卷积神经网络和经验回放从雅达利游戏画面中学习。经验回放会存储转移数据,并从中采样,用于后续更新。(arxiv.org)
2015年的DQN系统还使用了一个独立且定期更新的目标网络,以稳定学习目标。该系统在49款雅达利游戏上进行了评估,展示了深度学习如何将基于价值的强化学习扩展到高维视觉输入。这些实证结果并未证明神经网络也具备表格型方法的收敛保证。(nature.com)
普通Q学习可能高估价值,因为取最大值的操作更容易选中带有正误差的估计值。哈多·范·哈塞尔于2010年提出的双Q学习,将动作选择与价值评估分配给两个不同的估计器,以减轻这一效应。它的估计也可能低估价值,并不能消除所有误差来源。后来的Double DQN将这一原理应用于基于神经网络的动作价值学习。(papers.neurips.cc)