在强化学习中,策略规定了智能体在与环境交互时如何选择动作。它将智能体可获取的信息映射为一个动作或动作上的概率分布。策略描述的是行为,而不是环境的动态变化规律或各个结果所对应的奖励。强化学习是机器学习的一个分支,其核心目标之一是学习使长期期望奖励最大化的策略。策略可以被显式表示并加以优化,也可以由动作价值估计和动作选择规则隐式确定。(spinningup.openai.com)
数学定义
在完全可观测的马尔可夫决策过程(MDP)中,平稳随机策略通常写为
对于每个状态 ,它都定义了可选动作上的概率分布。当动作离散时,各个动作的概率均非负,且总和为一。确定性策略则选择单个动作,通常写为 。这里的确定性指的是智能体的选择规则:即使环境中的状态转移具有随机性,智能体仍可采用确定性策略。(spinningup.openai.com)
平稳策略在每个决策时刻都使用相同的规则。非平稳策略则可能显式依赖时间,例如 。这一区别在有限时域问题中尤为重要,因为随着剩余时间减少,最优动作可能发生变化。平稳性并不意味着学习算法在训练过程中始终不改变策略;它描述的是某一具体策略不显式依赖时间。(hankyang.seas.harvard.edu)
MDP 的状态满足马尔可夫性质,因此,在给定动作后,仅凭当前状态就足以预测后续状态转移。在部分可观测马尔可夫决策过程中,智能体接收到的是观测,而非完整状态。因此,策略可以利用观测历史或内部记忆,包括由循环神经网络维护的表示。仅对最新观测作出反应,可能会丢失与决策有关的信息。(hankyang.seas.harvard.edu)
回报、价值与最优性
对策略的评估依据是它在一系列交互中产生的后果。一个常见目标是折扣回报的期望值:
其中, 是初始状态分布。折扣因子控制后续奖励在回报中所占的权重。有限时域内的总奖励是另一种目标。仅使即时奖励最大化,并不一定能使回报最大化,因为动作会影响未来的状态和机会。(spinningup.openai.com)
价值函数估计遵循某一策略时的回报。状态价值 假定智能体从状态 出发并遵循策略 ;动作价值 则假定智能体先执行动作 ,随后遵循策略 。这些量满足贝尔曼方程,将即时奖励与后续价值联系起来。对于离散动作,
因此,策略负责选择动作,而价值函数负责评估这些动作的预期后果。(spinningup.openai.com)
对于奖励有界、以无限时域折扣回报为目标的有限 MDP,存在最优确定性平稳策略。如果已知最优动作价值,该策略就可以选择任意一个使动作价值最大化的动作:
可能有多个动作并列最优。这一存在性结论针对的是上述 MDP 设定,并不适用于所有带约束、部分可观测或经过其他修改的决策问题。(hankyang.seas.harvard.edu)
表示与学习
规模较小的策略可以用动作表或动作概率表表示。规模更大的问题则采用函数逼近,例如使用以 为参数的人工神经网络。对于离散动作,Softmax函数可以将网络输出转换为概率。对于连续动作,策略可以直接输出动作,也可以给出一个分布,例如参数随状态变化的正态分布。(spinningup.openai.com)
将策略表示与学习联系起来的算法思路主要有以下几种:
- 基于价值的学习:Q学习估计动作价值,再通过选择规则根据这些估计值确定行为。
- 策略优化:策略梯度方法直接调整策略参数,以提高期望回报。
- 联合学习:演员—评论家方法同时学习负责选择动作的演员和负责估计价值的评论家。(spinningup.openai.com)
策略梯度更新使用动作对数概率的梯度,并以回报或优势的估计值对其加权。优势衡量的是某个动作的价值相对于当前策略下状态价值的高低。在相关假设成立时,基于价值的基线可以降低估计量的方差,而不改变策略梯度的期望。近端策略优化使用替代目标函数;其截断版本消除了某些使概率比率变化过大的激励,而不是对每一次策略变化都施加严格界限。(spinningup.openai.com)
探索与数据收集
在学习过程中,动作选择必须处理探索与利用的权衡:是利用当前看来较有希望的动作,还是尝试其他动作,以发现可能更好的行为方式。ε贪心策略通常选择贪心动作,但偶尔也会采样一个探索性动作。随机策略通过从动作分布中采样来进行探索;确定性策略则可以通过向动作添加噪声来收集探索经验。仅有随机性并不能保证探索充分。(hankyang.seas.harvard.edu)
行为策略负责生成用于训练的交互数据,目标策略则是被评估或改进的策略。在离策略学习中,这两种策略可以不同。同策略方法则使用被评估或改进的策略所生成的交互数据进行学习,具体方式取决于算法的更新流程。这一区别涉及数据收集与学习之间的关系,而非策略是确定性的还是随机的。例如,确定性演员—评论家算法可以采用离策略学习,同时在其行为策略中添加探索噪声。(spinningup.openai.com)