L26 RL III
-
本节 主要介绍 RL 的两个重要概念 --- Exploration 和 Exploitation
- 其实我感觉这节的内容在RL I 已经涉及过了,而且 RL I 中讲的比这里更加全面和细节
-
我们将讨论两种在探索和利用之间分配时间的方法:ε-贪婪策略和探索函数
-
ε-贪婪策略
- 遵循ε-贪婪策略的智能体定义一个概率0 ≤ ε ≤ 1,并以概率ε随机行动和探索。相应地,他们以概率(1−ε)遵循当前已建立的策略并利用。这是一个非常简单的策略来实现,但仍可能相当难以处理。 ε 的值设定需要经验
-
Exploration Function
- 通过探索函数避免了手动调整ε的问题,这些函数使用修改后的Q值迭代更新来给予访问较少的状态一定的优先级。修改后的更新如下:
- \(Q(s,a)=(1-\alpha)Q(s,a)+\alpha \cdot [R(s,a,s')+\gamma max_{a'}f(s',a')]\)
- \(f(s,a)=Q(s,a)+\frac{k}{N(s,a)}\)
- k为某个预定的值,N(s,a)表示Q状态(s,a)被访问的次数
- 其实本质上这个改动是类似于 UCB1 的
- 通过探索函数避免了手动调整ε的问题,这些函数使用修改后的Q值迭代更新来给予访问较少的状态一定的优先级。修改后的更新如下: