L26 RL III

  • 本节 主要介绍 RL 的两个重要概念 --- Exploration 和 Exploitation

    • 其实我感觉这节的内容在RL I 已经涉及过了,而且 RL I 中讲的比这里更加全面和细节
  • 我们将讨论两种在探索和利用之间分配时间的方法:ε-贪婪策略和探索函数

  • ε-贪婪策略

    • 遵循ε-贪婪策略的智能体定义一个概率0 ≤ ε ≤ 1,并以概率ε随机行动和探索。相应地,他们以概率(1−ε)遵循当前已建立的策略并利用。这是一个非常简单的策略来实现,但仍可能相当难以处理。 ε 的值设定需要经验
  • Exploration Function

    • 通过探索函数避免了手动调整ε的问题,这些函数使用修改后的Q值迭代更新来给予访问较少的状态一定的优先级。修改后的更新如下:
      • \(Q(s,a)=(1-\alpha)Q(s,a)+\alpha \cdot [R(s,a,s')+\gamma max_{a'}f(s',a')]\)
      • \(f(s,a)=Q(s,a)+\frac{k}{N(s,a)}\)
        • k为某个预定的值,N(s,a)表示Q状态(s,a)被访问的次数
    • 其实本质上这个改动是类似于 UCB1 的