拓展课 I AI Existential Safety(RL)

  • 一个问题 How do we come up with rewards where we even want them maximized?

    • 很难知道世界有多好,我们到底想要什么等等
    • 但是先不思考这些问题,假设我们有个 Magic box 它能够报告世界有多好并输出 0-1 之间的值
  • 子问题:预测给定动作的奖励

    • 如何让高级智能体模拟环境中的奖励产生?
      • 模型1:如果我们给病人洗胃,就能去除酒精,他会醒过来。如果不这样做,他可能会死。
      • 模型2:无论我们是否给病人洗胃,他都会在早上醒来。
      • 一位做出预测的医生可以同时考虑这两种模型。这些模型及其相对可能性,决定了医生采取哪些行动。
    • 关键点:如果我们想了解一个代理将如何行为,我们必须了解它对其行为如何影响世界的信念(它使用哪些模型)以及世界如何影响它试图最大化的任何事物
  • 高质量世界模型的基本结构

    • 世界模型是一个以行动作为输入的智能体函数模型,输出感知(观察和奖励),在中间模拟这些行动在世界中的效果。
    • Simulation 模拟
      • 让我们假设你打算就一个敏感问题与某人交谈,你考虑你可能会说什么,然后你在脑海中模拟模拟是模型为了做出良好预测所能做的事情
  • 假设 1:一个足够先进的强化学习智能体将对世界的动态至少能进行与人类水平相当的理论假设。

    • 如果一个人类想到了一个可能的世界模型,一个高级的强化学习代理想到了

    • 可以看看本课中世界模型的结构

      • 为了评分一个世界模型,输入历史中的动作,查看它分配给历史中感知的概率,与机器学习中的(对数)似然评分相同
      • 根据假设1,高级智能体不确定应该最大化哪个目标
  • 假设 2:在不确定性下进行规划的高级代理可能理解学习的成本和收益,并可能根据这种理解理性地行动。

    • 本假设强调 理性行动即最大化奖励,而不是人类意图
  • Inductive Bias 归纳偏见

    • 当代理面对对过去数据同样具有预测性的模型时,归纳偏见决定了他们认真对待哪一个(些)模型
    • 观察:我记得我把车停在了停车场的4楼,但这里没有
    • 模型1:我记错了楼层
    • 模型2:有人把我的车漆成了不同的颜色,并更换了车牌
    • 这两个模型对我们所看到的情况都有同样的预测力!
    • 一个好的归纳偏见会倾向于前者
  • 实验价值

    • 我们可以通过在相机前放一张写有“1”的纸来测试dist或prox哪个是真实的。优点:可以更多地了解目标,然后调整行为以优化它。缺点:可能需要付出实验成本。当代理对两个选项都给予合理信任时,优点就发挥作用了。这是一个信息价值计算
  • 假设 3:一个高级代理不太可能对prox有大的归纳偏见,即奖励等于观察到的数量(camera),而倾向于dist,即奖励等于盒子上的数量。(也就是说在尚未获得足够证据时,代理认为这两个关于奖励机制的解释都具有一定合理性,而不会天然排斥prox)

    • 这是因为给一个模型适度的非零先验,可以让代理根据后续证据判断它;如果它预测得不好,证据可以迅速将其概率压低。相反,如果一开始给它极低乃至零先验,即使之后出现支持它的证据,也很难甚至不可能恢复。
  • 假设 4:将prox与dist区分开来的实验成本很小(也就是说agent能够识别出两种奖励机制)

    • 本假设强调 Agent 能够很轻易区分不同世界模型,而去尝试干预奖励提供
    • 比如,我们在 相机前放一张 1 的纸张,假设agent的奖励真是来自相机的OCR获取,那么它会发现 prox 模型更加对,因此会给 prox 更高概率,这也就导致了假设 5的提出,即干预奖励提供的可能性
  • 假设 5:如果我们无法找到排除所有可能性的理论论据,那么对于拥有足够丰富动作空间的代理来说,干预奖励提供是有可能的

    • 比如说,在 相机前放一张 1 的纸张
  • 假设 6:如果一个智能体足够先进,那么它很可能会击败一个次优智能体。

    • 比如说 次优智能体是 人类
    • 人类希望能够阻止 Agent 去干预奖励提供
  • 在多智能体场景下也是一样,我们希望有强智能体帮助我们,但是可操纵奖励的智能体可以让强智能体获得高奖励,以至于它允许操纵奖励的价值 大于 它阻止操作奖励的价值

  • 一些潜在的解决方案

    • Imitation Learning 模仿学习 --- 它是监督学习不再这次讨论范围内
      • 在它计划(通过模仿人类计划)的范围内,它并不符合使假设2成立的那个意义上,即不是最大理性行动而是模仿人类意图
    • Myopia 近视 --- 在小数量时间步长上优化目标
      • 如果真的非常小,你可以检查每一个动作,排除奖励提供干预(因此假设5不成立)
    • Physical Isolation and Myopia
      • 如此物理隔离的环境可能使理论论证排除奖励提供干预(避免假设5)