L1 Introduction

  • 我们应该 build 怎样的AI

    • Think like people ?
    • Act like people?(Turing 图灵)
    • Think rationally?(Aristotle 亚里士多德)
    • Act rationally? ---- 本课程采用这套说法
  • Rational Decisions

    • 我们将以非常具体、技术性的方式使用“理性”(Rational)这个术语:
      • Rational: 最大限度地实现既定目标
      • 目标以结果效用(utility of outcomes)来表述
      • 世界是不确定的,所以我们将使用预期效用(expected utility)
      • 理性(Be rational)意味着采取行动以最大化你的预期效用
  • 几种对 Intelligence的看法

    • skills-based 技能
    • embodiment 具身
    • psychometrics 心理测试学
      • 测量能力,而非技能 [...] 在广泛的任务范围内,包括之前对能力启用系统和其开发者而言未知的能力任务
    • Human-compatible 人类兼容
      • 机器的目标是最大化人类效用
      • 最初对人类偏好不确定
      • 必须了解人类行为中的偏好
  • 人类的Brain是怎样的

    • 大脑(人类思维)在做出理性决策方面非常出色,但并不完美
    • 大脑不像软件那样模块化,所以很难逆向工程
    • AI可能在某些任务上比大脑更出色
    • "大脑之于智力,犹如翅膀之于飞行"
    • 我们目前还不能在脑的规模上构建Al
      • 人类大脑中约100万亿(100T)个突触与GPT-4中约1.8万亿(1.8T)个权重相比
    • 大脑仍可以为AI提供巨大的灵感!
  • A short History of AI

  • Designing A Rational Agent

    • An agent is an entity that perceives and acts
    • A rational agent selects actions that maximize its (expected) utility
    • 感知、环境和动作空间的特点决定了选择合理行动的技术
  • Reflex Agent vs Planning Agent

    • 反射型智能体评估从当前状态采取的行动(后的状态)(一轮),而前瞻型智能体评估更远的未来状态
    • 它们的界限本就是 fuzzy 的可以不用太在意
  • 定义任务环境

    • 为了定义任务环境,我们使用==PEAS(性能度量、环境、执行器、传感器)描述==
    • P性能度量描述了智能体试图增加的效用。
    • E环境总结了智能体行动的地方以及影响智能体的因素。
    • A执行器和S传感器是智能体对环境施加影响和从环境中获取信息的方法。
  • 几种常见任务环境

    • 在==部分可观测环境==中,智能体无法获得关于状态的全部信息,因此智能体必须对世界状态有一个内部估计。这与==完全可观测环境==形成对比,在完全可观测环境中,智能体拥有关于其状态的全部信息
    • ==随机环境==在状态转移模型中存在不确定性,即在某些特定状态下采取行动可能有多个可能的结果,且每个结果有不同的概率。这与==确定性环境==形成对比,在确定性环境中,在某个状态下采取行动只有一个确定会发生的结果
    • 在==多智能体环境==中,智能体与其他智能体一起在环境中行动代理可能需要随机化其行为以避免被其他代理“预测” --- (这个有点意思,感觉在PRM中可能可以用到,让PRM避免被预测)
    • 如果环境在智能体对其采取行动时没有发生变化,那么这个环境被称为==静态环境==。这与智能体与环境交互时发生变化的==动态环境==形成对比。
    • 如果一个==环境具有已知的物理特性==,那么过渡模型(即使是不确定的)对智能体来说是已知的,它可以在规划路径时使用这一点。如果==物理特性未知==,智能体将需要采取有意的行动来学习未知的动力学。
  • 最重要的几个Topics --- 该课程的核心内容

    • Search & Planning
      • 如何找到实现目标的一系列行动?
    • Probability & Inference
      • 如何理解不确定性?
    • Supervised & Learning
      • 如何从数据中学习世界?
    • Reinforcement Learning
      • 如何学习应对任何情况的策略以最大化效用?