oka架构

📅 2026/7/21 22:33:15 👁️ 阅读次数 📝 编程学习
oka架构

去年Rich Sutton 在 Alberta Plan for AI 会议上的演讲: 通往强 AI 的路径是强化学习,而非大语言模型


一、为什么需要 Oak 架构

AI 的目标是理解人类思维、并放大人类能力,这是堪比生命起源的智识里程碑。但当前 AI 的发展路线(以大语言模型为代表)偏离了真正智能的本质。

当前 AI 的核心问题:

维度现状(LLM 路线)Sutton 的主张
学习时机Design time(设计阶段训练)Run time(运行时在线学习)
知识来源大量离线训练数据纯粹从运行时经验中学习
领域依赖高度依赖特定领域数据Domain general,不内置任何领域知识
抽象能力固定架构,无法随经验增长开放式的抽象层次,按需构建

“The biggest bottleneck is we have inadequate learning algorithms.”


二、Oak 架构的三大设计目标

  1. Domain general(领域通用):架构本身不应包含任何特定于某个世界的知识
  2. Experiential(从经验中学习):心智应从运行时经验中生长,而非从特殊训练阶段产生
  3. Open-ended(开放式):抽象的复杂度和层次无上限,仅受计算资源限制

Design time vs Run time

  • Design time(设计阶段):在工厂里被构建,内置领域知识
  • Run time(运行时):智能体在世界中交互、从经验中学习、针对所处世界的特定部分做规划

大语言模型的一切工作都在 design time 完成,部署后不再学习。Oak 架构则相反,所有重要的事情都要在 run time 完成——在线、在岗(on the job)

Big World(庞大世界)假设

智能体相对它所面对的世界是渺小的,无法在工厂中预知世界的一切细节。因此:

  • 想学到任意开放式的抽象,必须在 runtime 完成
  • 必须由世界本身告诉智能体哪些抽象是对的

三、两个关键设计问题的回答

Sutton 连续抛出两个问题来约束 Oak 的设计哲学:

问题 1:智能体的设计是否应该反映它将被使用的世界?

  • 如果追求性能:应该内置领域知识,让它能立刻表现良好
  • 如果追求概念简洁性(理解心智如何运作):不应该

Oak 的选择:后者。设计应该与具体世界无关,仅基于原理而非错综复杂的领域细节。

引用 Sutton 自述的"苦涩的教训"(Bitter Lesson)精神:

“The actual contents of minds are part of the arbitrary, intrinsically complex outside world. They are not what should be built in as their complexity is endless. Instead, we should build in only the meta methods that can find and capture this arbitrary complexity. We want agents that can discover like we can, not which contain what we have already discovered.”

问题 2:智能体应该从特殊训练数据中学习,还是只从运行时经验中学习?

Oak 的选择:仅从运行时经验学习(entirely experiential)

论证逻辑:

  1. 某些事情必须在 runtime 做(学到的抽象会改变、做世界模型、规划……)
  2. 如果这些事情能在 runtime 做,那么所有事情都应该在 runtime 做
  3. 这样能得到一个概念上更简洁的设计

四、Oak 名称的由来

O来自Options andKnowledge。

  • Option(选项):在 Sutton 的定义中,option 是 (policy, termination) 这一对——一个行为策略,加上一个决定何时停止该行为的条件(他故意省略了 initiation set)
  • Knowledge(知识):在 Oak 中,智能体将拥有大量 options,知识就是"跟随某个 option 会发生什么"

通过学习 options 及其后果,智能体构建出高层转移模型(high-level transition model),从而能以更大跳跃做规划,并沿世界的关节处切割(carve the world at its joints)。


五、Oak 的整体愿景

Sutton 用一个图形化比喻描述 Oak 的目标:寻找 AI 的"圣杯"(holy grail)。

理想的 AI 设计具备:

  • Domain general(不内嵌任何世界特定知识)
  • 概念上简洁(principles-based,而非细节堆砌)
  • 能在线学习高层结构

这与追求"立刻就能跑得好"的应用导向工程形成鲜明对比。Sutton 明确表示:

“My quest is the latter”——他的目标是获得对心智的概念性理解,而非某个具体应用的最佳性能。


六、Oak 与 Alberta Plan 的关系

Sutton 提到他遵循 Alberta Plan for AI Research(他和 Michael、Patrick 等人几年前提出的研究框架)。Oak 是该计划下的具体智能体架构提案,被视为通往"理解心智"这一终极目标的路径之一。


总结

  1. 强化学习是通往强 AI 的必经之路,而非大语言模型这类非经验性的方法
  2. 学习算法才是最大瓶颈,不是算力或数据规模
  3. 真正的智能必须从经验中诞生,且应在运行时持续学习
  4. 架构应保持领域无关,只内置能发现和捕获任意复杂性的元方法
  5. 抽象必须是开放式的,随经验无限扩展,仅受计算资源限制