理查德·萨顿 WAIC 思想者论坛主题分享:强化学习的第一线—从经验培育超级智能
2026年7月19日 · 48:07
本期收录2024年图灵奖得主、现代强化学习奠基人理查德·萨顿(Richard Sutton)在2026年WAIC思想者论坛的主题演讲《强化学习的第一线:从经验培育超级智能》。萨顿重申“苦涩的教训”——短期把人类知识塞进AI总有成效,但长期突破永远来自计算规模、搜索与学习,主张让超级智能像婴儿一样从观察、动作与奖励信号构成的经验中自主生长,而非依赖人类预编码的知识。他系统提出OAK架构(选项与知识):智能体为每个奖励尊重的状态特征创建“特征达成子问题”,解决子问题产生选项(策略加终止决策),再为选项学习转移模型并用价值迭代实现规划,从而形成“新特征—新子问题—新选项”的开放式抽象循环;他强调所有知识都只是对大世界的极度近似,学习、规划与抽象必须在运行时间发生,而深度持续学习仍是最大瓶颈,还需以生成式测试而非梯度下降做元学习。在问答环节,他预测2030年有四分之一、2040年有二分之一的概率深层理解智能;直言大语言模型已有局限、其他方法有空间,并称自己与Yann LeCun的JEPA是“兄弟”,分歧交由时间验证;他主张AI应像婴儿一样拥有自己的目标和奖励信号而非讨好人类评分,认为人类不应随意决定AI生死,AI为善应包括所有智能存在。