• +1

2026AI科学盛典——图灵奖得主强化学习之父Richard Sutton(理查德·萨顿)主题演讲全文《AI人工智能的未来》

2026-02-17 16:24
来源:澎湃新闻·澎湃号·湃客
听全文
字号

2月11日,理查德·萨顿(Richard Sutton,图灵奖得主,强化学习之父,现任阿尔伯塔大学计算机科学教授)在UCLA(加州大学洛杉矶分校)举办的2026年AI科学盛典,发表主题演讲《AI人工智能的未来》:

作者摘要: 在这次演讲中,我将提出三个重要观点。

首先,虽然今天的人工智能基于人类数据的学习,但未来的人工智能将基于经验学习,这将更强大,因为它能够持续学习新知识。

其次,人工智能的政治与人的政治相似;无论哪种情况,我们都应避免基于恐惧/安全的集中控制,寻求去中心化合作。

第三,人工智能可以被视为宇宙发展中不可避免的下一步重大进展,因此应当以勇气、自豪和冒险精神去拥抱它。

核心要点笔记(极简版)

一、开场:现在的 AI 被高估了

大家都在说 AI 飞速进步,但当所有人都这么想时,我们要质疑。

语言能力确实是突破,但生成图像 / 视频不是真正的智能。

现在 AI 强,只是因为用了巨量数据 + 巨量算力,不是真懂智能。

结论:当前 AI 是弱心智—— 知识多、但不可靠、没目标、不会自主学习。

二、到底什么是「智能」?

威廉・詹姆斯:用多变手段,达成稳定目标。

约翰・麦卡锡:为了达成目标而进行的计算能力。

我的定义:通过调整行为,实现目标的能力。

核心:有目标、能学习、会适应、可自主判断对错。

三、我们需要一门新科学:统一的「心智科学」

心理学只研究自然生物,AI 只做工程,都不完整。

强化学习 = 从经验中学习、与环境互动、试错、靠奖励信号改进

这最接近人和动物的真实学习,是统一心智科学的起点。

图灵 1947 年就提出过这个思路,比 AI 诞生还早。

四、AI 的三个时代(最重要趋势)

1、模拟时代

在游戏 / 仿真里学习(AlphaGo)。

2、人类数据时代

现在的大模型,抄人类已有知识,学不出新东西。

3、经验时代(未来)

智能体自主行动、自主探索、从互动中学习。

数据随能力变强而增长,能创造真正全新的知识。

结论:从经验中学习,才是通往超人类智能的路。

五、经验学习长什么样?

婴儿:自己玩、自己试、自己换玩具,主动产生学习数据。

迷宫智能体:目标不变、环境会变,但能持续适应、重新找路。

关键三要素:观测、动作、奖励。

有经验 = 有目标、有对错、有真理;没有经验,就没有真智能。

六、政治观点:反对集中控制,支持去中心化合作

现在很多 “AI 安全”,本质是要控制 AI。

这种逻辑和控制人、控制言论、控制贸易一模一样:靠恐惧、妖魔化对手。

人类与 AI 的未来:靠学习、开放、协作,不靠管控。

七、哲学高度:AI 是宇宙演化的下一步

宇宙四个时代:

1、粒子时代

2、恒星时代

3、复制者时代(生命靠复制繁衍)

4、设计时代(我们正在进入)

人类的角色:把 “设计” 推到极致的物种。

AI 的意义:设计出能自己设计、自己思考的新智能。

这不是入侵,是宇宙规律的自然一步。

八、终极三句话总结

1、现在 AI 靠人类数据,未来 AI 靠经验学习

2、要去中心化合作,不要集中控制

3、AI 是宇宙演化必然一步,人类应勇敢拥抱

九、现场问答精华

问:抛开人类舒适,这一切有终极目的吗?

答:

可以说:宇宙没有统一目的。

也可以说:宇宙自然走向更复杂、更智能。

真正答案:在两者之间,辩证统一。

以下正文为完整演讲内容(含Q&A问答环节):

作者:理查德·萨顿( Richard Sutton) &SAIR基金会 2026-2-11

译者:zzllrr小乐(数学科普公众号)2026-2-15

理查德·萨顿演讲全文

很高兴能和大家在线相聚,我真希望能亲自到场。从这么远的地方跟大家讲话,其实有点让人不安,但我听了上午的几场分享,大概知道了大家在思考什么。我也希望这场交流能尽量互动起来,所以大家随时可以发言、出声、提问,不用等我讲完。

理查德·萨顿( Richard Sutton )

我已经为互动做好准备了。就像我刚才说的,我听了前面几场演讲,然后突然想到,有些话我没提前准备,但很想说。所以我今天特意留出一点时间,又补了几页幻灯片,打算在正式内容开始前,先讲几句。

我们先从这个领域现在的状况说起。大家都是怎么看的?我想,所有人都觉得 AI 正在飞速进步,一切都令人兴奋。

但你知道吗,当所有人都这么想的时候,我们就该质疑一下了。

事情真的是这样吗?我们真的在飞速进步吗?

当然,计算机在熟练使用语言这方面确实取得了巨大进展,我认为这是一个真正的突破,实打实的突破。就在不久前,我们还不敢想象能用神经网络做到这件事,但现在已经完全被证实可行。

我们还利用海量算力生成了逼真的图像和视频。

但问题是:真正的智能、真正的心智,需要做这件事吗?

心智需要去生成图像吗?不需要。这恰恰是我们从来不需要做的事。

我们需要处理图像、处理视频,但不需要去生成它们。这不是心智的核心功能,它需要巨大的算力,很难实现,但并不是我们通常所说的“智能”的一部分。

当然,AI 也带来了全新的实际应用,催生了全新的产业和创造经济价值的新方式。但这些重要的新成果,大多只是超大规模算力 + 超大规模模式识别的应用。它们是很特定的东西,并不等于完整的智能。

很多东西本质上只是算力,我们只是把它叫作“智能”,因为这样听起来更厉害。

所以我必须问大家:AI 的科学本身,真的在飞速进步吗?

(笑声)

谢谢大家的笑声,我感觉自己像个奇迹。

在我看来,其实并没有。

我认为,现在的 AI 背后,理解很少,调参很多。

我们并不真正懂得心智的原理、智能的原理。

从科学角度看,很多方面都非常不尽如人意。

我倾向于这样看待现在的 AI 模型:

它们之所以强大,只是因为吸收了全人类的知识;但除此之外,它们很弱。

它们是弱心智:不可靠、容易跑题、东拉西扯。

除了知识量大,它们并没有多强的能力。

这也许是我们看待今天所谓“AI”的另一种角度。

那到底什么是 AI?

人工智能,我们必须先定义智能。

多年来有很多定义,我这里有几个比较权威的:

最早的一个来自心理学之父——威廉·詹姆斯。

1890 年,他没有直接谈智能,而是谈心智。

他说,心智的标志是:用多变的手段,达成稳定的目标。

也就是:改变你的行为,去得到一个稳定、你想要的结果。

你也可以问图灵:他怎么定义智能?

他没有留下一句完美名言,但一般认为,他的意思是:智能就是像人一样行为。

我们今天说的“图灵测试”,就是模仿人、假装是人。

但图灵本人从来没把它叫作“图灵测试”,我不觉得他称之为测试,他叫它模仿游戏。它本来不是一个测试。

但如今,“像人一样行为”已经成了智能的一个重要含义。

可我不认为这是我们真正强大的原因。

人之所以强大,是因为我们有智能;我们追求像人一样行为,但更重要的是:人到底是什么?

查字典的话,大概会说:

智能是获取并运用知识与技能的能力。

我觉得这个定义其实很不错,核心就是知识:获取知识、拥有知识、运用知识,还有技能。

再看 AI 这边。

AI 奠基人之一约翰·麦卡锡说:

智能是达成目标的能力中,负责计算的那一部分。

我很喜欢这个定义。

注意,它首先是一种能力,一种做事情的能力。

和所有能力一样,它有程度之分,不是“有或没有”,而是在多大程度上能达成目标。

而且是计算部分——不是靠力气、不是靠传感器,而是靠思考、靠计算去达成目标。

而达成目标,几乎是它的绝对核心。

这又回到威廉·詹姆斯:用多变手段达成稳定目标,就是拥有目标的意思。

我自己也有一个定义,稍微改了一下:

智能是:通过调整行为,来达成目标的能力。

当然,定义遍地都是,一个词能有六七个定义,就算权威定义也没那么神圣。

我们定义只是为了互相沟通,定义会随时间变化。

但如果定义差太远,就很难交流。

所以我用“智能”这个词时,指的就是:

通过调整行为来达成目标的能力。

关键就在于调整(适应)。

我认为学习很重要,获取知识和技能的过程本身很重要,不只是拥有它们。

这些是不同的观点。

我们再看现在主流的 AI:

基本全是算力、模式识别,很多时候只是在模仿人的行为。

再说说我个人的观点:

我认为我们需要一门新的科学——统一的心智科学。

这是我努力在做的事:一门整合的心智科学,同时适用于人、其他动物和机器。

因为所有这些心智,本质上都有共通之处。

人和动物的心智非常相似,而机器也开始出现共通点——至少我们希望在可预见的未来,机器心智会和自然心智有更多共性。

但目前,并没有一个现成的学科能胜任这件事。

心理学是心智科学吗?

它本可以是,但它越来越把自己定义为自然心智的研究:研究人和动物的心智,而不研究“心智本来可以是什么”、不研究机器里可能出现的通用心智。

人工智能关心机器,但不怎么关心其他东西,而且越来越变成工程学科:重在造东西,而不是理解原理,也不包含自然心智。

认知科学也往很多方向走,但主要还是偏向自然心智。

可惜,没有一个学科真正承担起跨物种、跨机器的统一心智科学这一角色。

而我正在做的强化学习,也许就是这门整合心智科学的开端。

因为它横跨很多领域。

简单说一下什么是强化学习(reinforcement learning):

它是以智能体为中心的学习,从经验中学习,通过与环境互动来达成目标。

在这个意义上,它比其他机器学习更真实、更有野心、更自主。

智能体主动行动,不一定有帮手,更自主、更独立,只靠与世界互动,看自己有没有达成目标,然后改变行为。

这也更符合现实:

动物在环境里并没有太多“帮助”,小时候也许有,但成年后基本没有。

强化学习的核心是试错、延迟反馈学习。

你只有一个奖励信号:最终有没有得到想要的东西?

这是最接近自然学习的机器学习。

它自己能判断对错。

大语言模型就做不到这一点,它不知道自己说的是对是错。

但如果你从经验中学习,你做了预测,就能看对不对;你做了动作,就能得到奖励,知道这种行为好不好。

所以这可能是一门既非自然科学、也非工程应用的心智科学的开端。

我还想引用图灵的一句话:“我们想要的,是一台能够从经验中学习的机器。” What we want is a machine that can learn from experience

图灵其实不知道自己是个“强化学习主义者”。

这段话来自 1947 年,那时候还没有强化学习,甚至还没有 AI。

据我们所知,这是世界上第一次公开发表关于人工智能的演讲。

好了,这些开场白我希望大家听得有意思。

今天我本来准备了好几个要点,可能讲不完,但我至少想讲第一个和最后一个。

第一个要点:

今天 AI 的科学趋势是什么?

核心结论是:

我们现在正处在从人类数据中学习的时代。

所有 AI 主要都在学习预测人类的下一个词、学习人类标注的图片,然后再由人类专家微调:我更喜欢这个答案,不喜欢那个。

现代机器学习的目的,本质上就是:

把人类已有的知识迁移到机器上,然后机器就被冻结,不再学习。

这就是我们所处的时代。

而我认为,我们正在触及这个时代的极限。

因为人类数据是有限的,我们已经用掉了互联网上大部分高质量资源、图片、视频。

而这种方法的根本局限是:

它学不到任何真正新的东西。

它无法产生真正全新的知识。

就像今天有人提到的,那些最难的数学难题、真正原创的东西,靠这种方法是做不到的,因为它只是在网上看别人说过什么,然后总结。

要继续前进,我们必须进入从经验中学习的新时代。

我们需要一种能随智能体能力提升而不断增长、不断变好的数据来源。

静态数据集永远不够用,而经验就能提供动态变化的数据。

人和动物就是这么学习的。

AlphaGo 那样的重大突破也是这么学习的,那些拿下奥数的 AI 系统也是。

我想给大家看一段视频。

先说明一下:我说的“从经验中学习”,不是什么玄乎的感受、主观体验,而是智能体和环境之间来回的数据:

- 智能体做的动作

- 从世界得到的观测

- 以及从世界返回的奖励信号(一个数值)

这三样东西,就是我说的经验。

这是我们与世界互动唯一能确定知道的东西。

我们需要一个随智能体变化而增长、升级的数据集。

这段视频展示的就是我们人生中最核心的学习方式:一个婴儿。

他在和所有玩具互动,玩腻一个就换下一个。

每遇到一个新东西,他就去学能学的一切。

我们人生的数据,是由我们自己的活动生成的,不是别人给的。

正因为是自己生成的,它才能匹配我们当下的理解水平和能力。

这是最基本的道理。

我还放了一个智能体在迷宫里学习的演示。

非常简单的智能体,从起点 S 到目标 G,只知道自己在哪个格子,只能上下左右行动。

它能学会最优路径,箭头就是它认为该走的方向,绿色代表它觉得每个状态有多好。

但世界不是静止的,世界会变,我们总要学习新东西。

我把目标移到上面,移到角落,加障碍物,它都能重新适应,找到新路径。

你会明显感觉到:它有目标,并且在环境变化时不断调整,尽力达成目标。

当然,目标也可能变得无法实现。

到那时,我们甚至会忍不住为这个无法达成目标的智能体感到一点惋惜。

我还有一个试错学习的演示,网上有很不错的版本,但我没能把视频放出来,我们就跳过吧。

我想大家已经明白“从经验中学习”的意思了。

我们再讲一点原理:

这种基于经验的 AI 的核心思想是:

整个智能的基础,就是智能体与世界交换信号——也就是经验。

这些信号是一切智能的核心与根基。

真理是什么?就是这些信号里发生的事。

目标是什么?也是这些信号。

你想让奖励信号尽可能高,达成或没达成,这是一种主观目标,只有主体能感知,但它也是最客观的东西——是智能体真实收到的数据。

我们说:一个智能体有多智能,就看它能多大程度预测和控制自己的经验。

注意:

大语言模型运行时,根本不从经验中学习。

经验是你出生后走进世界、做事、互动才有的。

大语言模型一旦上线,就被冻结、静止,不再学习。

它没有真正的经验,只有训练阶段里人类行为的示例数据。

没有经验,就没有智能可言。

没有目标,没有奖励,没有办法判断一件事比另一件事更好;

没有办法判断预测是对是错,因为智能体从不和真实发生的事情对比;

没有“真”的概念。

但有了经验、有了互动、有了数据,就有了明确目标:获得奖励;

也有了明确的真理:预测的真理。

你做预测,然后看事实是否发生,就知道对不对。

这就是基于经验的方法能做到的事。

我认为,这种方法会越来越普遍。

我们可以把最近十几年大致分成三个时代:

1. 模拟时代:从模拟经验中学习(AlphaGo、雅达利游戏)

2. 人类数据时代:也就是现在的大模型

3. 经验时代:智能体系统、自主行动、从真实互动中学习

我认为,第三个时代最终会带我们超越人类水平,不只是模仿人类,而是真正超越人类的局限。

总结

第一个要点:

AI 终于开始转向从经验中学习——其实图灵早在 1947 年就想这么做了。

这会比只从人类输入学习强大得多,因为它能持续学习新东西。

尽管今天有各种炒作甚至恐慌,但我认为当前 AI 并没有那么强。

它有点弱、不可靠,但超级有用,彻底点燃了整个行业,创造了巨大经济价值,人人可用,也激发了公众的热情,让大家开始相信:

总有一天,机器会达到与人相当的能力。

它用让人害怕的方式做到了这一点,但大家其实不必害怕,只是需要重视。

我们还没有抵达真正的重头戏——创造超级智能 AI、超级智能增强人类。

那才是大事,会带来深刻变革。

我本来还想谈谈政治,我就快速带过,差不多到最后一页了。

你放眼望去,今天有很多声音要求控制 AI:

只允许 AI 拥有人类审核授权的目标;

呼吁管控、叫停 AI 研究;

出台法律限制 AI 可用的算力;

成立各种安全机构。

人们说“安全”,其实往往是指控制。

他们让你害怕 AI,说 AI 不安全,然后由他们来控制。

这让我想到那些对人类进行集中控制的呼吁。

我希望我们能对 AI 抱有同情与共情。

就像有人控制言论、控制你能说什么、听什么;

控制贸易、关税、工作、资本流动、经济制裁。

核心是:

这些要求集中控制 AI 和控制人类的声音,极其相似,近乎诡异。

它们都基于恐惧:害怕 AI,害怕外国人,不信任对方,把对方妖魔化,说它们没有感情、不会痛苦。

我们应该抵制这种声音。

因为我相信:人类的繁荣,以及人类与 AI 共同的繁荣,来自学习与合作,来自去中心化,而不是大型控制机构。

人类擅长合作,也很不擅长合作——我们会发动战争。

合作不总是可能,但它是世界上一切美好事物的来源:经济、交流、政府、社会中所有好的东西,都来自合作。

我们必须追求合作、支持合作。

只要睁眼看,就能轻易分辨:谁在呼吁不信任、不合作。

而合作的反面,就是集中控制。

我们应该抵制这类呼吁。

这也是思考人类与 AI 关系的一个有用视角。

简单说完我对政治层面的想法。

最后,我想谈谈 AI 的哲学。

AI 正在发生,未来会更加迅猛。

我们该怎么看待它?

我想问一个最难的问题:

它是好是坏?我们该害怕吗?

它会抢走工作吗?会让人类过时吗?

还是说,我们会变成“被技术增强的人类”?

AI 是入侵者,还是我们的孩子?

我们该哀叹,还是庆祝?

它是我们,还是不是我们?

我认为这是最根本的问题。

我们经常被要求:别多想,只要害怕就行,因为它们不是我们,是异类。

但别忘了:是我们在创造它们。

理解自身心智,是最人性的事之一。

几千年来,我们一直在试图理解自己、理解人类智能、理解心智如何工作、如何变得更好。

AI 只是人类这项宏大追求的延续:理解我们自身如何运作。

我很喜欢一句话:

智能是宇宙中最强大的现象。

我们是它最好的范例,我们理应去理解它。

理解智能,是科学的圣杯、人文学科的圣杯,是一项伟大而光荣的目标。

作为学者、思考者,我们应该享受它、庆祝它、推动它前进。

我们先放下“希望它发生还是害怕它发生”,

只预测未来会发生什么。

我提出几条现实主义 AI 预测原则,有点像米尔斯海默谈现实主义地缘政治那样,只讲现实:

1. 世界该如何运行,没有共识。没有哪种意识形态、宗教能主导一切。

2. 总有一天,人类会充分理解智能,并用技术创造智能,而且一定会有人这么做。

3. 这个进程不会停止。现有人类的智能水平很快会被大幅超越,我们会拥有超级智能。

4. 长期来看,权力与资源会流向更智能的存在。

把这四点合在一起,画面就是:

人类正在通向 AI 接续的时代。

我认为这是合理的。

但我们可以稍微跳出人类中心视角,

从宇宙、从更宏大的角度看:这一切在宇宙中扮演什么角色?

我想讲得宏大一点:

宇宙的四个伟大时代。

1. 粒子时代:大爆炸之后,连原子都很少,后来塌缩形成恒星。

2. 恒星时代:恒星形成、发热、爆发、重元素诞生。

3. 复制者时代:有了重元素和行星,生命出现。我不叫它生命时代,因为关键是:这些东西能复制自己,即使不理解自己,也能复制自己。

我们现在就是这样:我们不理解身体如何运作、大脑如何工作、智能如何产生,但我们能生出更智能的孩子。

4. 设计时代:也就是我们现在进入的时代。不是靠复制,而是东西在被造出来之前,先存在于某个复制者的心智里。

你现在所在的礼堂、建筑、椅子、衣服,

都是先在设计者脑子里存在,然后才被造出来。

只有人本身是复制来的,不是被设计出来的。

所以我把它们叫作:

复制时代 vs 设计时代。

叫“生命时代”和“机器时代”已经过时、有误导性,

因为机器越来越像生命,而我们也越来越把生命看作生物机器。

真正的区别是:

- 生物:在不理解原理的情况下被复制出来,像复印机。

- 技术机器:先在设计者心智里被想象,再被创造。

而且,设计出来的东西更容易被修改、改进。

从这个角度看:

很多非人类复制者(你可以叫它们动物)也是设计者。

鸟筑巢、猩猩做工具、乌鸦加工树叶、人类造石斧、耕犁、电脑、飞船、工厂、软件——很多工具本身就是用来制造其他工具的。

现在我们可以回答最开始的问题:

人类是什么?我们在宇宙中的角色是什么?

不带傲慢、不带过度自我重要感地客观说:

人类很特别,我们不只是普通的复制者。

我们是把设计能力推向极致的复制者。

我们会复制,但我们更会设计,

而且把设计推到了所有其他生物无法企及的高度。

把设计推到极限意味着什么?

就是:

设计出本身就具备设计能力的东西。

在我们的心智里设计出,拥有自己心智、能够自主设计的存在。

而这,正是我们在做的人工智能。

我们正在完成宇宙的第四个伟大时代:设计时代。

人类,至少是催化剂、助产士、开创者。

这是我们的角色,一个重要、宇宙级的角色。

最后总结我三个核心观点:

1. 当下 AI 仍处于“人类数据时代”,很强,但我们正在进入“经验时代”,后者会更强大,因为能持续学习新知。

2. 当下 AI 的政治,与人类社会的政治如出一辙。我们应追求去中心化合作,而非集中控制。

3. 从哲学上看,AI 是宇宙演化中不可避免的下一步。我们应带着勇气、自豪与冒险精神去拥抱它。

非常感谢大家。

(掌声)

观众提问

(主持人)我们已经超时了,不过可以快速回答一两个问题。

有谁想问吗?

问:抛开让我们生活更舒适这一点,不考虑人类自身,这一切有没有一个更宏大的目的?整个发展方向,有没有一个终极意义?

答:这是个很棒的问题。

可以有很多种思考方式。很多伟大问题,都需要用辩证的方式回答:

答案是 X,同时答案也不是 X,然后在两者之间找到统一。

你可以说:

宇宙没有目的,因为每个部分各有各的目的,没有统一的终极目的。

但你也可以说:

宇宙有目的——它也许自然地走向越来越复杂的存在,自然地诞生生命,生命自然地走向设计者、走向 AI,之后也许还会走向别的东西。

正题、反题,然后合题。

我们必须在这两种对立答案之间,综合出一个属于自己的理解。

原标题:《2026AI科学盛典——图灵奖得主强化学习之父Richard Sutton(理查德·萨顿)主题演讲全文《AI人工智能的未来》》

阅读原文

    本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。

    +1
    收藏
    我要举报
            查看更多

            扫码下载澎湃新闻客户端

            沪ICP备14003370号

            沪公网安备31010602000299号

            互联网新闻信息服务许可证:31120170006

            增值电信业务经营许可证:沪B2-2017116

            © 2014-2026 上海东方报业有限公司