- +1
2026AI科学盛典——图灵奖得主强化学习之父Richard Sutton(理查德·萨顿)主题演讲全文《AI人工智能的未来》
2月11日,理查德·萨顿(Richard Sutton,图灵奖得主,强化学习之父,现任阿尔伯塔大学计算机科学教授)在UCLA(加州大学洛杉矶分校)举办的2026年AI科学盛典,发表主题演讲《AI人工智能的未来》:

作者摘要: 在这次演讲中,我将提出三个重要观点。
首先,虽然今天的人工智能基于人类数据的学习,但未来的人工智能将基于经验学习,这将更强大,因为它能够持续学习新知识。
其次,人工智能的政治与人的政治相似;无论哪种情况,我们都应避免基于恐惧/安全的集中控制,寻求去中心化合作。
第三,人工智能可以被视为宇宙发展中不可避免的下一步重大进展,因此应当以勇气、自豪和冒险精神去拥抱它。
核心要点笔记(极简版)
一、开场:现在的 AI 被高估了
大家都在说 AI 飞速进步,但当所有人都这么想时,我们要质疑。
语言能力确实是突破,但生成图像 / 视频不是真正的智能。
现在 AI 强,只是因为用了巨量数据 + 巨量算力,不是真懂智能。
结论:当前 AI 是弱心智—— 知识多、但不可靠、没目标、不会自主学习。
二、到底什么是「智能」?
威廉・詹姆斯:用多变手段,达成稳定目标。
约翰・麦卡锡:为了达成目标而进行的计算能力。
我的定义:通过调整行为,实现目标的能力。
核心:有目标、能学习、会适应、可自主判断对错。
三、我们需要一门新科学:统一的「心智科学」
心理学只研究自然生物,AI 只做工程,都不完整。
强化学习 = 从经验中学习、与环境互动、试错、靠奖励信号改进
。
这最接近人和动物的真实学习,是统一心智科学的起点。
图灵 1947 年就提出过这个思路,比 AI 诞生还早。
四、AI 的三个时代(最重要趋势)
1、模拟时代
在游戏 / 仿真里学习(AlphaGo)。
2、人类数据时代
现在的大模型,抄人类已有知识,学不出新东西。
3、经验时代(未来)
智能体自主行动、自主探索、从互动中学习。
数据随能力变强而增长,能创造真正全新的知识。
结论:从经验中学习,才是通往超人类智能的路。
五、经验学习长什么样?
婴儿:自己玩、自己试、自己换玩具,主动产生学习数据。
迷宫智能体:目标不变、环境会变,但能持续适应、重新找路。
关键三要素:观测、动作、奖励。
有经验 = 有目标、有对错、有真理;没有经验,就没有真智能。
六、政治观点:反对集中控制,支持去中心化合作
现在很多 “AI 安全”,本质是要控制 AI。
这种逻辑和控制人、控制言论、控制贸易一模一样:靠恐惧、妖魔化对手。
人类与 AI 的未来:靠学习、开放、协作,不靠管控。
七、哲学高度:AI 是宇宙演化的下一步
宇宙四个时代:
1、粒子时代
2、恒星时代
3、复制者时代(生命靠复制繁衍)
4、设计时代(我们正在进入)
人类的角色:把 “设计” 推到极致的物种。
AI 的意义:设计出能自己设计、自己思考的新智能。
这不是入侵,是宇宙规律的自然一步。
八、终极三句话总结
1、现在 AI 靠人类数据,未来 AI 靠经验学习
2、要去中心化合作,不要集中控制
3、AI 是宇宙演化必然一步,人类应勇敢拥抱
九、现场问答精华
问:抛开人类舒适,这一切有终极目的吗?
答:
可以说:宇宙没有统一目的。
也可以说:宇宙自然走向更复杂、更智能。
真正答案:在两者之间,辩证统一。
以下正文为完整演讲内容(含Q&A问答环节):
作者:理查德·萨顿( Richard Sutton) &SAIR基金会 2026-2-11
译者:zzllrr小乐(数学科普公众号)2026-2-15
理查德·萨顿演讲全文
很高兴能和大家在线相聚,我真希望能亲自到场。从这么远的地方跟大家讲话,其实有点让人不安,但我听了上午的几场分享,大概知道了大家在思考什么。我也希望这场交流能尽量互动起来,所以大家随时可以发言、出声、提问,不用等我讲完。

理查德·萨顿( Richard Sutton )
我已经为互动做好准备了。就像我刚才说的,我听了前面几场演讲,然后突然想到,有些话我没提前准备,但很想说。所以我今天特意留出一点时间,又补了几页幻灯片,打算在正式内容开始前,先讲几句。
我们先从这个领域现在的状况说起。大家都是怎么看的?我想,所有人都觉得 AI 正在飞速进步,一切都令人兴奋。
但你知道吗,当所有人都这么想的时候,我们就该质疑一下了。
事情真的是这样吗?我们真的在飞速进步吗?
当然,计算机在熟练使用语言这方面确实取得了巨大进展,我认为这是一个真正的突破,实打实的突破。就在不久前,我们还不敢想象能用神经网络做到这件事,但现在已经完全被证实可行。
我们还利用海量算力生成了逼真的图像和视频。
但问题是:真正的智能、真正的心智,需要做这件事吗?
心智需要去生成图像吗?不需要。这恰恰是我们从来不需要做的事。
我们需要处理图像、处理视频,但不需要去生成它们。这不是心智的核心功能,它需要巨大的算力,很难实现,但并不是我们通常所说的“智能”的一部分。
当然,AI 也带来了全新的实际应用,催生了全新的产业和创造经济价值的新方式。但这些重要的新成果,大多只是超大规模算力 + 超大规模模式识别的应用。它们是很特定的东西,并不等于完整的智能。
很多东西本质上只是算力,我们只是把它叫作“智能”,因为这样听起来更厉害。

所以我必须问大家:AI 的科学本身,真的在飞速进步吗?
(笑声)
谢谢大家的笑声,我感觉自己像个奇迹。
在我看来,其实并没有。
我认为,现在的 AI 背后,理解很少,调参很多。
我们并不真正懂得心智的原理、智能的原理。
从科学角度看,很多方面都非常不尽如人意。
我倾向于这样看待现在的 AI 模型:
它们之所以强大,只是因为吸收了全人类的知识;但除此之外,它们很弱。
它们是弱心智:不可靠、容易跑题、东拉西扯。
除了知识量大,它们并没有多强的能力。
这也许是我们看待今天所谓“AI”的另一种角度。
那到底什么是 AI?
人工智能,我们必须先定义智能。
多年来有很多定义,我这里有几个比较权威的:

最早的一个来自心理学之父——威廉·詹姆斯。
1890 年,他没有直接谈智能,而是谈心智。
他说,心智的标志是:用多变的手段,达成稳定的目标。
也就是:改变你的行为,去得到一个稳定、你想要的结果。
你也可以问图灵:他怎么定义智能?
他没有留下一句完美名言,但一般认为,他的意思是:智能就是像人一样行为。
我们今天说的“图灵测试”,就是模仿人、假装是人。
但图灵本人从来没把它叫作“图灵测试”,我不觉得他称之为测试,他叫它模仿游戏。它本来不是一个测试。
但如今,“像人一样行为”已经成了智能的一个重要含义。
可我不认为这是我们真正强大的原因。
人之所以强大,是因为我们有智能;我们追求像人一样行为,但更重要的是:人到底是什么?
查字典的话,大概会说:
智能是获取并运用知识与技能的能力。
我觉得这个定义其实很不错,核心就是知识:获取知识、拥有知识、运用知识,还有技能。
再看 AI 这边。
AI 奠基人之一约翰·麦卡锡说:
智能是达成目标的能力中,负责计算的那一部分。
我很喜欢这个定义。
注意,它首先是一种能力,一种做事情的能力。
和所有能力一样,它有程度之分,不是“有或没有”,而是在多大程度上能达成目标。
而且是计算部分——不是靠力气、不是靠传感器,而是靠思考、靠计算去达成目标。
而达成目标,几乎是它的绝对核心。
这又回到威廉·詹姆斯:用多变手段达成稳定目标,就是拥有目标的意思。
我自己也有一个定义,稍微改了一下:
智能是:通过调整行为,来达成目标的能力。
当然,定义遍地都是,一个词能有六七个定义,就算权威定义也没那么神圣。
我们定义只是为了互相沟通,定义会随时间变化。
但如果定义差太远,就很难交流。
所以我用“智能”这个词时,指的就是:
通过调整行为来达成目标的能力。
关键就在于调整(适应)。
我认为学习很重要,获取知识和技能的过程本身很重要,不只是拥有它们。
这些是不同的观点。
我们再看现在主流的 AI:
基本全是算力、模式识别,很多时候只是在模仿人的行为。

再说说我个人的观点:
我认为我们需要一门新的科学——统一的心智科学。
这是我努力在做的事:一门整合的心智科学,同时适用于人、其他动物和机器。
因为所有这些心智,本质上都有共通之处。
人和动物的心智非常相似,而机器也开始出现共通点——至少我们希望在可预见的未来,机器心智会和自然心智有更多共性。
但目前,并没有一个现成的学科能胜任这件事。
心理学是心智科学吗?
它本可以是,但它越来越把自己定义为自然心智的研究:研究人和动物的心智,而不研究“心智本来可以是什么”、不研究机器里可能出现的通用心智。
人工智能关心机器,但不怎么关心其他东西,而且越来越变成工程学科:重在造东西,而不是理解原理,也不包含自然心智。
认知科学也往很多方向走,但主要还是偏向自然心智。
可惜,没有一个学科真正承担起跨物种、跨机器的统一心智科学这一角色。
而我正在做的强化学习,也许就是这门整合心智科学的开端。
因为它横跨很多领域。
简单说一下什么是强化学习(reinforcement learning):

它是以智能体为中心的学习,从经验中学习,通过与环境互动来达成目标。
在这个意义上,它比其他机器学习更真实、更有野心、更自主。
智能体主动行动,不一定有帮手,更自主、更独立,只靠与世界互动,看自己有没有达成目标,然后改变行为。
这也更符合现实:
动物在环境里并没有太多“帮助”,小时候也许有,但成年后基本没有。
强化学习的核心是试错、延迟反馈学习。
你只有一个奖励信号:最终有没有得到想要的东西?
这是最接近自然学习的机器学习。
它自己能判断对错。
大语言模型就做不到这一点,它不知道自己说的是对是错。
但如果你从经验中学习,你做了预测,就能看对不对;你做了动作,就能得到奖励,知道这种行为好不好。
所以这可能是一门既非自然科学、也非工程应用的心智科学的开端。
我还想引用图灵的一句话:“我们想要的,是一台能够从经验中学习的机器。” What we want is a machine that can learn from experience

图灵其实不知道自己是个“强化学习主义者”。
这段话来自 1947 年,那时候还没有强化学习,甚至还没有 AI。
据我们所知,这是世界上第一次公开发表关于人工智能的演讲。
好了,这些开场白我希望大家听得有意思。
今天我本来准备了好几个要点,可能讲不完,但我至少想讲第一个和最后一个。

第一个要点:
今天 AI 的科学趋势是什么?
核心结论是:
我们现在正处在从人类数据中学习的时代。

所有 AI 主要都在学习预测人类的下一个词、学习人类标注的图片,然后再由人类专家微调:我更喜欢这个答案,不喜欢那个。
现代机器学习的目的,本质上就是:
把人类已有的知识迁移到机器上,然后机器就被冻结,不再学习。
这就是我们所处的时代。
而我认为,我们正在触及这个时代的极限。
因为人类数据是有限的,我们已经用掉了互联网上大部分高质量资源、图片、视频。
而这种方法的根本局限是:
它学不到任何真正新的东西。
它无法产生真正全新的知识。
就像今天有人提到的,那些最难的数学难题、真正原创的东西,靠这种方法是做不到的,因为它只是在网上看别人说过什么,然后总结。
要继续前进,我们必须进入从经验中学习的新时代。
我们需要一种能随智能体能力提升而不断增长、不断变好的数据来源。
静态数据集永远不够用,而经验就能提供动态变化的数据。

人和动物就是这么学习的。
AlphaGo 那样的重大突破也是这么学习的,那些拿下奥数的 AI 系统也是。
我想给大家看一段视频。
先说明一下:我说的“从经验中学习”,不是什么玄乎的感受、主观体验,而是智能体和环境之间来回的数据:
- 智能体做的动作
- 从世界得到的观测
- 以及从世界返回的奖励信号(一个数值)
这三样东西,就是我说的经验。
这是我们与世界互动唯一能确定知道的东西。
我们需要一个随智能体变化而增长、升级的数据集。
这段视频展示的就是我们人生中最核心的学习方式:一个婴儿。
他在和所有玩具互动,玩腻一个就换下一个。
每遇到一个新东西,他就去学能学的一切。
我们人生的数据,是由我们自己的活动生成的,不是别人给的。
正因为是自己生成的,它才能匹配我们当下的理解水平和能力。
这是最基本的道理。
我还放了一个智能体在迷宫里学习的演示。

非常简单的智能体,从起点 S 到目标 G,只知道自己在哪个格子,只能上下左右行动。
它能学会最优路径,箭头就是它认为该走的方向,绿色代表它觉得每个状态有多好。
但世界不是静止的,世界会变,我们总要学习新东西。
我把目标移到上面,移到角落,加障碍物,它都能重新适应,找到新路径。
你会明显感觉到:它有目标,并且在环境变化时不断调整,尽力达成目标。
当然,目标也可能变得无法实现。
到那时,我们甚至会忍不住为这个无法达成目标的智能体感到一点惋惜。
我还有一个试错学习的演示,网上有很不错的版本,但我没能把视频放出来,我们就跳过吧。
我想大家已经明白“从经验中学习”的意思了。
我们再讲一点原理:

这种基于经验的 AI 的核心思想是:
整个智能的基础,就是智能体与世界交换信号——也就是经验。
这些信号是一切智能的核心与根基。
真理是什么?就是这些信号里发生的事。
目标是什么?也是这些信号。
你想让奖励信号尽可能高,达成或没达成,这是一种主观目标,只有主体能感知,但它也是最客观的东西——是智能体真实收到的数据。
我们说:一个智能体有多智能,就看它能多大程度预测和控制自己的经验。
注意:
大语言模型运行时,根本不从经验中学习。
经验是你出生后走进世界、做事、互动才有的。
大语言模型一旦上线,就被冻结、静止,不再学习。
它没有真正的经验,只有训练阶段里人类行为的示例数据。
没有经验,就没有智能可言。
没有目标,没有奖励,没有办法判断一件事比另一件事更好;
没有办法判断预测是对是错,因为智能体从不和真实发生的事情对比;
没有“真”的概念。
但有了经验、有了互动、有了数据,就有了明确目标:获得奖励;
也有了明确的真理:预测的真理。
你做预测,然后看事实是否发生,就知道对不对。
这就是基于经验的方法能做到的事。
我认为,这种方法会越来越普遍。
我们可以把最近十几年大致分成三个时代:

1. 模拟时代:从模拟经验中学习(AlphaGo、雅达利游戏)
2. 人类数据时代:也就是现在的大模型
3. 经验时代:智能体系统、自主行动、从真实互动中学习
我认为,第三个时代最终会带我们超越人类水平,不只是模仿人类,而是真正超越人类的局限。
总结

第一个要点:
AI 终于开始转向从经验中学习——其实图灵早在 1947 年就想这么做了。
这会比只从人类输入学习强大得多,因为它能持续学习新东西。
尽管今天有各种炒作甚至恐慌,但我认为当前 AI 并没有那么强。
它有点弱、不可靠,但超级有用,彻底点燃了整个行业,创造了巨大经济价值,人人可用,也激发了公众的热情,让大家开始相信:
总有一天,机器会达到与人相当的能力。
它用让人害怕的方式做到了这一点,但大家其实不必害怕,只是需要重视。
我们还没有抵达真正的重头戏——创造超级智能 AI、超级智能增强人类。
那才是大事,会带来深刻变革。
我本来还想谈谈政治,我就快速带过,差不多到最后一页了。

你放眼望去,今天有很多声音要求控制 AI:
只允许 AI 拥有人类审核授权的目标;
呼吁管控、叫停 AI 研究;
出台法律限制 AI 可用的算力;
成立各种安全机构。
人们说“安全”,其实往往是指控制。
他们让你害怕 AI,说 AI 不安全,然后由他们来控制。
这让我想到那些对人类进行集中控制的呼吁。
我希望我们能对 AI 抱有同情与共情。
就像有人控制言论、控制你能说什么、听什么;
控制贸易、关税、工作、资本流动、经济制裁。

核心是:
这些要求集中控制 AI 和控制人类的声音,极其相似,近乎诡异。
它们都基于恐惧:害怕 AI,害怕外国人,不信任对方,把对方妖魔化,说它们没有感情、不会痛苦。
我们应该抵制这种声音。
因为我相信:人类的繁荣,以及人类与 AI 共同的繁荣,来自学习与合作,来自去中心化,而不是大型控制机构。
人类擅长合作,也很不擅长合作——我们会发动战争。
合作不总是可能,但它是世界上一切美好事物的来源:经济、交流、政府、社会中所有好的东西,都来自合作。
我们必须追求合作、支持合作。
只要睁眼看,就能轻易分辨:谁在呼吁不信任、不合作。
而合作的反面,就是集中控制。
我们应该抵制这类呼吁。
这也是思考人类与 AI 关系的一个有用视角。
简单说完我对政治层面的想法。
最后,我想谈谈 AI 的哲学。
AI 正在发生,未来会更加迅猛。
我们该怎么看待它?
我想问一个最难的问题:

它是好是坏?我们该害怕吗?
它会抢走工作吗?会让人类过时吗?
还是说,我们会变成“被技术增强的人类”?
AI 是入侵者,还是我们的孩子?
我们该哀叹,还是庆祝?
它是我们,还是不是我们?
我认为这是最根本的问题。
我们经常被要求:别多想,只要害怕就行,因为它们不是我们,是异类。
但别忘了:是我们在创造它们。
理解自身心智,是最人性的事之一。

几千年来,我们一直在试图理解自己、理解人类智能、理解心智如何工作、如何变得更好。
AI 只是人类这项宏大追求的延续:理解我们自身如何运作。
我很喜欢一句话:
智能是宇宙中最强大的现象。
我们是它最好的范例,我们理应去理解它。
理解智能,是科学的圣杯、人文学科的圣杯,是一项伟大而光荣的目标。
作为学者、思考者,我们应该享受它、庆祝它、推动它前进。

我们先放下“希望它发生还是害怕它发生”,
只预测未来会发生什么。
我提出几条现实主义 AI 预测原则,有点像米尔斯海默谈现实主义地缘政治那样,只讲现实:
1. 世界该如何运行,没有共识。没有哪种意识形态、宗教能主导一切。
2. 总有一天,人类会充分理解智能,并用技术创造智能,而且一定会有人这么做。
3. 这个进程不会停止。现有人类的智能水平很快会被大幅超越,我们会拥有超级智能。
4. 长期来看,权力与资源会流向更智能的存在。
把这四点合在一起,画面就是:
人类正在通向 AI 接续的时代。
我认为这是合理的。

但我们可以稍微跳出人类中心视角,
从宇宙、从更宏大的角度看:这一切在宇宙中扮演什么角色?
我想讲得宏大一点:
宇宙的四个伟大时代。

1. 粒子时代:大爆炸之后,连原子都很少,后来塌缩形成恒星。
2. 恒星时代:恒星形成、发热、爆发、重元素诞生。
3. 复制者时代:有了重元素和行星,生命出现。我不叫它生命时代,因为关键是:这些东西能复制自己,即使不理解自己,也能复制自己。
我们现在就是这样:我们不理解身体如何运作、大脑如何工作、智能如何产生,但我们能生出更智能的孩子。
4. 设计时代:也就是我们现在进入的时代。不是靠复制,而是东西在被造出来之前,先存在于某个复制者的心智里。
你现在所在的礼堂、建筑、椅子、衣服,
都是先在设计者脑子里存在,然后才被造出来。
只有人本身是复制来的,不是被设计出来的。

所以我把它们叫作:
复制时代 vs 设计时代。
叫“生命时代”和“机器时代”已经过时、有误导性,
因为机器越来越像生命,而我们也越来越把生命看作生物机器。
真正的区别是:
- 生物:在不理解原理的情况下被复制出来,像复印机。
- 技术机器:先在设计者心智里被想象,再被创造。
而且,设计出来的东西更容易被修改、改进。
从这个角度看:

很多非人类复制者(你可以叫它们动物)也是设计者。
鸟筑巢、猩猩做工具、乌鸦加工树叶、人类造石斧、耕犁、电脑、飞船、工厂、软件——很多工具本身就是用来制造其他工具的。
现在我们可以回答最开始的问题:
人类是什么?我们在宇宙中的角色是什么?

不带傲慢、不带过度自我重要感地客观说:
人类很特别,我们不只是普通的复制者。
我们是把设计能力推向极致的复制者。
我们会复制,但我们更会设计,
而且把设计推到了所有其他生物无法企及的高度。
把设计推到极限意味着什么?
就是:
设计出本身就具备设计能力的东西。
在我们的心智里设计出,拥有自己心智、能够自主设计的存在。
而这,正是我们在做的人工智能。
我们正在完成宇宙的第四个伟大时代:设计时代。
人类,至少是催化剂、助产士、开创者。
这是我们的角色,一个重要、宇宙级的角色。
最后总结我三个核心观点:

1. 当下 AI 仍处于“人类数据时代”,很强,但我们正在进入“经验时代”,后者会更强大,因为能持续学习新知。
2. 当下 AI 的政治,与人类社会的政治如出一辙。我们应追求去中心化合作,而非集中控制。
3. 从哲学上看,AI 是宇宙演化中不可避免的下一步。我们应带着勇气、自豪与冒险精神去拥抱它。
非常感谢大家。
(掌声)
观众提问
(主持人)我们已经超时了,不过可以快速回答一两个问题。
有谁想问吗?

问:抛开让我们生活更舒适这一点,不考虑人类自身,这一切有没有一个更宏大的目的?整个发展方向,有没有一个终极意义?
答:这是个很棒的问题。
可以有很多种思考方式。很多伟大问题,都需要用辩证的方式回答:
答案是 X,同时答案也不是 X,然后在两者之间找到统一。
你可以说:
宇宙没有目的,因为每个部分各有各的目的,没有统一的终极目的。
但你也可以说:
宇宙有目的——它也许自然地走向越来越复杂的存在,自然地诞生生命,生命自然地走向设计者、走向 AI,之后也许还会走向别的东西。
正题、反题,然后合题。
我们必须在这两种对立答案之间,综合出一个属于自己的理解。
原标题:《2026AI科学盛典——图灵奖得主强化学习之父Richard Sutton(理查德·萨顿)主题演讲全文《AI人工智能的未来》》
本文为澎湃号作者或机构在澎湃新闻上传并发布,仅代表该作者或机构观点,不代表澎湃新闻的观点或立场,澎湃新闻仅提供信息发布平台。申请澎湃号请用电脑访问http://renzheng.thepaper.cn。





- 报料热线: 021-962866
- 报料邮箱: news@thepaper.cn
互联网新闻信息服务许可证:31120170006
增值电信业务经营许可证:沪B2-2017116
© 2014-2026 上海东方报业有限公司




