- +1
具身智能的“ChatGPT时刻”何时到来?王兴兴:快则两到三年,慢则五到十年
8月20日,“人形机器人第一股”宇树科技登陆科创板次日,该公司创始人、董事长王兴兴在2026世界机器人大会上发表题为《从展品到产品:人形机器人产业的下一个十年》主题演讲。

王兴兴演讲
他表示,当前机器人产业正站在人工智能加速发展的新起点,但通用机器人真正进入家庭和日常生产生活,仍有赖于具身智能泛化能力取得关键突破,现阶段该领域最大的发展瓶颈仍然是具身智能的泛化能力不足。
王兴兴认为,判断具身智能是否迎来类似ChatGPT的产业临界点,可以采用一个相对直观的标准:将一台机器人带入任意陌生环境或普通家庭后,它能够根据语音、语言指令,自主完成约80%的任务。(在80%的陌生场景中,通过语音或文字指令,机器人能够顺利完成大约80%的任务)。
从时间上看,王兴兴给出了相对乐观的判断,最快可能需要两至三年,最慢可能需要五年甚至十年。
王兴兴在演讲中进一步分析了当前机器人AI模型存在的技术瓶颈。他指出,目前全球不少AI模型,在固定场景中经过充足的数据采集和专项训练后,任务成功率基本可以接近100%。但只要更换操作物品,或是稍微改变环境,机器人的任务成功率就会出现大幅下降。
他认为,这主要是因为AI模型的输入-输出与真实世界有偏差导致,大语言模型完全由数字编码组成,严格限制在向量空间里,输入-输出基本不会有太大损失,但对机器人来说,每次输入-输出都有偏差和损失,这导致目前全世界机器人模型的泛化能力和成功率稍有偏差,
“我认为未来几年是必然可以解决的问题。”王兴兴表示。
这一瓶颈也直接制约着机器人在家庭和工厂中的规模化应用。王兴兴以宇树科技G1机器人近年来在工厂、会议室整理、医疗场景等落地情况为例,指出通过实践,现阶段机器人已经能够完成部分装配和整理任务,但整体效率和泛用性不高,与人类相比仍有差距。面对新任务时,机器人通常还需要重新采集数据和训练,任务迁移效率有待进一步提高。
王兴兴指出,这不仅是宇树科技面临的问题,也是目前全球大家共同面临的瓶颈。
在模型技术路线上,宇树科技重点关注端到端模型和世界模型。王兴兴介绍,公司早在2020年初就开始探索基于视频生成的世界模型,虽然早期效果并不理想,相关工作一度放缓,但从2025年开始,公司再次加大了对这一方向的投入。目前,AI模型已经成为宇树科技资金和人力投入最大的方向之一。
王兴兴还介绍,近期宇树正在推动的是让物理AI机器人模型实现自我进化。
简单来理解,这是一套用目前最前沿、最顶尖的AI大模型驱动,宇树公司在内部设定规则和约束等,让AI自己去完成搜索、编程、生成机器人控制代码工作。
王兴兴表示,生成之后,可以在仿真环境里完成试运行,再部署到实物机器人上进行测试和打分。训练完成之后,再由AI模型和人工进行评价,确定效果如何再把结果反馈给编程智能体,形成正向训话。
为什么这么做?王兴兴表示,随着每个月、每年基础模型的提升、持续净化,自进化循环本身的能力也会同步增强。“它是非常良性,某种意义上可以跟随整个全球AI技术进步”。此外,可以更高效地使用多元数据,单纯依靠人工处理数据效率相对较低;通过自循环,可以综合利用各种训练数据,包括真实世界数据和人的数据。随着真机部署数量增加,系统还可以获得更多测试数据和评价指标,从而持续提高数据利用效率,并推动数据积累走向规范化。
王兴兴称,这套逻辑形成体系并运行起来以后,整个机器人的开发效率会高很多,迭代速度也会非常快。
此次演讲中,王兴兴也回顾了宇树科技十年来的发展历程。王兴兴介绍,公司成立于2016年8月,早期主要研发四足机器人,近年来逐步拓展至人形机器人。
他表示,在人工智能加速发展、全球关注度持续提高的背景下,机器人的进化速度已经显著加快。未来十年的产业发展速度,甚至可能超过当前预期。
“这是一个全新的起点、全新的开始。”王兴兴说。
澎湃科技注意到,8月20日,宇树科技上市次日低开6.51%,开盘报790元。
以下是王兴兴演讲全文(略有编辑):
各位嘉宾,大家好。非常荣幸在此作分享。
首先回顾一下公司的情况。宇树科技成立于2016年8月,到现在将近十年。公司最早从事四足机器人研发,最近几年开始做人形机器人。我们2024年推出的G1,是近几年比较成功的一款产品,推出后基本成为全球一个标杆性的产品。
今年年初,我们参加了总台春晚《武BOT》节目的演出。这个节目融合了中国经典功夫文化,我们提前采集了几十个中国功夫动作,经过AI训练后,把精彩动作呈现在舞台上。
这个节目最大的亮点,是将当前全球前沿的人形机器人技术与中国传统功夫文化结合起来。节目在海外传播得非常好,播放量可能达到数百亿次。我认为,这是一个非常好的科技与文化交流案例。
今年2月,我们还在北京天坛进行了机器人集群演示,现场共有49台机器人参与表演。天坛拥有数百年的历史,当机器人出现在现场时,有一种穿越时空的感觉——中国数百年的传统文化与当前最新的机器人技术交融在一起,给人非常强烈的震撼感。
过去几年,我们一直在推动机器人真正走进生活、进入工厂工作。2024年,我们开始与汽车工厂合作,探索机器人在汽车生产中的落地应用,也在自己的工厂里部署机器人,开展一些简单的测试。公司绝大部分AI团队都在研究如何让机器人真正进入家庭和工厂工作。
为什么我们现在没有大规模推广呢?最主要的原因是机器人的效率和泛化性能力还是不够高。虽然机器人已经能够完成一些简单装配任务,但与人相比,效率仍然较低。每当出现新的任务,机器人通常还需要重新训练,整体效率会进一步下降。所以我们希望能把泛化性做的更好的情况下,再进行大规模推广,这是全球机器人行业共同面对的最大瓶颈。
今年4月,H1人形机器人的奔跑速度达到约10米每秒,刷新了人形机器人奔跑速度的世界纪录,已经非常接近人类顶尖运动员的奔跑速度。这款机器人基于我们2023年推出的第一代人形机器人改制而来。
现在的机器人基本都是由AI驱动,而AI本质上是由数据驱动的。拥有多少数据,特别是拥有多少高质量数据,在很大程度上决定了AI模型的能力。所以我们正在自行采集数据,也在与第三方公司合作,采集更多数据供行业和公司使用。
从现阶段看,真正用于AI机器人训练的数据,还是以海量真人数据和互联网数据为主,再加上部分真机数据。这两类数据都非常重要,但从量上说真人数据可能会需要更多一些,而真机在真实世界中产生的数据同样不可或缺,因为我们需要让机器人真正与物理世界实现匹配。
今年5月,我们发布了量产版载人变形机甲GD01。这款机甲身高三米左右,载人后重量约为500公斤。简单来说,它有点像一辆越野车,并不是主要用于家庭或城市环境,而是可以应用于户外徒步以及复杂环境中的运输等场景。
这款机甲还可以变形成四足模式。在四足模式下,它的稳定性和越障能力更好,这也是我们将其推向预售的一个重要原因。
前几个月,我们还演示了基于多模态模型和端到端技术的AI动作自动生成。以往很多机器人动作都需要提前训练,而这套系统可以根据实时语音生成动作。
由于动作是根据实时语音生成的,目前仍会存在一定延迟。系统需要先完成语音识别,再上传到云端,由云端进行AI动作生成和动作验证,确认没有问题后再下发给机器人,整个过程需要几秒钟。
我们希望,未来机器人在实际应用中,动作能够完全实时生成,而不是依赖提前编程。自动生成也存在一个特点:即使向机器人发出同一句话,它今天和明天生成的动作也可能略有差异。
我们还在推动机器人真正进入会议室工作。公司内部的会议室有时也会比较杂乱,因此,会议室整理是一个具有实际价值的应用场景。
我们在一个会议室中进行数据采集和训练,将会议室中的物品任意打乱后,机器人可以把它恢复到干净整洁的状态。由于整个过程采用端到端模型实现,目前机器人的运动效率仍然相对较慢。
这一场景中设置了七至八项不同任务,机器人可以使用一个模型在不同任务之间自动切换,同时具备一定的抗干扰能力。由于机器人需要实时识别环境并生成动作,每走一步都要进行推理,所以动作还不够流畅。相关演示视频采用一镜到底的方式拍摄,没有经过剪辑。
会议室整理具有一定实用价值,同时任务难度相对适中,因此是我们认为非常值得推进的应用方向。
在此基础上,我们还进行了语音驱动机器人工作的演示。此前的语音生成主要解决动作问题,不涉及交互和实际工作;新的演示则让机器人在语音驱动下完成具体任务。
例如,用户可以要求机器人把指定颜色的药盒放到相应位置,也可以询问机器人看到了几盒药。机器人通过多模态模型识别物体后,可以回答药盒的数量和颜色,并根据指令完成搬运。这套系统具备一定的抗干扰能力,并不是简单执行固定动作。
前段时间,我们还发布了新一代轻量化轮足机器人As2-W。这款机器人重量约20多公斤,负载能力和续航能力较强,并具备一定的防雨水能力,可以在室内和室外使用。较轻的重量使它在日常生活和工业场景中使用时更加方便。
我们把一部分人形机器人技术应用到四足机器人上,使四足机器人的灵活性得到进一步提升。我们希望这类机器人能够真正应用于户外徒步等场景。
前段时间,我们还预览了一款新的机器人。这款机器人目前开发了三个多月,还不是正式发布的产品。它的最高速度已经达到12.65米每秒,超过了人类历史上最快运动员的奔跑速度,跳跃高度也超过了人类历史上的最高纪录。
2025年,我本人、公司的产品以及宇树科技都登上了《时代》杂志的相关榜单。
回顾近几年具身智能AI模型的发展,目前主要有VLA模型和世界模型两条技术路线。今年,大家可能听到更多的是世界模型。宇树科技一直在加大对AI模型的投入,这也是目前公司资金和人力投入最大的方向。
2020年初,我们就开始探索基于视频生成的世界模型,但当时的效果并不理想,因此中间搁置了一段时间。从2025年开始,我们再次大力发展基于视频生成的世界模型。
很多人都关心,真正通用的机器人,无论是人形机器人还是半人形机器人,什么时候才能进入生活和家庭。
目前,全球具身智能面临的最大瓶颈仍然是泛化能力不足。在固定场景中,只要进行充分的数据采集和训练,很多AI模型的任务成功率基本可以接近100%;但只要更换操作物品,或者稍微改变周边环境,任务成功率就会出现非常明显的下降。
我希望,进展较快可能需要两至三年,慢一点可能需要五年甚至十年。如果有一天,我们把一台机器人带入任意陌生环境或普通家庭,它能够通过语音或文字指令完成约80%的任务,我认为就基本实现了具身智能的“ChatGPT时刻”。
这将是机器人产业真正的临界爆发点,判断标准也相对简单:把一台机器人带入陌生环境,它能够根据语言指令完成约80%的任务。
要达到这一目标,目前最大的瓶颈,是AI模型的输入和输出与真实机器人、真实物理世界的对齐程度不够。
现有机器人模型在执行移动、装配或者搬运等任务时,整体方向通常没有问题,基本能够理解并执行任务。真正的问题出现在最后几厘米甚至几毫米。机器人无法很好地修正这些细微偏差,也无法与真实世界实现足够精确的匹配。
例如,当机器人伸手抓取一个物体时,从视觉上看已经接近抓住,但最后一点触觉反馈和细微误差可能无法得到有效修正,最终导致任务成功率大幅下降。
这是目前全球具身智能面临的最大瓶颈:AI模型的输入和输出与真实世界之间仍然存在偏差。
为什么机器人会出现这一问题,而一般的语言模型或多模态模型相对不明显?语言模型处理的是经过数字编码的文字,输入和输出被严格限制在相应的向量空间中,通常不会产生较大偏差,信息损失也相对较小。
但对机器人来说,每进行一次输入和输出,都可能产生偏差和损失。这是目前机器人模型泛化能力和任务成功率仍然不足的重要原因。不过,我认为这个问题在未来几年一定可以得到解决,只是还需要一些时间。
接下来介绍一下我们正在推动的一项工作。
过去几年,大家已经广泛使用AI进行编程和AI开发,但在机器人研发领域,对AI的使用仍然相对不足。
我们近期正在推动物理AI机器人模型的自进化。具体来说,就是使用当前前沿的AI大模型驱动机器人研发,同时由我们设定规则、经验、约束条件和工具,使智能体能够自主搜索最新论文、研究成果和开源方案,并自主编写机器人控制代码。
代码生成后,可以先在仿真环境中运行和验证,再用于控制实体机器人。我们会把相关程序部署到实体机器人上进行测试,并对测试结果作出评价和打分。
一部分评价可以由机器人AI模型完成,另一部分由人工参与。人的经验非常重要,因为人能够很容易判断机器人的动作和任务执行效果是好还是坏。
如果这套逻辑形成完整体系并运行起来,机器人的开发效率会得到明显提高,迭代速度也会进一步加快。只要这一流程持续运行,就有望真正提升机器人的自我进化能力。
目前,一些编程智能体已经可以自主编写机器人控制代码。对于部分相对简单的深度强化学习算法,智能体的自动编程效果已经不错。
这些代码首先在仿真环境中验证,训练完成后再部署到实体机器人上测试。测试完成后,由AI模型和人工进行评价、打分,判断实际效果,再将评价结果反馈给编程智能体,由其继续修改和优化代码,从而形成正向循环。
这里展示的只是一个最简单的示例,真正应用时会更加复杂。我认为,这是当前以及未来几年全球机器人行业非常值得推进的一项工作。
为什么要这样做?主要有几个原因。
第一,随着基础模型能力逐月、逐年提升,自进化循环本身的能力也会进一步增强。这是一个良性循环,某种意义上可以持续受益于全球AI技术的进步。
第二,自循环机制可以更加高效地使用多元数据。单纯依靠人工处理和使用数据,效率相对较低。通过自循环,我们可以综合利用各种训练数据,包括真实世界数据和人的数据,从而提高数据使用效率。
随着实体机器人的部署数量不断增加,系统可以获得更多测试数据和评价指标,数据利用率和增长速度也能得到保证,并逐步实现数据积累的规范化。
第三,机器人每天、每月获得的新技能可以持续保存和积累,而不是今天开发出一个技能,明天又把它浪费掉。真正利用AI大幅提高机器人的开发效率和进化效率,是未来非常值得推进的一件事。
我认为,这可能开启物理AI机器人自进化的新纪元,未来会有越来越多的人和企业推动这一方向。
过去将近十年,宇树科技也多次参加世界机器人大会。我们大概在2017年或2018年第一次参会,对行业这些年的变化感受非常深刻。
站在新的十年起点上,特别是在AI加速发展、全球关注度不断提高的背景下,机器人的进化速度已经显著加快。未来的发展速度,可能比我现在预估的还要更快。
这是一个全新的起点、全新的开始。
谢谢大家。





- 报料热线: 021-962866
- 报料邮箱: news@thepaper.cn
互联网新闻信息服务许可证:31120170006
增值电信业务经营许可证:沪B2-2017116
© 2014-2026 上海东方报业有限公司




