开场十年0:00
尊敬的各位领导 、 各位嘉宾 , 大家好 , 非常荣幸在此做分享 。 然后, 首先的话是回顾一下我们公司的情况 。
像我们公司的话是 16 年成立的 , 到现在为止的话就是到 , 呃 ,16 年 8 月份成立 , 到现在的话也是 8 月份 , 将近 , 差不多就是 10 年整的时间 。
然后像我们公司最早是做私主机器人, 然后最近几年做人形机器人。 然后我们近 、 最近几年做的比较成功的一款机器人的话 , 就是我们 24 年推出这款 "G1" 这款机器人。
这款机器人, 呃 , 推出以后 ,其实基本上成为了一个全球的一个标杆性的一个产品啊之类的事情 。 所以目前大家在看到的 , 我们公司的绝大部分的机器人产品 , 或者 , 呃 , 全球大家在用的机器人产品 , 基本上都是跟它 , 呃 , 同一款产品 , 或者跟它长得都非常非常类似的一款产品啊之类的事情 。
然后另外的话 , 像我们那个 , 像 , 呃 , 今年年初比较代表性的话 , 就是我们的 " 武 bot" 这个 , 呃 ,
就 " 武 bot" 这个的话 ,也是我们融合了中国的非常经典的一些传统的功夫文化 。 我们把非常经典的几十个中国功夫动作 , 然后提前采集 , 然后做 AI 训练 , 然后再把精彩的动作放到整个舞台上啊之类的事情 。
功夫出圈1:04
这个节目最大的亮点 ,其实它是结合了当前全世界最顶尖的人形机器人技术 ,以及中国传统的功夫武术文化 。
然后这个视频的话 , 尤其在海外的传播非常非常好 , 大概有可能在海外有几百亿次的播放量啊之类的事情 。
所以大家都非常非常喜欢 。 我觉得是一个非常好的 , 呃 , 那个科技和文化交融的一个例子 。
另外的话 , 像我们当时 2 月份的话 ,也是在天坛上有一个 , 呃 , 简单的一个演 、 演示 。 当时这里现场的话大概有 49 台机器人, 也是全动进行表演 ,也是非常非常震撼 。
因为天坛大家也知道 , 它有几百年的文化和历史 。 所以当时机器人在现场的话 ,其实有一种非常穿越时空的感觉 , 就是过去中国的几百年的文化和当前最新的技术交融在一起 。
这个穿越时空的感觉还是非常非常强烈 , 非常震撼 。
另外的话 , 我们公司其实在过去几年一直在推动机器人真正的去走进生活 , 去工厂干活这件事情 。
进厂落地2:14
像 24 年的话 , 我们就跟那个汽车工厂合作 , 去做 , 呃 , 汽车工厂现在一些落地应用 , 包括我们自己也在自己的工厂部署机器人, 做一些简单测试和落地应用 。
然后这块的话 ,其实我们也在公司里面绝大部分的 AI 的团队 , 都在做机器人真正的在家庭或者在工厂里干活 。
这部分事情为什么我们现在没有大规模推广呢 ? 其实最主要原因就是目前的整个的效率和它的泛用性能力还是不够提高 。
简单来说就是 , 虽然目前我们机器人能做一些简单的装配了 ,但它的效率其实跟人比起来还是比人还是要更低一些 。
然后另外的话 , 就是每次有一些新的任务过来的时候 , 要重新进行训练 , 这样的话效率相对更低一点 。
所以我们还是希望把技术做到更加泛化能力更好的情况 , 再进行大规模推广 。 而且这是目前全球大家共同的一个最大的瓶颈 。
产品突破3:07
然后另外的话 , 像我们今年 4 月份的话 ,也刷新了一个记录 , 就是 , 呃 , 人形机器人当时的奔跑的最快记录吧 , 大概超越了 10 米每秒的奔跑速度啊之类的事情 。
这款机器人的话 ,是我们在 24 年我们第一代的人形机器人改制的 , 呃 ,23 年第一代人形机器人改制的 。
当时是 H1, 这款机器人也是我们公司第一款人形机器人, 非常非常经典 。 然后包括的话 ,也是我们后面也可以在上面装轮子 , 这样的话更加灵活一些 。
然后另外的话 ,其实大家也知道 , 目前的机器人的话都是 AI 驱动的 。AI 的话目前基本都是数据驱动的 ,有多少数据 , 尤其有多少高质量的数据 , 就有多少 AI。
所以我们也在自己采集 , 或者和第三方公司合作采集更多的数据给大家用 ,也给我们自己用 。 所以这部分数据的驱动还是非常非常重要的一件事情 。
当然目前的话 , 我个人感觉就是真正的 AI 机器人训练数据 , 还是大量的海量的真人数据或者互联网数据为主要的预训练数据 , 然后再加上部分真机数据 。
这是我觉得是非常非常刚需的两个 、 两部分数据啊之类的事情 。 如果从量的角度来说 , 还是真人的数据会更加多和更加重要一些 。
然后真人的机器人实机的数据也非常非常重要 ,因为我们需要把机器人真正的跟物理世界进行做匹配 。
包括我们今年 5 月份比较经典的 , 就是我们发布了 , 就是应该全球第一款量产级的那个 , 呃 , 载人机甲吧 。
这款机器人也非常非常有意思 , 身高的话大概有 3 米多高 , 然后如果载人以后重量大概 500 千克左右 。
然后某种意义上, 大家可能会好奇这款机器人应用 。其实做个简单的比喻 , 这款机器人有点像一个越野车 , 就是它并不是给你在家庭啊或者在城市里面使用的 。
很多情况下, 比如说你出去户外徒步啊 , 或者说 , 哎 ,有一些非常复杂的一些环境下的一些运输 , 就可以使用它去做 。
而且最另外有比较有趣一点 , 就是它可以变形成 , 呃 , 四条腿的模式 , 这样的话它的稳定性会更好一些
。 这也是为什么说我们为什么要把它拿出来 , 呃 , 真正的去预售这个机器人来说 。 因为在四条腿的模式下, 它的稳定性是相对比较好的 ,而且预战能力也非常好 。
就简单来说就是一个 , 呃 , 越野车这种比喻 。
实时动作生成5:57
朋友们同学 , 另外的话 , 这里也有我们前几个月演示的一个基于那个多模态的一个端到端的一个自动 , 呃 ,AI 动作生成 。
因为大家也知道 , 像我们做一些 , 呃 , 很多常规的一些动作演示 , 都是用来提前做训练好的 。 而这部分的话 ,其实它的动作都是基于实时的语音生成的 。
正因为是基于实时语音生成的 , 所以它中间会有点延迟 , 就是每句话说好了以后, 它要语音识别 , 识别以后上传到云端 , 云端做一些 AI 动作生成 , 动作生成完以后做一些动作验证 , 验证好没有问题以后才下发给机器人。
所以说整个过程还需要几秒钟的延迟 。 但是我们一直是希望未来真正的机器人应用落地的时候 , 它的动作都是完全实时生成的 ,而不是提前做编程的 。
表现得不错 。 我们现在试一下双手平举 , 向前走几步 , 然后再走回原点 。
所以因为有个语音延 , 呃 , 处理的过程 , 所以说会有点延迟 。
但是这种自动生成的方式 ,其实有一个 , 呃 ,不太好的地方 。 因为它自动生成的时候 , 每次的动作是有点差异性的 。
就你跟它说同一句话 , 它可能今天和明天做的动作还是会有略微差异 。
会议室整理7:18
好的 , 准备开始 。 先半蹲着向前 。
另外的话 , 包括我们也在推动像机器人真正的像在会议室里真正的干活 , 我觉得也是非常非常重要的一件事情 。
因为像我 , 我们公司自己有时候会议室就乱糟糟的 。 所以在会议室整理这个 ,其实也是非常非常刚需的一件事情 。
因为每一个公司都有很多会议室 , 如果会议室比较糟糕 ,其实还是比较麻烦的一件事情 。 然后我们在这里的话 , 主要采集和训练的话 , 就是在一个会议室 , 如果我们把它任意打乱以后, 我们都可以把它恢复到一个干净整洁的状态 。
因为完全是端到端实现的 , 所以它的运动的效率目前还是相对是慢一些 。
而且是多任务的 。 我们在这个场景里的话 , 大概有布置了 , 呃 ,7 到 8 个不同的任务吧 ,而且用一个模型让它自动切换 , 不同任务都能直接执行 ,而且是可以抗干扰的 。
因为正因为是 AI 实时生成和实时识别的 , 所以说大家可以看到它动作可能没有那么流畅 。 因为它每走一步的话 , 动作都会要进行推理 , 所以说动作丝滑性会稍微差一些 。
而且这个视频本身是一镜到底实现的 , 没有做过剪辑 。
呃 , 刚才也提到 , 最主要就是可以突出一下, 可以 , 呃 , 直接如果有干扰 ,其实也可以实现 。
呃 , 时间关系可能这里也不多放了 。 如果大家有兴趣 , 可以去我们的那个官方网站看一下 ,有更详细的 。
就是这个功能的话 ,也是我们最近一直在开发的 。 因为我们希望一台机器人, 比如说像会议室整理这种相对来说 , 呃 , 相对有实用价值 ,并且难度不是特别特别大的场景 , 我觉得还是非常有意义做的一件事情 。
朋友们同学 。
另外的话 , 这是我们在刚才一个那个语音自动生成的技术上重新做了个事情 。 就刚才的动作生成是不带交互或者不带干活能力的 , 只是动作 。
语音干活9:27
然后这部分的话 , 就是在语音驱动情况下, 它的动作是可以干活的 。
我用眼镜给你看看 。 白色 。
朋友们同学 , 帮我把这个 。
搭载了一个多模态模型本身 。
要放到上面来 。 好的 , 马上帮你把第三层的蓝色药盒放到上面来 。
你看到了几盒药 ?
我用眼镜给你看看 。 一共有 3 盒药 , 一盒是红色 , 一盒是蓝色 , 一盒是黄色 。
而且是可以抗干扰的 , 就并不是说一个固定动作啊之类的事情 。
朋友们同学 , 帮我把这个 。
啊 , 包括的话 , 我们前段时间也发布了我们最新一代的那个轮足的那个 S2W 这款机器人。 这款机器人比较轻量化 , 自重大概只有 20 千克左右啊之类的事情 ,但它的负载能力和续航非常非常强劲 ,而且是 , 呃 , 基本上是防雨水的 , 所以室内和室外都可以使用 。
新品速览10:14
相对比较轻量级 , 就是 , 呃 , 轻量级的话 ,在正常日常生活中使用 , 或者在一些工业场景中使用 , 都会非常非常方便 。
而且它本身的话 , 我们目前把一些人形机器人的一些技术又重新放到了四足机器人上, 让四足机器人灵活性又有进一步的提升 , 包括它的负载能力也非常强劲 。
我们还是非常非常希望把这款机器人真正的落地应用到 , 比如说像一些户外徒步上的场景啊之类的事情 。
包括前段时间我们也升级了一些 , 像我们去年那款小的 AS 那个 R2 的一款机器人的那个 , 呃 , 灵活性 。
这款机器人目前性价比非常非常高 , 呃 ,在京东 、 淘宝上就有预售或者零售 , 大家有兴趣可以关注一下 。
啊 , 包括我们前段时间有 , 呃 , 应该是预览了一款我们新的机器人吧 。 这款机器人开发的时间比较短 , 我们大概只花了到现在为止只花了 3 个多月的时间啊之类的事情 。
所以某种意义上目前只是个预览产品啊之类 , 不是一个正式发布 。 但它的速度已经最快已经达到了 12.65 米每秒 , 已经超越了目前全世界历史上以来最快的人类的奔跑速度 。
包括它的跳高高度也是目前基本上是超越了人类历史上最高的跳跃高度 。
然后包括的话 , 像 , 呃 ,25 年我们我本人, 包括我们公司产品 , 包括 , 呃 , 我们公司都登上了时代杂志的一个搒单 。
世界模型12:09
然后另外的话 ,也是回顾一下最近几年整个的目前具身智能的 AI 模型的一个发展 。其实最主要的流派目前主要是 VA 模型 , 还有世界模型 。
当然今年大家可能听到最多的还是世界模型这个方向 。 像我们公司的话 ,其实对 AI 模型这块的投入一直非常非常大的 ,而且应该是我们公司目前资金和人力投入最大的一个方向之类的事情 。
然后像我们公司在 20 年初 , 我们就开始做基于视频生成的那个世界模型方向 。 但是当时在 20 年底的时候 , 我们当时做的效果不是特别理想 , 所以中间稍微搁置了一段时间 。
但是在去年, 我们又大力的发展了基于视频生成的世界模型这个方向之类的事情 。
泛化瓶颈12:59
然后另外最典型一个问题 , 就是大家可能会很多人都会好奇 , 就是真正的通用的机器人什么时候 , 无论是人形机器人也好 , 或者说半人形机器人也好 , 什么时候真正的走进生活 , 走进家庭 。其实最大的问题还是就是全世界目前最大的瓶颈还是就是具身智能的泛化能力还不太够 。
简单来说就是目前的很多 AI 模型在全世界范围内 ,在一个固定场景上, 你做足够的采集训练 , 它的成功率基本上可以做到 100% 的接近 100% 的成功率 。
但是如果它操作的物品或者它的环境稍微换一下, 它的成功率下降是非常非常严重的一件事情 。 所以我希望就是未来快的话可能 2 到 3 年, 慢的话 5 年或者 10 年的时间 , 就真正如果哪一天大家能看到把一台机器人带到一个你的任意的一个陌生环境 , 带到你的家庭 , 它基本可以实现 80% 左右的任务 , 我觉得就差不多已经实现了具身智能确定性
时刻 。 这就是未来真正产业的一个零件的爆发点 。 这个评价的指标也非常非常简单 , 就刚才有有提到 , 就是你带一个机器人到 80% 左右的陌生场景 , 它通过语音和语言指引 , 语言指令就可以实现 80% 的任务 。
我觉得这是一个非常非常重要的临界点 。 然后为什么要达到这个点呢 ? 如果 , 呃 , 就是目前要达到这个时刻最大的一个瓶颈是什么呢 ?
其实最大的瓶颈就是目前的 AI 模型的输入和输出跟真实机器人对齐程度不够 。 就是目前的机器人的模型 , 如果你让它吩咐它 , 让它移动 , 或者说 , 哎 , 我要把什么东西装配在一起 , 或者说要把一个物体搬到这个哪个问题 , 它的整个趋势是没有问题的 。
就它大差不差是能能执行你的任务 ,但是最后的几个厘米或者最后的几个毫米的成功率或者它偏差 , 它没办法很好的跟真实世界匹配 。
就是我去拿这个东西的时候 , 哎 , 我看到时候已经快要拿住了 ,但最后一点点触觉 , 最后一点点误差 , 它没办法很好的去修正它 。
就最终这个误差没办法很好修正 , 导致它的成功率就暴跌得非常非常严重啊之类的事情 。 所以这个是目前全世界具身智能的最大的瓶颈 , 就是 AI 模型的输入和输出 , 它的跟真实世界有偏差的 。
而为什么机器人上会有这个问题 ,而在一般的语言模型或多模态模型上没有这个问题呢 ? 因为语言模型大家也知道 , 就是它的数字完全是数字编码的 。
就是一个文字 , 你输入是什么 , 输出什么 , 它是在严格限制在它的一个限量空间里面 , 它基本上不会有大的偏差 。
而且它的简单来说 , 它是没有损失的 。 就是它输入输出 , 再把它倒回来输入输出 , 它没有任何损失 。
但是对于机器人来说 , 它的输入输出 , 每输入输出一次 , 它都有偏差和都有损失 。 所以导致了目前整个全世界这个模型 , 就是刚才有提到 , 就是真正的泛化能力和成功率会相当会差一些的原因 。
但是我觉得在未来几年, 这是必然是可以解决的问题 , 需要一些需要一些时间的问题 。 然后另外的话 , 我再也这里介绍一下我们昨天刚刚提出的 , 或者公司的一个 , 就是我们正在预研着做的一件事情 。
物理自进化15:51
因为在过去的很多年, 或者过去的几年, 大家已经用 AI 做很多的编程或做一些 AI 开发了 。 但是对于 AI 的真正的使用 , 我觉得在机器人领域的开发上 ,其实还是相对比较欠缺一点 。
所以我们公司最近一段时间 , 我们在推动的一件事情 , 就是直接让物理 AI 机器人模型自自进化 , 就是让这个与使用目前最前沿的 , 目前那个顶尖 AI 大模型来驱动 。
然后我们自己定一些规则 , 定一些经验 , 包括定一些约束和工具 , 让它自己去网上搜索最新的一些论文 , 最好的一些研究成果 , 最好的一些各种的一些开源方案 , 然后让它自己去编程生成自己的机器人控制代码 。
控制代码生成以后, 它可以在仿真环境里面运行 , 或者说在一些去生成一些 , 呃 , 调用一些大模型状态 , 然后去控制一个实物机器人。
如果实物机器人, 我们在实物机器人上做一些部署测试 , 然后进行评价和打分 。 这个评价和打分 , 一部分是机器人 AI 模型自己实现的 , 还有一部分就是也可以人肉参与去评价和打分 。
因为人的经验是非常非常重要的 , 人就非常非常能容易的判断出来这个是好的和坏的 , 然后这个是非常重要的 。
所以说这套逻辑层体系一旦是运行起来 , 它的整个机器人的开发效率会高很多 ,而且整个迭代速度也会非常非常快 。
一旦这个流程运行一段时间 , 真正可以实现机器人的自我的进化能力的提升啊之类的事情 。 然后这里也有简单一个示例 , 就是怎么做的 , 就是左下角就是一个 coding 的智能体 , 它自己编写机器人的一些控制代码 , 包括很多代码 。
大家可以如果有兴趣 , 大家可以试一下 。 目前的很多的简单的深度强化学习算法 ,其实让很多的 coding 的那个程序 , 它其实自动编程的效果已经还是不错了 , 还是不错了 。
然后另外的话 , 把这部分编程效果放到仿真环境里面去做验证训练 。 训练好了以后, 我们再把它放到实物机器人上去做测试 。
测试好了以后, 我们做 AI 模型 , 包括人肉去打分评价 , 然后确定这个效果怎么样 , 然后把它反馈给我们的那个编程智能体 , 然后形成一个正向循环 。
这里是个最简单的一个简单示例 , 真正使用的时候会比这个更加复杂一些 。 我觉得这个是未来当下以及未来几年全球 , 我觉得最非常值得做的一件事情 。
大家有兴趣可以关注一下这件事情 。 然后为什么要这么做呢 ? 其实有几个比较简单的原因 。 第一点就是随着每个月每年的基础模型的能力提升 , 这个自信进化循环本身能力就会进一步提升啊之类的事情 。
所以它是说实在它是非常非常良性 ,以及某种意义上是可以达到跟随整个全球 AI 技术进步的 。 然后另外的话 , 就可以更使用多元的数据 。
因为你也知道 , 人肉的去使用数据是效率非常非常低的 。 使用这个自循环的话 , 我们可以把各种的数据训练数据 , 包括 , 呃 , 真实世界 , 包括人的数据都使用起来 , 这样使用的效率会更高一点 ,而且可以有更多的增级部署 。
而且随着我们增级部署越来越多 ,有更多的测试数据 , 包括有更多的评价指标在里面 , 这样的话 , 它整个的数据的利用率和它的增长率是有可以保证的 , 就能达到一个数据的规模化 。
而且随着我们也可以每天或者每个月累加一些技能 ,而不是说 , 哎 , 我今天开发了一个技能 , 明天又把这个技能浪费掉了 。
所以我觉得这是非常非常重要的一件事情 , 就是让真正使用 AI 把这个机器人的开发效率 , 或者把机器人进化效率大幅度提升 。
我觉得未来是非常值得做的一件事情 。 然后我觉得这也是可以开启一个物理 AI 机器人自进化的一个新的纪元吧 。
未来展望19:34
我觉得未来这个方向是会让大家应该是可能很多人大家都会推动的一件事情 。 然后我觉得过去已经 10 年的时间 , 我我们公司应该最早的话 , 大概是 17 和 18 年第一次参加那个世界机器人大会 , 然后也是那个感受非常非常深刻 。
我觉得未来 10 年, 在当下新的起点 , 尤其在 AI 大爆发 , 全球大家的关注度非常高的时间 , 整个的机器人的进化速度已经大幅度提升了 。
可能可能未来发展速度可能比我预估的还会更快一点点 。 我觉得是一个全新的起点 , 全新的开始 。 由于时间关系 , 那回报比较简单 , 谢谢大家 , 还请大家多多包涵 。
