对话蚂蚁灵波 CEO 朱兴:机器人还吃不了「粗粮」

机器人打拳跳舞火了一年,它什么时候才能替我们上班?
前段时间宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击。据其介绍,UnifoLM-X2-1.0 能实时预测未来状态,完成规划、决策和动态交互。

自主格斗让我们看到机器人临场反应的进步,但如果换成在药房里取放商品这样的场景,另一组难题又来了:包装各异的药品、有人走动的货架通道、长时间运行中不断出现的意外。
这些日常任务,需要机器人把一次次判断变成持续、可靠的工作。
APPSO 在 2026 外滩大会现场跟蚂蚁灵波 CEO 朱兴进行了交流。聊到机器人为什么连小卖部都还没大规模落地,他直言:「小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。」
与许多围绕整机产品展开研发的本体厂商不同,灵波把重心放在具身「大脑」上,希望同一套基础模型能够适配不同构型、不同任务,再通过后训练降低具体场景的使用门槛。重载作业和轻量分拣可以用不同的身体,智能则尽可能复用。
生成可交互世界的 LingBot-World 也是灵波技术探索的一部分。它还训练了面向具身的视频生成基座 LingBot-Video,并在此基础上训练动作模型 LingBot-VLA 2.0,同时建设数据管线、后训练和部署工具。
朱兴关心的是,这些投入能否让机器人用更少的数据学会干活。
我们在外滩大会上,也看到灵波大脑的机器人展示了药品拣选、物流分拣和工业上下料等操作。药房演示中的货架通道仅 80 厘米宽,相关方案已在国大药房零售门店部署。
灵波也保留了自己的 R 系列本体,用于研发和生活服务探索。做具身大脑,仍然得与硬件、具体场景一起磨合。
在现场交流中,朱兴谈了不少尚未解决的问题:小模型能完成特定任务,为什么还要花钱训练基模?数据越多,效果为什么可能越差?商业化又该推进到哪一步?
对于日常生活中产生的数据,他的判断很有意思:今天的机器人还吃不了「粗粮」。
以下内容整理自蚂蚁灵波 CEO 朱兴的媒体沟通会,APPSO 略经编辑。

一、小卖部,也没那么容易
Q:药房、上下料看起来都很普通。为什么不选一些更能体现技术水平的场景?
朱兴: 我们更在意的是跟生态合作伙伴一起,做一些实实在在的落地。今天要让它做一个很炫的事情,那也是一个 demo。我让团队搞两个月,可以让四个机器人打掼蛋,展示高精度、触觉等非常多的技术,也没太大意义。
我们看重的是真实应用、数据的产生。在这个过程中,让模型迭代循环起来,知道还有哪些不足,要提升什么。
产业也想搞既能规模化应用、又更帅的东西。做不了,模型能力还没到那一步,或者成本还没到那一步。
Q:连抓取、放置这样的简单操作,也很难做到 100% 成功吗?
朱兴: 要看场景、环境和任务本身操作序列的复杂度。
小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。 模型能力、硬件稳定性,有些就是够不着。
今天整个模型还在冷启动阶段。基模干什么?是把小学生培养成初中生、高中生、本科生,现在可能还在比较早的阶段。
相对客观地说,现阶段想做一定规模的落地,环境不能太开放,任务不能太长程。任务太长,异常就多。今天主流可落地的产品基本还是模仿学习为主,最怕异常,因为没见过。还有成本约束,你创造的价值不够,自己又贵,长期也玩不转。
Q:既然如此,先把一个小模型训到能稳定干活,为什么还要投入通用基模?
朱兴: 如果阶段性只做一个非常特定的任务,也不追求规模化复制,直接怼一个小模型,也不是不能做。但你要看,规模化是不是意味着跨场景、跨任务、跨场所复制,这里面有泛化的挑战。
基模能力跟成功率不冲突。基模很大的价值,就是让后训练的少样本表现更好:用更少的数据达到同样的效果,或者用同样的数据达到更好的效果。 这个效果就包含成功率。
基模提升是水涨船高,跟大语言模型的基模发展,带动生态应用是一样的道理。
Q:从一家门店复制到另一家,现在卡在哪儿?
朱兴: 我们过去一段时间把模型从实验室拿出来,跟很多伙伴做落地,确实会遇到一个门店和多个门店复制的问题。现在复制成本很高,本质上还是泛化性不足。不同药房、不同便利店,环境有很多不一样。
短期可以先选没那么开放的环境,压缩泛化的挑战;任务不要太长程,先偏单任务。模型可以先驱动一部分环节,再到更多地由模型主导,能力成长要有一个爬坡过程。

二、矿泉水不能跳着舞落到手上
Q:现在很多做视频、游戏的公司都在谈世界模型。它们的能力,能直接用来控制机器人吗?
朱兴: 有些词的概念很泛。具身的世界模型,跟数字世界、游戏里的模型,客观讲也不是一种生物。以视频生成路线为基础的这类世界模型,底层用的是视频生成的原理,但数字世界和物理世界差别比较大。
数字世界的模型,满足的是内容需求:丰富、好看、创新、特效、画质。只要好,用户可以接受延迟。
机器人需要什么?它不需要那么好看,也不需要特效,需要的是合理,符合物理规律,因为最终要变成动作,控制机器人。
比如我现在想喝这瓶矿泉水,矿泉水在天空中跳个舞,落到我手上,肯定好看,但不符合物理规律,没意义。
机器人第一在乎是否符合物理规律,第二需要高性能、实时。 它在物理世界里不断输入、输出,不可能等你帮它生成一个很好的故事。
Q:灵波也尝试过在通用视频模型上微调。为什么后来决定从头做?
朱兴: 1.0 系列的时候,我们也是基于数字世界的通用视频生成模型,比如 Wan,通过微调把它硬调到适合机器人。
一个问题是上限不高。另一个问题是,调到最后会破坏前面模型的先验和知识,副作用就是泛化性降低。走到后期,我们真的是撞到南墙了。
所以我们很早就启动了更原生的研发。LingBot-Video 训练时加入了大量机器人真实数据,再基于它训练 LingBot-VLA 2.0。
我们相信物理智能需要基于物理真实数据,从 0 到 1 训练自己的基模。数字智能,包括多模态、大语言模型的发展,可能会给具身很多助力,但内核部分还要靠具身本身解决。
Q:从头训练基模,投入更大、风险也更高,为什么还要选?
朱兴: 因为我们希望长期发展,选择上限更高的路线。从 0 到 1 大规模训基模挺费钱的。
大语言模型兴起之后,有的选择基于别人的基模微调,有的冒更大风险投入预训练。选择后者也不见得跑得出来。今天具身也进入了「百模大战」初期,你选一个更高上限的路线还不见得做得出来,但不选择的话,肯定做不大。
Q:LingBot-World 2.0 开放了 1.3B 小模型。模型小了,幻觉和效果损失怎么办?
朱兴: 不可能说幻觉完全没有。模型小了这么多,效果完全保持一致,也不现实。
我们之前说过会开放更小的版本,希望对高交互世界模型感兴趣的人能更多地玩起来,这是想给技术社区做的贡献。
这次也开放了一部分训练技术。比如怎样训练单向因果的能力,机器人的时间一定是单向的,在线预测要按时间顺序使用已经发生的观测,不能依赖未来的真实帧。从现在到未来,不可能穿越。这些技术本身也有门槛,希望能帮助开发者和学术界。
三、「炼丹」背后,是数据的配方
Q:行业总在谈百万、千万小时数据。你相信 Scaling Law 吗?
朱兴: 我也相信 Scaling Law。但不能这么机械地看数据量。
现在已经有这种现象:一个模型用的数据比另一个多了 3 倍、5 倍,效果却差,但在某些类型的场景任务上表现得特别好,肯定是数据分布大量不均衡。我们做基模,谈的是一定的通用性。
量重要,但更要谈质量和分布。大家老说「炼丹」,炼丹背后就是配方,数据的配方。
我知道大家特别想大力出奇迹,觉得怼到多少小时,智能就涌现了,具身智能新时代就来了。这个事情不太简单。
Q:有人说数采厂 90% 的数据无效。问题出在数据供应商,还是模型公司?
朱兴: 我不知道这个数字是谁说的,怎么统计出来的。确实,不管哪种数据源、哪种采集方式,都有大量场景重复。过度重复的数据,意义没有那么大。
但作为模型方,你有义务定义需要什么数据、什么质量,不能把这件事赖到数采厂。
数据需求是模型训练来定义的:要什么类型,什么分布,覆盖哪些场景、哪些任务。难采的先试采,形成比较好的标准作业流程,再交给供应商上量。这是模型厂商很核心的经验和能力。
供应商则要把执行做好。要求采抓药瓶,就要把轨迹质量、平滑性、适当的泛化性做好。各有各的责任。
Q:灵波具体怎么做?
朱兴: 我们很早就转向定制化采集,不怎么购买成品数据了。成品数据容易有技术质量差、大量重复的问题,导致最终能用的比例很低。
我们跟供应商在作业流程、端到端数据管线的自动化集成上,做了很多工作。内部从原始数据到能进入模型训练的数据漏斗,可用率比较早就从 15% 左右拉到了 90% 以上。
还有一个特别关注的问题:数据从生产出来,到进入训练,到底要多久,是一周还是三天?我们跟供应商基本采用流式交付,不等一大批数据攒齐再交。
Q:想把质量握在手里,是不是最好自己建数采厂?
朱兴: 没必要非黑即白。
专业供应商有大规模用工的能力。管理很多生产员,怎么考核、激励,产能怎么保留弹性,这也是能力。至少灵波不擅长,也不想把自己搞得那么复杂。
未来数据要进入更多场景,进入场景本身也需要运营。我们把数据管线做得更高效,对数据理解得更深,再跟专业服务商配合,是 1 加 1 大于 2。
Q:第一人称视角的 Ego 数采很热。戴个头环、眼镜拍下人干活,就够了吗?
朱兴: Ego 是一个很好的思想,以人为中心,更便携,更容易进入开放场景,能够增加场景和任务的多样性。但要看具体怎么采。
头环加裸手,当前比较大的问题是精度。手的轨迹是重建出来的,误差过大的时候,数据价值就打折了。
我比较看好结合高精度、便携的触觉手套。既保留 Ego 的优势,又借助硬件和算法解决精度问题。还有一个重要的点,视觉和触觉的信息天然可以对齐,只要误差不要太大。这类数据对下一步模型发展意义很大。
至于设备有两个、四个还是六个相机,视角不同,都有用途。关键还是数据满足什么标准,轨迹精度够不够。
Q:互联网视频、仿真和真机数据,到底应该怎么配?
朱兴: 不要轻易谈不同数据源的配比。互联网视频操作数据那么多,配那么一点点真机数据,不就淹死了吗?
要分训练阶段。越往预训练,我们越希望获得场景泛化,所以用无本体数据、互联网视频等更容易扩大规模的数据。越到后训练,越要针对具体场景、具体任务把成功率拉上去,贴近机器人的数据就越有价值。落地前还要采数据,就是让模型熟悉机器人的构型、任务和环境。
仿真数据也有价值。我认为今天更多体现在中后训练,尤其是针对某个具体任务,强化成功率。每种数据都有阶段性的价值,不能混在一起只看一个总量。
四、真正的飞轮,要能接住失败
Q:数据一直要靠人专门去采。什么时候才能让机器人边工作,边给自己积累数据?
朱兴: 今天还很早,是冷启动,靠各种数采强制喂。再往前走,有一点应用规模了,至少部分场景里的异常数据飞轮可以转起来。
这时候看重的是异常数据,成功数据没有那么大意义。
Q:再往后,真正的数据飞轮会是什么样?
朱兴: 我认为什么才是具身智能真正的数据飞轮?其实每个人的日常生活或者工作过程中,都在为机器人生产数据。
Q:这些日常数据,现在能直接给机器人用吗?
朱兴: 你现在给它,它也吃不了,吃不了「粗粮」。
Q:既然关键在数据,是不是模型架构已经没那么重要了?
朱兴: 数据现在很重要,未来更重要。但模型范式没有完全收敛。世界模型的能力怎么用好,机器人未来的学习范式,都还要发生变化,必须持续探索。
不要把这个跟 Transformer 那一层的计算架构混为一谈。计算架构一换,大家都会换。模型范式有新东西出来,别人也会对齐。
所以要把数据管线做得更高效,对数据的理解更深。离开这个东西谈模型,没有意义。
Q:那大语言模型公司下场,会不会很快把这些优势抹平?
朱兴: 我打个比方,如果今天 OpenAI 或者 Anthropic 下场做自动驾驶,能短时间颠覆特斯拉吗?
大模型厂商在训练能力等方面有优势。但自动驾驶更核心的壁垒,还是数据:什么是好数据,对数据的理解,以及数据管线。
通用大模型可以提升机器人特定阶段的研发效率,是很好的工具支持。但具身面临的数据挑战还在那里,还是要自己解决。
五、人形,不必成为执念
Q:为什么把适配不同机器人构型,看得这么重?以后不会收敛到一种通用的人形机器人吗?
朱兴: 构型泛化是长期存在的问题,也是产业需要。
先看生产力场景。高负重的重载作业,和很轻的分拣,为什么要同一套硬件配置?为什么一定要同一种构型?有的单臂用六轴就可以,有的需要七轴甚至更多。要服务效率,背后是成本。
再看家庭,每家的第一需求也不一样,有的要老人看护,有的要陪伴,喜好也不同。人都有高矮胖瘦。
我觉得机器人没必要长得像人、什么都像人。 我们更应该看具身智能作为一项技术,能在社会里创造什么价值。把「人形机器人必须更像人」当成第一性原理,我不觉得是科学的方法。
Q:外骨骼这类产品好像不太需要大脑。一定要用大模型,才算好的机器人吗?
朱兴: 我们谈具身智能、谈大脑,一般希望它能泛化。有的场景不需要怎么泛化,完全可以用其他技术更稳健地解决,这是没问题的。
技术都是手段,最终满足场景需要是最关键的。 过去工业机器人基本上把能穷举的规则都做了,再往前,有些场景就做不了了。
Q:灵波做大脑,为什么还要做自己的 R 系列机器人?
朱兴: 研发肯定需要软硬一体。模型需要数据,数据由硬件产生,自己不做,也得找别人定制。
另外,蚂蚁集团的核心业务沉
机器人打拳跳舞火了一年,它什么时候才能替我们上班?
前段时间宇树发布人形机器人格斗演示,称首次实现由世界模型实时驱动的全自主搏击。据其介绍,UnifoLM-X2-1.0 能实时预测未来状态,完成规划、决策和动态交互。

自主格斗让我们看到机器人临场反应的进步,但如果换成在药房里取放商品这样的场景,另一组难题又来了:包装各异的药品、有人走动的货架通道、长时间运行中不断出现的意外。
这些日常任务,需要机器人把一次次判断变成持续、可靠的工作。
APPSO 在 2026 外滩大会现场跟蚂蚁灵波 CEO 朱兴进行了交流。聊到机器人为什么连小卖部都还没大规模落地,他直言:「小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。」
与许多围绕整机产品展开研发的本体厂商不同,灵波把重心放在具身「大脑」上,希望同一套基础模型能够适配不同构型、不同任务,再通过后训练降低具体场景的使用门槛。重载作业和轻量分拣可以用不同的身体,智能则尽可能复用。
生成可交互世界的 LingBot-World 也是灵波技术探索的一部分。它还训练了面向具身的视频生成基座 LingBot-Video,并在此基础上训练动作模型 LingBot-VLA 2.0,同时建设数据管线、后训练和部署工具。
朱兴关心的是,这些投入能否让机器人用更少的数据学会干活。
我们在外滩大会上,也看到灵波大脑的机器人展示了药品拣选、物流分拣和工业上下料等操作。药房演示中的货架通道仅 80 厘米宽,相关方案已在国大药房零售门店部署。
灵波也保留了自己的 R 系列本体,用于研发和生活服务探索。做具身大脑,仍然得与硬件、具体场景一起磨合。
在现场交流中,朱兴谈了不少尚未解决的问题:小模型能完成特定任务,为什么还要花钱训练基模?数据越多,效果为什么可能越差?商业化又该推进到哪一步?
对于日常生活中产生的数据,他的判断很有意思:今天的机器人还吃不了「粗粮」。
以下内容整理自蚂蚁灵波 CEO 朱兴的媒体沟通会,APPSO 略经编辑。

一、小卖部,也没那么容易
Q:药房、上下料看起来都很普通。为什么不选一些更能体现技术水平的场景?
朱兴: 我们更在意的是跟生态合作伙伴一起,做一些实实在在的落地。今天要让它做一个很炫的事情,那也是一个 demo。我让团队搞两个月,可以让四个机器人打掼蛋,展示高精度、触觉等非常多的技术,也没太大意义。
我们看重的是真实应用、数据的产生。在这个过程中,让模型迭代循环起来,知道还有哪些不足,要提升什么。
产业也想搞既能规模化应用、又更帅的东西。做不了,模型能力还没到那一步,或者成本还没到那一步。
Q:连抓取、放置这样的简单操作,也很难做到 100% 成功吗?
朱兴: 要看场景、环境和任务本身操作序列的复杂度。
小卖部其实也很难落地。我懂你的焦虑,今天还是能力和成本两个都有问题。 模型能力、硬件稳定性,有些就是够不着。
今天整个模型还在冷启动阶段。基模干什么?是把小学生培养成初中生、高中生、本科生,现在可能还在比较早的阶段。
相对客观地说,现阶段想做一定规模的落地,环境不能太开放,任务不能太长程。任务太长,异常就多。今天主流可落地的产品基本还是模仿学习为主,最怕异常,因为没见过。还有成本约束,你创造的价值不够,自己又贵,长期也玩不转。
Q:既然如此,先把一个小模型训到能稳定干活,为什么还要投入通用基模?
朱兴: 如果阶段性只做一个非常特定的任务,也不追求规模化复制,直接怼一个小模型,也不是不能做。但你要看,规模化是不是意味着跨场景、跨任务、跨场所复制,这里面有泛化的挑战。
基模能力跟成功率不冲突。基模很大的价值,就是让后训练的少样本表现更好:用更少的数据达到同样的效果,或者用同样的数据达到更好的效果。 这个效果就包含成功率。
基模提升是水涨船高,跟大语言模型的基模发展,带动生态应用是一样的道理。
Q:从一家门店复制到另一家,现在卡在哪儿?
朱兴: 我们过去一段时间把模型从实验室拿出来,跟很多伙伴做落地,确实会遇到一个门店和多个门店复制的问题。现在复制成本很高,本质上还是泛化性不足。不同药房、不同便利店,环境有很多不一样。
短期可以先选没那么开放的环境,压缩泛化的挑战;任务不要太长程,先偏单任务。模型可以先驱动一部分环节,再到更多地由模型主导,能力成长要有一个爬坡过程。

二、矿泉水不能跳着舞落到手上
Q:现在很多做视频、游戏的公司都在谈世界模型。它们的能力,能直接用来控制机器人吗?
朱兴: 有些词的概念很泛。具身的世界模型,跟数字世界、游戏里的模型,客观讲也不是一种生物。以视频生成路线为基础的这类世界模型,底层用的是视频生成的原理,但数字世界和物理世界差别比较大。
数字世界的模型,满足的是内容需求:丰富、好看、创新、特效、画质。只要好,用户可以接受延迟。
机器人需要什么?它不需要那么好看,也不需要特效,需要的是合理,符合物理规律,因为最终要变成动作,控制机器人。
比如我现在想喝这瓶矿泉水,矿泉水在天空中跳个舞,落到我手上,肯定好看,但不符合物理规律,没意义。
机器人第一在乎是否符合物理规律,第二需要高性能、实时。 它在物理世界里不断输入、输出,不可能等你帮它生成一个很好的故事。
Q:灵波也尝试过在通用视频模型上微调。为什么后来决定从头做?
朱兴: 1.0 系列的时候,我们也是基于数字世界的通用视频生成模型,比如 Wan,通过微调把它硬调到适合机器人。
一个问题是上限不高。另一个问题是,调到最后会破坏前面模型的先验和知识,副作用就是泛化性降低。走到后期,我们真的是撞到南墙了。
所以我们很早就启动了更原生的研发。LingBot-Video 训练时加入了大量机器人真实数据,再基于它训练 LingBot-VLA 2.0。
我们相信物理智能需要基于物理真实数据,从 0 到 1 训练自己的基模。数字智能,包括多模态、大语言模型的发展,可能会给具身很多助力,但内核部分还要靠具身本身解决。
Q:从头训练基模,投入更大、风险也更高,为什么还要选?
朱兴: 因为我们希望长期发展,选择上限更高的路线。从 0 到 1 大规模训基模挺费钱的。
大语言模型兴起之后,有的选择基于别人的基模微调,有的冒更大风险投入预训练。选择后者也不见得跑得出来。今天具身也进入了「百模大战」初期,你选一个更高上限的路线还不见得做得出来,但不选择的话,肯定做不大。
Q:LingBot-World 2.0 开放了 1.3B 小模型。模型小了,幻觉和效果损失怎么办?
朱兴: 不可能说幻觉完全没有。模型小了这么多,效果完全保持一致,也不现实。
我们之前说过会开放更小的版本,希望对高交互世界模型感兴趣的人能更多地玩起来,这是想给技术社区做的贡献。
这次也开放了一部分训练技术。比如怎样训练单向因果的能力,机器人的时间一定是单向的,在线预测要按时间顺序使用已经发生的观测,不能依赖未来的真实帧。从现在到未来,不可能穿越。这些技术本身也有门槛,希望能帮助开发者和学术界。
三、「炼丹」背后,是数据的配方
Q:行业总在谈百万、千万小时数据。你相信 Scaling Law 吗?
朱兴: 我也相信 Scaling Law。但不能这么机械地看数据量。
现在已经有这种现象:一个模型用的数据比另一个多了 3 倍、5 倍,效果却差,但在某些类型的场景任务上表现得特别好,肯定是数据分布大量不均衡。我们做基模,谈的是一定的通用性。
量重要,但更要谈质量和分布。大家老说「炼丹」,炼丹背后就是配方,数据的配方。
我知道大家特别想大力出奇迹,觉得怼到多少小时,智能就涌现了,具身智能新时代就来了。这个事情不太简单。
Q:有人说数采厂 90% 的数据无效。问题出在数据供应商,还是模型公司?
朱兴: 我不知道这个数字是谁说的,怎么统计出来的。确实,不管哪种数据源、哪种采集方式,都有大量场景重复。过度重复的数据,意义没有那么大。
但作为模型方,你有义务定义需要什么数据、什么质量,不能把这件事赖到数采厂。
数据需求是模型训练来定义的:要什么类型,什么分布,覆盖哪些场景、哪些任务。难采的先试采,形成比较好的标准作业流程,再交给供应商上量。这是模型厂商很核心的经验和能力。
供应商则要把执行做好。要求采抓药瓶,就要把轨迹质量、平滑性、适当的泛化性做好。各有各的责任。
Q:灵波具体怎么做?
朱兴: 我们很早就转向定制化采集,不怎么购买成品数据了。成品数据容易有技术质量差、大量重复的问题,导致最终能用的比例很低。
我们跟供应商在作业流程、端到端数据管线的自动化集成上,做了很多工作。内部从原始数据到能进入模型训练的数据漏斗,可用率比较早就从 15% 左右拉到了 90% 以上。
还有一个特别关注的问题:数据从生产出来,到进入训练,到底要多久,是一周还是三天?我们跟供应商基本采用流式交付,不等一大批数据攒齐再交。
Q:想把质量握在手里,是不是最好自己建数采厂?
朱兴: 没必要非黑即白。
专业供应商有大规模用工的能力。管理很多生产员,怎么考核、激励,产能怎么保留弹性,这也是能力。至少灵波不擅长,也不想把自己搞得那么复杂。
未来数据要进入更多场景,进入场景本身也需要运营。我们把数据管线做得更高效,对数据理解得更深,再跟专业服务商配合,是 1 加 1 大于 2。
Q:第一人称视角的 Ego 数采很热。戴个头环、眼镜拍下人干活,就够了吗?
朱兴: Ego 是一个很好的思想,以人为中心,更便携,更容易进入开放场景,能够增加场景和任务的多样性。但要看具体怎么采。
头环加裸手,当前比较大的问题是精度。手的轨迹是重建出来的,误差过大的时候,数据价值就打折了。
我比较看好结合高精度、便携的触觉手套。既保留 Ego 的优势,又借助硬件和算法解决精度问题。还有一个重要的点,视觉和触觉的信息天然可以对齐,只要误差不要太大。这类数据对下一步模型发展意义很大。
至于设备有两个、四个还是六个相机,视角不同,都有用途。关键还是数据满足什么标准,轨迹精度够不够。
Q:互联网视频、仿真和真机数据,到底应该怎么配?
朱兴: 不要轻易谈不同数据源的配比。互联网视频操作数据那么多,配那么一点点真机数据,不就淹死了吗?
要分训练阶段。越往预训练,我们越希望获得场景泛化,所以用无本体数据、互联网视频等更容易扩大规模的数据。越到后训练,越要针对具体场景、具体任务把成功率拉上去,贴近机器人的数据就越有价值。落地前还要采数据,就是让模型熟悉机器人的构型、任务和环境。
仿真数据也有价值。我认为今天更多体现在中后训练,尤其是针对某个具体任务,强化成功率。每种数据都有阶段性的价值,不能混在一起只看一个总量。
四、真正的飞轮,要能接住失败
Q:数据一直要靠人专门去采。什么时候才能让机器人边工作,边给自己积累数据?
朱兴: 今天还很早,是冷启动,靠各种数采强制喂。再往前走,有一点应用规模了,至少部分场景里的异常数据飞轮可以转起来。
这时候看重的是异常数据,成功数据没有那么大意义。
Q:再往后,真正的数据飞轮会是什么样?
朱兴: 我认为什么才是具身智能真正的数据飞轮?其实每个人的日常生活或者工作过程中,都在为机器人生产数据。
Q:这些日常数据,现在能直接给机器人用吗?
朱兴: 你现在给它,它也吃不了,吃不了「粗粮」。
Q:既然关键在数据,是不是模型架构已经没那么重要了?
朱兴: 数据现在很重要,未来更重要。但模型范式没有完全收敛。世界模型的能力怎么用好,机器人未来的学习范式,都还要发生变化,必须持续探索。
不要把这个跟 Transformer 那一层的计算架构混为一谈。计算架构一换,大家都会换。模型范式有新东西出来,别人也会对齐。
所以要把数据管线做得更高效,对数据的理解更深。离开这个东西谈模型,没有意义。
Q:那大语言模型公司下场,会不会很快把这些优势抹平?
朱兴: 我打个比方,如果今天 OpenAI 或者 Anthropic 下场做自动驾驶,能短时间颠覆特斯拉吗?
大模型厂商在训练能力等方面有优势。但自动驾驶更核心的壁垒,还是数据:什么是好数据,对数据的理解,以及数据管线。
通用大模型可以提升机器人特定阶段的研发效率,是很好的工具支持。但具身面临的数据挑战还在那里,还是要自己解决。
五、人形,不必成为执念
Q:为什么把适配不同机器人构型,看得这么重?以后不会收敛到一种通用的人形机器人吗?
朱兴: 构型泛化是长期存在的问题,也是产业需要。
先看生产力场景。高负重的重载作业,和很轻的分拣,为什么要同一套硬件配置?为什么一定要同一种构型?有的单臂用六轴就可以,有的需要七轴甚至更多。要服务效率,背后是成本。
再看家庭,每家的第一需求也不一样,有的要老人看护,有的要陪伴,喜好也不同。人都有高矮胖瘦。
我觉得机器人没必要长得像人、什么都像人。 我们更应该看具身智能作为一项技术,能在社会里创造什么价值。把「人形机器人必须更像人」当成第一性原理,我不觉得是科学的方法。
Q:外骨骼这类产品好像不太需要大脑。一定要用大模型,才算好的机器人吗?
朱兴: 我们谈具身智能、谈大脑,一般希望它能泛化。有的场景不需要怎么泛化,完全可以用其他技术更稳健地解决,这是没问题的。
技术都是手段,最终满足场景需要是最关键的。 过去工业机器人基本上把能穷举的规则都做了,再往前,有些场景就做不了了。
Q:灵波做大脑,为什么还要做自己的 R 系列机器人?
朱兴: 研发肯定需要软硬一体。模型需要数据,数据由硬件产生,自己不做,也得找别人定制。
另外,蚂蚁集团的核心业务沉
