🤖 AI 资讯

· ·
← 返回列表

Xspark AI 丁文伯:触觉替代不了视觉,但机器人需要一套自己的“脊髓” |物理AI 50人

雷锋网2026-09-15 07:52:00大模型,具身智能,政策监管,对话助手,多模态,翻译字幕,Transformer,扩散模型,预训练,向量数据库,传媒内容,AI for Science,榜单评测原文 ↗

具身智能进入“触觉时代”,丁文伯提出“脊髓”架构补全机器人物理交互短板。


作者:李秋悦
编辑:吴彤

丁文伯很难被一个词准确“定位”。通信博士、材料学博士后、机器触觉学者,这些标签都对,但都只能解释他的部分经历。

2025年,丁文伯又多了一个身份——Xspark AI(无界智航)联合创始人、首席科学家。一个做了多年传感器研究的清华教授出来创业,没有把公司定义成一家“传感器公司”。相反,他认为造出更好的传感器,并不会自动得到一个更聪明的机器人,机器人触觉可能需要一套自己的模型。

这个判断首先来自纯视觉的局限。

过去两年,具身智能最主流的技术路径仍然延续大模型的Scaling逻辑,即更多视频、更多机器人轨迹、更大的VLA(视觉-语言-动作模型),让机器人沿着“看见—理解—行动”的链条不断提高泛化能力。丁文伯并不反对这条路线,他甚至认为“VLA是一个蛮solid的逻辑,像早期Transformer、diffusion policy一样,一定会在具身智能(历史)长河里留下浓墨重彩的一笔”。

但机器人和语言模型最大的不同在于,它最终要伸出手,真正碰到这个世界。

在丁文伯看来,视觉其实已经解决了机器人感知世界“99%”的问题,触觉没有必要和视觉竞争。它更像是在视觉失效或者不够确定的时候,补上接触发生之后的信息。杯子有没有开始滑动,手指是不是捏得太紧,机械臂有没有撞到人,一个灵巧动作应该继续用力还是立刻修正。机器人一旦真正进入物理世界,问题就不只是“有没有看见”,还包括接触之后能不能及时感知、修正和避险。

问题也由此往前走了一步:如果机器人需要触觉,那么触觉应该以什么方式成为智能?

最直接的办法,是把触觉作为一种新的模态塞进现有模型。但丁文伯对此并不完全满意,他认为从第一性原理看,触觉的信息量远没有视觉丰富,却对反馈效率有更高要求。把它直接和整个视觉模型融合,要么产生大量冗余,要么少量关键触觉信息反而被视觉淹没。

这也是他开始提出“触觉原生智能”的原因。

触觉智能未必需要拥有视觉大模型那样丰富的语义理解能力,相反,它可能应该更轻、更快、更靠近身体。人快要摔倒时,并不会先识别“我正在摔倒”、分析原因,再决定伸手,而是身体先完成反射。丁文伯因此喜欢用人的“脊髓”来类比触觉智能:它处理的信息可以没有那么丰富,但要足够低延迟,能够在滑动、碰撞、失衡等发生的一瞬间做出反应。

不过,从“触觉很重要”到真正做出一套触觉智能,中间还有很长的距离。

首先是硬件。不同触觉传感器之间的一致性依然很差,即使同一批次生产的设备,性能也可能存在明显差异。模型因此很难像视觉模型一样,在不同硬件之间直接迁移。

其次是数据。触觉没有互联网时代天然积累下来的海量图片和视频,同一个动作换一个人、一个传感器甚至一个机器人,数据分布都可能发生变化。

再往后还有更基础的问题:触觉到底应该如何Representation和Embedding?不同传感器采集出来的力、温度、剪切、振动,最终有没有可能被转换成某种与具体硬件无关的共同表征?丁文伯把接下来两三年甚至五年的问题概括为三个“跨”——跨传感器、跨模态、跨本体。

所以丁文伯并没有声称,一套成熟的“触觉大模型”已经有了答案。他承认,目前更现实的仍然是一条折中路线:短期先把某一种多模态触觉传感器做好,再和现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合则放在灵巧操作的后训练和动作修正阶段。至于长期,他才倾向于认为,触觉最终会形成自己的模型和逻辑。

Xspark AI提出的“慢脑 VLM—快脑 VTLA+TWAM—脊髓 VTA”三层架构,可以看作前者判断现阶段的一种工程表达。在这套架构里,视觉语言模型构成“慢脑”,负责语义理解、高层认知和任务规划;触觉首先进入“快脑”,与视觉、语言和动作一起参与长程任务和灵巧操作;再往下一层,触觉成为“脊髓”的核心信息,在碰撞、滑落、安全等场景下完成更快的局部反应。同一种触觉,因此同时承担两种角色:在快脑里帮助机器人“做得更好”,在脊髓里保证机器人“来得及反应”。

这也让丁文伯正在研究的问题比“机器人需不需要触觉”更具体了一层。

视觉仍然会是机器人理解世界最重要的信息来源,VLA也仍然是主流路线。真正没有被定义清楚的是:触觉究竟只是现有视觉模型增加的一种输入,还是因为它对接触、运动和实时反馈的特殊要求,最终会生长出一套不同于视觉智能的模型和计算逻辑。

丁文伯现在做的,就是试图找到这个答案。以下是左林右狸与丁文伯的对话(在不改变原意的基础上做了部分编辑):


01 “科研困难户”是怎么入门的?

左林右狸:2007年安徽省理科第三名,为什么读清华电子系?

丁文伯:当时没考到省状元,就“没法选经管”。那时候我们很多人都想读经管。刚好来招生的是电子系老师,他跟我讲了一番电子系的“宏伟蓝图”,最后我就去了电子系。我记得当年我们学校有几个同学,分别是全省第二、第三、第六名,最后全被这位老师招进了电子系。

左林右狸:这位老师当时给你讲的“宏伟蓝图”是什么?

丁文伯:他的“宏伟蓝图”其实很简单,他说你学不了经管,清华在安徽只招一个人,你去不了。后来我才听说,经管在安徽其实招了5个人。不过也没关系。前两天我还跟同学说,人生里很多选择,当时你可能觉得自己做了一个很好的决定,但最后真正改变人生的,往往是一些不经意的选择,甚至是被迫做出的选择。

具身智能进入“触觉时代”,丁文伯提出“脊髓”架构补全机器人物理交互短板。


作者:李秋悦
编辑:吴彤

丁文伯很难被一个词准确“定位”。通信博士、材料学博士后、机器触觉学者,这些标签都对,但都只能解释他的部分经历。

2025年,丁文伯又多了一个身份——Xspark AI(无界智航)联合创始人、首席科学家。一个做了多年传感器研究的清华教授出来创业,没有把公司定义成一家“传感器公司”。相反,他认为造出更好的传感器,并不会自动得到一个更聪明的机器人,机器人触觉可能需要一套自己的模型。

这个判断首先来自纯视觉的局限。

过去两年,具身智能最主流的技术路径仍然延续大模型的Scaling逻辑,即更多视频、更多机器人轨迹、更大的VLA(视觉-语言-动作模型),让机器人沿着“看见—理解—行动”的链条不断提高泛化能力。丁文伯并不反对这条路线,他甚至认为“VLA是一个蛮solid的逻辑,像早期Transformer、diffusion policy一样,一定会在具身智能(历史)长河里留下浓墨重彩的一笔”。

但机器人和语言模型最大的不同在于,它最终要伸出手,真正碰到这个世界。

在丁文伯看来,视觉其实已经解决了机器人感知世界“99%”的问题,触觉没有必要和视觉竞争。它更像是在视觉失效或者不够确定的时候,补上接触发生之后的信息。杯子有没有开始滑动,手指是不是捏得太紧,机械臂有没有撞到人,一个灵巧动作应该继续用力还是立刻修正。机器人一旦真正进入物理世界,问题就不只是“有没有看见”,还包括接触之后能不能及时感知、修正和避险。

问题也由此往前走了一步:如果机器人需要触觉,那么触觉应该以什么方式成为智能?

最直接的办法,是把触觉作为一种新的模态塞进现有模型。但丁文伯对此并不完全满意,他认为从第一性原理看,触觉的信息量远没有视觉丰富,却对反馈效率有更高要求。把它直接和整个视觉模型融合,要么产生大量冗余,要么少量关键触觉信息反而被视觉淹没。

这也是他开始提出“触觉原生智能”的原因。

触觉智能未必需要拥有视觉大模型那样丰富的语义理解能力,相反,它可能应该更轻、更快、更靠近身体。人快要摔倒时,并不会先识别“我正在摔倒”、分析原因,再决定伸手,而是身体先完成反射。丁文伯因此喜欢用人的“脊髓”来类比触觉智能:它处理的信息可以没有那么丰富,但要足够低延迟,能够在滑动、碰撞、失衡等发生的一瞬间做出反应。

不过,从“触觉很重要”到真正做出一套触觉智能,中间还有很长的距离。

首先是硬件。不同触觉传感器之间的一致性依然很差,即使同一批次生产的设备,性能也可能存在明显差异。模型因此很难像视觉模型一样,在不同硬件之间直接迁移。

其次是数据。触觉没有互联网时代天然积累下来的海量图片和视频,同一个动作换一个人、一个传感器甚至一个机器人,数据分布都可能发生变化。

再往后还有更基础的问题:触觉到底应该如何Representation和Embedding?不同传感器采集出来的力、温度、剪切、振动,最终有没有可能被转换成某种与具体硬件无关的共同表征?丁文伯把接下来两三年甚至五年的问题概括为三个“跨”——跨传感器、跨模态、跨本体。

所以丁文伯并没有声称,一套成熟的“触觉大模型”已经有了答案。他承认,目前更现实的仍然是一条折中路线:短期先把某一种多模态触觉传感器做好,再和现有模型融合;预训练阶段聚焦通用能力构建,触觉信息的引入与融合则放在灵巧操作的后训练和动作修正阶段。至于长期,他才倾向于认为,触觉最终会形成自己的模型和逻辑。

Xspark AI提出的“慢脑 VLM—快脑 VTLA+TWAM—脊髓 VTA”三层架构,可以看作前者判断现阶段的一种工程表达。在这套架构里,视觉语言模型构成“慢脑”,负责语义理解、高层认知和任务规划;触觉首先进入“快脑”,与视觉、语言和动作一起参与长程任务和灵巧操作;再往下一层,触觉成为“脊髓”的核心信息,在碰撞、滑落、安全等场景下完成更快的局部反应。同一种触觉,因此同时承担两种角色:在快脑里帮助机器人“做得更好”,在脊髓里保证机器人“来得及反应”。

这也让丁文伯正在研究的问题比“机器人需不需要触觉”更具体了一层。

视觉仍然会是机器人理解世界最重要的信息来源,VLA也仍然是主流路线。真正没有被定义清楚的是:触觉究竟只是现有视觉模型增加的一种输入,还是因为它对接触、运动和实时反馈的特殊要求,最终会生长出一套不同于视觉智能的模型和计算逻辑。

丁文伯现在做的,就是试图找到这个答案。以下是左林右狸与丁文伯的对话(在不改变原意的基础上做了部分编辑):


01 “科研困难户”是怎么入门的?

左林右狸:2007年安徽省理科第三名,为什么读清华电子系?

丁文伯:当时没考到省状元,就“没法选经管”。那时候我们很多人都想读经管。刚好来招生的是电子系老师,他跟我讲了一番电子系的“宏伟蓝图”,最后我就去了电子系。我记得当年我们学校有几个同学,分别是全省第二、第三、第六名,最后全被这位老师招进了电子系。

左林右狸:这位老师当时给你讲的“宏伟蓝图”是什么?

丁文伯:他的“宏伟蓝图”其实很简单,他说你学不了经管,清华在安徽只招一个人,你去不了。后来我才听说,经管在安徽其实招了5个人。不过也没关系。前两天我还跟同学说,人生里很多选择,当时你可能觉得自己做了一个很好的决定,但最后真正改变人生的,往往是一些不经意的选择,甚至是被迫做出的选择。