核心内容总结
今年以来,触觉技术赛道的竞争从“比传感器硬件”升级为“拼全链条能力”——企业不再只强调传感器多灵敏,而是开始布局数据采集、模型训练和评测基准。触觉的价值在于能弥补纯视觉模型“看得见但摸不透物理规律”的短板,让机器人更懂真实世界;但麻烦在于,不同传感器输出的触觉信号差异大(像“方言”),模型容易被绑定在特定硬件上,跨设备迁移难。目前企业多走“全栈闭环”路线(自己做传感器+数据+模型)快速落地,但长期来看,谁能建立通用的触觉数据标准或模型架构(比如触觉版ImageNet/Transformer),谁才能突破硬件限制,成为赛道头部玩家。
一、触觉赛道:从“卖硬件”到“拼全链条”
以前大家聊触觉,焦点都是“我的传感器能测多少个压力点”“灵敏度多高”。现在不一样了——企业开始晒数据集、模型和评测基准,因为光有硬件没用,得让机器人学会用触觉干活。比如:
- 千觉机器人同时发布“数采夹爪(采集触觉数据)+千小时视触觉数据集+触觉模型”,形成从数据到模型的闭环;
- 戴盟机器人开源1万小时全模态数据集,还做了触觉操作评测基准(相当于给模型出“考试卷”);
- 他山科技传感器月销几万枚,但也开始建触觉训练平台,研发“触觉原生模型”。
这背后的逻辑是:机器人要完成抓握、装配等任务,不仅需要传感器“感知”,更需要数据教它“理解”(比如“抓杯子时用多大劲才不会滑”),模型则把这些经验转化为动作。所以现在的竞争,是从“一块传感器”扩展到“数据采集→模型训练→效果评估”的整条技术链。
二、触觉为啥能让机器人更懂物理?
纯视觉模型有个大问题:看得见,但摸不透。比如:
- 杯子被手挡住,模型可能以为杯子“消失”了(违反物体恒存性);
- 抓东西时,不知道物体滑不滑,容易掉;
- 接触状态模糊时,会凭空想象出不符合物理规律的画面(比如杯子悬浮)。
加入触觉后,模型能获取接触时的力、形变、摩擦力等信息,就像人用手摸东西一样,能更准确理解物理世界。比如:
- 华盛顿大学和Meta的论文显示,加触觉后,模型理解“物体恒存”的能力提升33%,符合运动规律的比例提升29%;
- 新智具身的模型在仿真任务中成功率达84.5%,比纯视觉模型(48%)高近一倍。
简单说,触觉让机器人从“看客”变成“参与者”,能真正“感受”世界,而不是只“看”世界。
三、触觉的“方言问题”:跨硬件迁移难
触觉的最大麻烦是:不同传感器输出的信号像“方言”,模型学了一种,换另一种就听不懂。比如:
- 有的传感器测压力数值(比如“10牛”),有的测接触面形变图像,有的测不同方向的力;
- 斯坦福团队把触觉信号直接拼到视觉模型里,成功率从17%降到6%,后来专门设计了处理高频触觉信号的流程,才提到65%。
为啥会这样?视觉领域有摄像头这种标准化硬件(比如手机摄像头都输出RGB图像),但触觉传感器路线太多(电容、压阻、视触觉等),没有统一标准。这就导致模型学到的可能是“这套传感器打滑时电压怎么变”,而不是“物体打滑时摩擦力的规律”——换个传感器,模型就得重新学,相当于“换个地方就得学新方言”。
四、企业的应对:先闭环落地,再求通用
面对“方言问题”,企业现在有两种思路:
1. 全栈闭环路线:自己做传感器、数据采集、模型训练,形成内部适配的系统。比如千觉、戴盟,这样各环节之间的适配成本低,能快速给客户提供“能跑通的方案”(比如抓握特定物体的机器人)。这是当前商业化的主流,因为客户要的是“能用的产品”,不是“通用技术愿景”。
2. 通用标准探索:试图建立跨传感器的“翻译器”。比如清华大学等机构的FTP-1模型,用不同编码器处理不同传感器的信号,再把它们放进统一的“触觉语言空间”。实验中,FTP-1在没见过的传感器上微调后,成功率比基线模型高3倍。但它还不完美——换新传感器要重新训练编码器,不能直接迁移。
短期看,全栈派更容易落地;长期看,通用派才能突破硬件限制(比如让模型在不同机器人、不同传感器上通用),拿到更大的市场。
五、未来机会:谁能做出“触觉界的ImageNet”?
视觉领域的爆发,离不开ImageNet(通用图像数据集)和Transformer(通用模型架构)。触觉赛道要想规模化,也需要类似的通用基础设施:
- 通用数据集:像ImageNet一样,能让不同传感器的数据都能用来训练模型;
- 通用模型架构:能处理各种触觉信号,不需要为每个传感器重新设计模型。
现在FTP-1是个开始,但还远不够。未来谁能解决“方言问题”,建立通用的触觉数据标准或模型,谁就能成为赛道的“规则制定者”,拿到大估值。
总之,触觉让机器人更懂物理,但也给规模化带来了挑战。现在是“闭环落地”的阶段,未来则是“通用标准”的竞争——最终目标是让模型不用跟着每款传感器重新学物理,真正实现跨硬件的通用。
(全文用大白话拆解,避免专业术语,非财经/技术背景也能轻松理解~)