虎嗅

被高估的视触觉:容易复制的生意,能有多大投资价值?

核心内容总结

视触觉传感器(VBTS)是当前具身智能触觉赛道的热门方向,但它本质上是“视觉技术的附庸”——依赖现成的视觉硬件和算法,缺乏独立的核心技术。由于原理和硬件结构的先天缺陷,它在工业落地时面临体积大、易损坏、力感知不准、算力负担重等问题,无法满足具身智能大规模应用所需的稳定性、可靠性和规模化要求,最终难以成为支撑产业级触觉感知的基础设施。

一、学术热闹但产业“空心”:没核心技术,全靠“拿来主义”

视触觉传感器的热度,其实是蹭了视觉技术的“红利”:

  • 硬件“拼装”:核心元件(如CMOS摄像头)都是买现成的,创业公司只是把摄像头、弹性体、光源拼起来,没有自己的底层工艺。高校学生都能快速做出原型,导致硬件门槛极低,几十家公司做的产品都差不多,同质化严重。
  • 算法“照搬”:研究用的算法(如ResNet、U-Net)都是直接从视觉领域拿过来的,没有针对触觉的物理特性做原创改进。论文发得多,但没有真正解决触觉感知的核心问题。
  • 资本不买账:因为没有核心技术,供应链依赖别人,商业模式容易被复制,资本觉得风险高——这种“拼装式创新”没有护城河,赚的是辛苦钱,成不了行业标准。

二、硬件天生“娇气”:体积大、易坏、算力吃得多

视触觉的硬件结构决定了它“不适合工业场景”:

  • 体积大装不下:摄像头需要最小焦距,导致传感器厚度通常超过10mm,机器人手指里本来就挤(有电机、减速器),根本塞不下太多视触觉模组。
  • 弹性体“两难”:弹性体软了灵敏度高,但容易磨损、老化(像果冻一样用久了变形);硬了耐用,但形变太小,摄像头拍不到细节,灵敏度直接下降。这是物理上的死结,没法兼顾。
  • 算力“黑洞”:如果机器人双手都装视触觉,需要几十个摄像头,每路视频都要处理,算力需求暴涨(比如30路需要160+TOPS算力,得外挂服务器),功耗超百瓦,机器人根本背不动。而且线太多,手指根部直径才几毫米,根本穿不过去。

三、力感知“猜不准”:原理上就有缺陷

触觉的核心是“测力”,但视触觉是“间接猜力”,天生不准:

  • 信息丢失:把3D的力(比如按压、滑动)压缩成2D图像,再反推回去,就像从一张照片猜物体的真实形状——信息不够,容易猜错。比如多点接触时,力的方向和大小算不准。
  • 像素≠测力点:很多厂商说“每平方厘米四万感知单元”,其实是摄像头的像素数,实际有效测力点只有几百个,而且没有3D信息。堆像素没用,反而增加噪声。
  • 动态响应慢:摄像头帧率只有30-60fps(每秒拍30-60张),但机器人抓东西时的冲击力是毫秒级的,根本拍不到。比如抓鸡蛋时,冲击力瞬间就过了,视触觉还没反应过来,鸡蛋可能已经碎了。

四、工业落地难:环境一复杂就“罢工”,规模化更是没戏

真实工业场景(油污、高温、振动)对传感器要求极高,但视触觉扛不住:

  • 环境干扰大:油污粘在弹性体上,摄像头拍不清;温度变化会让弹性体变形、光源衰减,信号漂移严重。比如在潮湿环境里,水汽凝结在镜头上,直接“瞎了”。
  • 长期可靠性差:弹性体用久了会老化(蠕变),力和图像的映射关系就变了,即使摄像头还在拍,输出的也是错误信号。这比没信号更危险——机器人会根据错误的力反馈操作,导致工件损坏或事故。
  • 规模化成本高:装一个视触觉传感器不贵,但配套的算力、布线成本很高。比如一台机器人装30个,算力和功耗成本可能比传感器本身还高,企业根本用不起。

结语

视触觉传感器适合实验室研究、教学演示,但成不了产业级的触觉基础设施。具身智能要落地,需要的是能稳定测力、耐用、易集成的技术,而视触觉从原理到硬件都满足不了这些要求。它的热度只是暂时的,最终会被更适合工业场景的技术替代。