第一财经

对话腾讯张正友:机器人养老不易做,与人接触不可出现差错

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

这篇新闻围绕WAIC(世界人工智能大会)上的具身智能机器人展开,核心信息可概括为:具身智能机器人技能进步明显,但同质化严重、尚未大规模落地;养老场景是潜力方向但难度极大(安全要求极高);当前机器人存在“缸中之脑”的智能缺陷(缺乏物理世界互动闭环);技术突破需解决数据打通和技术栈收敛问题;腾讯正通过平台、模型和真实场景迭代布局这一领域

详细解读

1. 具身智能机器人:技能“上新”快,但“撞脸撞活”问题突出

WAIC展馆里的机器人已经能做分拣、倒茶、打乒乓球等活,比两年前“呆站着或被吊起来”的前辈灵活多了。但腾讯科学家张正友发现,这些机器人“长得差不多,能干的活也差不多”——不管是外观形态(比如都是人形或机械臂),还是落地场景(大多瞄准工业领域),同质化严重。目前大家都在找能大规模应用的场景,但还没找到“独一份”的突破口,所以都处于摸索阶段。

2. 养老场景:想进家庭却卡“安全关”,是最难啃的骨头

张正友特别提到,希望更多企业关注养老场景,但这个场景的难度“天花板级”。为啥?因为机器人要和人直接物理接触,必须100%安全——比如搀扶老人时,稍微用力大一点就可能捏伤骨头,这种差错绝对不能有。要解决这个问题,机器人得同时具备触觉(摸东西的感觉)、力觉(感知用力大小)、视觉,而且这三者要“无缝配合”:触觉反馈快(1毫秒)、视觉反馈慢(30毫秒),得把不同速度的信息整合起来,让机器人能精准控制力度。腾讯的“小六计划”机器人已经进养老院试运营,就是为了在真实场景里找问题、迭代改进。

3. 当前机器人的“智能硬伤”:是“缸里的聪明脑”,不会和世界互动

张正友说,现在最聪明的AI其实是“缸中之脑”——就像把一个超级聪明的大脑关在玻璃缸里,它会推理、写文章、回答问题,但没有身体去接触真实世界。比如它知道“杯子是装水的”,但可能不知道怎么拿才不会掉;如果杯子被移动了位置,它也不会调整动作。真正的智能需要把“语言理解、视觉观察、空间认知、身体控制、环境反馈”连起来,这样机器人才能在变化的环境里灵活应对。

4. 让机器人变聪明:得把四类数据“打通”,技术路线还没定

要训练出更智能的机器人,需要四种数据:①网上的视频(比如别人怎么操作);②人第一视角的操作视频(比如你用手机拍自己泡茶的过程);③带传感器手套收集的触摸数据(比如摸杯子时的力度、温度);④远程操作机器人的数据(比如人控制机器人干活的记录)。这些数据要整合起来,机器人才能学透“怎么做”。另外,具身智能的技术路线还没“定调”——大语言模型(比如ChatGPT)已经有成熟的技术方法,但具身智能还在探索:去年流行“视觉语言动作模型(VLA)”,今年又讲“世界模型”,但怎么实现世界模型还没统一答案,大家还在试错。

5. 腾讯的布局:搭“大脑”、练“身体”,扎进真实场景找答案

腾讯去年推出了Tairos具身智能开放平台,相当于给机器人搭了个“通用大脑”;今年WAIC又发布了Hy-Embodied-VLM-1.0等新模型和智能体框架,目的是完善机器人的“大小脑”,让身体的感知(比如触觉、视觉)和大脑的决策连通起来。他们的“小六计划”机器人进入养老院,就是想在真实场景里“实战”——比如遇到老人突然摔倒,机器人怎么反应?怎么安全搀扶?通过这些真实问题,不断优化技术。

这篇新闻其实告诉我们:具身智能机器人离“走进家庭”还有一段路,但养老等场景的需求已经很明确,技术突破的方向也清晰了——解决安全问题、打通数据、找到统一的技术路线,就能让机器人真正“活”起来。