核心内容总结
这篇对话围绕极佳视界在具身智能(简单说就是能像人一样在物理世界动手做事的机器人)领域的布局展开,核心讲了5个关键方向:
1. 模型路线选择“世界-动作模型(WAM)+语言模型”分工合作,而非二选一;
2. 当前行业最大卡点不是模型架构,而是高质量数据和标准化评测体系;
3. 坚持自己做机器人本体,为了获取真实场景数据、形成“模型-本体-场景”闭环;
4. 家庭机器人先从人才公寓等标准化场景测试,再逐步推向普通家庭;
5. 商业化的核心是让用户愿意买单,解决实际家务问题,而非仅靠实验室演示。
详细拆解解读
1. WAM和VLA:不是“对手”,是“搭档”
你可以把WAM理解成“动作实操员”,VLA是“任务指挥官”。
- WAM的强项:通过看视频学具体动作细节(比如拿笔时手指怎么抓、切番茄的力度),适合处理精细、需要适应物理环境的操作(比如在不同药房拿药,应对不同摆放位置);
- VLA的强项:用语言把长任务拆成步骤(比如“做番茄炒蛋”拆成“切番茄→倒油→炒番茄→放鸡蛋”);
- 两者怎么配合?长任务由VLA拆分成小步骤,每个小步骤的精细操作交给WAM。比如做番茄炒蛋,VLA说“第一步切番茄”,WAM负责具体怎么切(不管番茄放左边还是右边,都能准确操作)。
所以不是谁替代谁,而是各干各的擅长活。
2. 数据和评测:比模型更“卡脖子”
现在行业里很多人在争论模型架构,但极佳视界认为数据和评测才是当前最大的问题:
- 数据不是越多越好,而是要“高质量”:
数据像机器人的“练习题”,得覆盖多样场景(比如不同家庭的厨房布局)、动作细节准(比如拿杯子时有没有碰到旁边的碗)、还要记录失败案例(比如掉了东西)。他们估算,家庭机器人需要1000万小时的高质量数据才够用,但现在远没达到。
- 评测得有统一标准:
就像考试要有统一试卷,不然不同团队的机器人“做100次任务成功多少次”的结果没法比。比如有的团队算“拿起来就算成功”,有的算“拿到指定位置才算成功”,这样排名没用。极佳视界内部专门有独立团队做评测,用自动化方法打分,减少主观误差。
3. 自己做机器人本体:为了“一手数据”和“控风险”
很多AI公司只做模型,但极佳视界还要做机器人硬件(本体),原因有两个:
- 验证模型必须靠自己的硬件:如果用别人的机器人,模型好不好没法准确验证,换平台或供应链变了还会有风险;
- 拿真实场景的数据回流:自己的机器人进到工厂、人才公寓后,能把真实使用中的问题(比如碰倒东西、用户说“拿杯子”但机器人拿错了)反馈回来,让模型和本体一起改进,形成“机器人用起来→数据回来→模型优化→机器人更好用”的闭环。
比如他们的Maker H01机器人,现在在工厂里参与制造机器人零件,就是为了测试它的精细操作能力,同时收集数据。
4. 家庭机器人:先在“半真实场景”练手
普通家庭太复杂(每家东西放的位置、装修风格都不一样),所以极佳视界先从人才公寓、酒店这些相对标准化的场景入手:
- 比如武汉的光谷之寓,机器人能做清洗衣物、整理卫生间、番茄炒蛋等长任务,但这不是卖给用户,而是为了收集真实反馈(比如用户觉得“切番茄太慢”)和数据(比如公寓里的杯子都放在哪里);
- 等模型在这些场景里练熟了,能应对大部分情况,再推向普通家庭。
5. 商业化:用户愿意买单才是“真能打”
家庭机器人不是“演示好看就行”,得满足两个条件才算能卖:
- 用户愿意买回家:比如机器人刚到家时可能需要教(像教小孩一样),但教过之后能越来越好,真正帮用户做家务(比如每天自动整理衣服);
- 能持续解决问题:用户愿意为它提供的服务付费(比如每月付多少钱让它帮忙做饭、打扫)。
现在他们的Maker H01已经交付超100台,今年目标是千台,但还要看产品稳定性(比如会不会经常出错)、客户验收(比如工厂是否满意它的装配能力)。
总结
极佳视界的思路很务实:不纠结模型路线的“对错”,而是用分工解决问题;不追求“一步到位”进普通家庭,而是先在半真实场景练手;把数据和评测放在优先位置,因为这是机器人能真正落地的基础。对用户来说,未来家庭机器人能不能“靠谱”,关键就看这些细节能不能做好。