虎嗅

WAIC,机器人变了

该文章尚未提供 Русский 解读,以下为中文版内容。

核心内容总结

今年WAIC大会上,具身智能首次独立成馆,成为与智算并列的核心赛道。相比去年,参展企业从80多家增至200多家,真机超300台且全部动态运行(去年以静态为主)。最大变化是:机器人形态从单一“炫技人形”转向场景适配(工业轮式、消费小人形、载人机甲等);大脑从“死记硬背动作”的VLA模型,向能“脑内预测”的世界模型进化;落地卡点集中在数据采集和灵巧手技术,但整体仍处早期探索阶段,离真正实用还有距离。

一、形态:从“人形独占C位”到“按场景选样子”

去年WAIC是150台人形机器人比后空翻、做咖啡,今年人形不再是唯一主角,厂商们开始“按场景反推形态”:

  • 工业务实派:用轮式或轮臂组合替代人形,追求稳定和量产。比如智元的轮式精灵G2Max能24小时搬货,它石智航把汽车线束产线搬进展台,用“轮式底盘+双臂”集群作业,成本低、能连续干活。
  • 消费小人形:把人形做小、降价抢市场。松延动力的小布米身高94cm,定价9998元(全尺寸人形要几十万),能跳舞还支持手机更新;加速进化的小人形直接在展台踢足球,走科研竞技路线。
  • 新形态探索派:按环境变样子。宇树的载人机甲能坐人操控(售价390万);上纬启元T1室内用轮足(安静转弯小)、户外变四足(过草地台阶);逐际动力的模块化机器人能拼成“半人马”,背30kg还能拖轮胎。

一句话:以前是“人形万能”,现在是“什么场景用什么样子”,形态打散但更贴近真实需求。

二、大脑:从“背动作”到“会思考”

机器人的“大脑”是看不见的核心比拼。去年主流的VLA模型(视觉-语言-动作)像“背菜谱”——记住固定动作,但换个场景就懵。今年大家都在试“世界模型”:让机器人先在脑内预测“这么做会怎样”,再决定动作,相当于“会自己想菜谱”。

  • 长程任务:银河通用的机器人能连续做3-5分钟早餐(烤面包、倒饮料),就算杯子被挪了也能重新找;原力灵机的6台机器人用模型连续拼15小时积木长城,不中断。
  • 复杂操作:星尘智能的机器人能煎蛋颠锅、打蝴蝶结,不是背动作,而是“脑内想象”:蛋在中间不好颠,得先滑到锅边,再压手调整。
  • 不同解法:银河通用的“测试时训练”(TTT)让机器人看人类视频就能适应新环境;星尘的“隐式模型”省算力但像黑盒(看不到脑内过程);腾讯的RxBrain用文字+图像让左右脑联动,兼顾推理和想象。

现在VLA和世界模型不是二选一,而是一起进化——背动作的基础上,开始学思考。

三、落地卡点:数据和灵巧手是“拦路虎”

机器人为什么还进不了家、厂?主要卡两个地方:

  • 数据不够:世界模型虽缓解了数据压力,但高质量真实数据还是刚需。今年WAIC第一次出现专门的数据采集公司:
  • 本体厂自采:宇树、乐聚自己采数据,“采什么练什么”但封闭;
  • 卖“铲子”:觅蜂科技的手持设备(像游戏手柄)能记录毫米级轨迹,普通人就能采,不绑机器人;
  • 打包卖:大晓机器人把数据采集设备和世界模型绑定,客户不用转格式直接用。

大家都在抢2026年“具身数据元年”的机会,谁能低成本搞到标准化数据谁占优势。

  • 灵巧手不行:末端手不灵活,再好的大脑也白搭。今年重点从“腿”转到“手”:

灵心巧手的全直驱手(电机直接连关节)力控精准,能做汽车精密装配;超维动力的手有37个关节,指尖能感知0.1牛的力度,还能砸木板不碎。但怎么做“完美的手”还没共识,成本和精度还在平衡。

四、行业现状:热闹背后仍在“试错期”

虽然今年进步明显(任务时长从秒级到小时级,操作从简单到复杂),但离实用还有距离:

  • 展会上的demo大多是“可控环境下演出来的”,比如搬运、踢球,换个真实场景可能就卡壳;
  • 零售、物流、工业离“可用”还远,家庭服务更是遥遥无期;
  • 大脑架构、数据标准、灵巧手技术都没定,各家还在摸索。

就像现场创业者说的:“真正丝滑的还是跳舞、迎宾这类简单活,复杂场景还得熬很多年。”WAIC的热闹是信号,但具身智能要从“展台秀”到“真干活”,还有很长的路要走。

(全文用大白话拆解,避免专业术语,重点突出变化和痛点,让非财经/科技背景的人也能看懂行业现状。)