虎嗅

独家|一个爱折腾的95后,靠做机器人“大脑”拿到5个亿

核心内容总结

这篇新闻聚焦95后连续创业者穆泽林的第三次创业——眸深智能,该公司主打“世界动作模型”(机器人的大脑),已累计融资近10亿元。与多数从实验室走出、先搞论文的团队不同,穆泽林从第一天就强调商业化,拒绝“展厅式假订单”,只接有规模化需求的真订单。其技术路线针对当前具身智能的痛点:主流VLA(视觉语言动作模型)像“背动作”,换场景就失效;而世界动作模型让机器人理解物理规律,能适应环境变化。团队由穆泽林负责商业(销售、融资)和复旦长聘教授陈涛负责技术,强调成建制研发(40+博士分板块),认为世界模型是系统工程,不是靠单个天才就能追上的。

一、连续创业者的“踩坑”与迭代:从AI客服到机器人的大脑

穆泽林的创业之路是“螺旋上升”:

  • 第一次:大学做教育,积累行业认知;
  • 第二次:毕业后做AI智能客服(木心智能),做到1亿年收入、2000万利润,但发现问题——模型架构错了(依赖分散的中小企业语料,大模型出来后数据价值暴跌),且是“项目制”公司,难突破天花板;
  • 第三次:定了三个标准:做AI、做多模态(不只处理文字)、做“按个卖”的产品(不是项目制)。最终锁定“机器人大脑”——世界动作模型,因为它符合多模态、可规模化(按个卖机器人),且和复旦陈涛团队的技术积累匹配。

他的教训:模型结构比数据量重要,太早商业化可能限制扩张;要做能长期干的事,而不是赚快钱被卖掉。

二、技术路线:为什么VLA“不行”,世界动作模型才是未来?

用大白话解释:

  • VLA的问题:像“背唐诗三百首”——机器人在固定高度桌子上拿盘子会,但桌子降20厘米就不会,因为它只记“动作轨迹”,没理解物理规律(比如桌子矮了要弯腰更多);还浪费算力(识别桌子花纹这种无关信息)。
  • 世界动作模型的优势:学“语法”而非“背诗”——理解环境变化和动作的关系(桌子矮→调整弯腰幅度)。它生成的是通用动作轨迹,能适配不同机器人(像穿动捕服,同一套动作可驱动不同机器人),解决跨场景、跨本体的问题。
  • 穆泽林的判断:纯VLA走不通,会被世界模型“吃掉”(变成辅助的“小脑”);世界模型现在成熟度只有20%-30%,但聚焦“环境-动作关系”(丢掉无关信息),落地更快——新场景交付目前要2-3个月,2028年有望缩到2-3周。

三、商业化:拒绝“展厅机器人”,只接“真订单”

穆泽林的商业化逻辑很实在:

  • Day1就要赚钱:企业不是实验室,要穿越周期,技术得“上货架”(不是放书架);
  • 筛选真订单:
  • 看需求规模:比如岗位有1万人,才可能买1万台机器人(拒绝只买1台放展厅的客户);
  • 设门槛:先收几百万研发费——真有大规模需求的客户,摊到每台成本低;假需求的客户不会付这笔钱;
  • 不做项目制:要做“按个卖”的产品(比如卖10亿颗机器人大脑),而不是赚一次性项目钱。

他的目标:让眸深成为10亿收入级别的公司,而不是小而美的分红型企业。

四、团队与竞争:成建制研发是“护城河”,不怕跟风者

  • 分工明确:穆泽林管商业(销售、融资),陈涛管技术(底层算法+工程化);技术方向会议穆泽林会听,但不插手细节;
  • 成建制研发:和复旦联合实验室有40+博士,分成4个板块——一个人离开只能带走1/40的知识,不是靠单个天才;
  • 竞争观:
  • 真正对手是“两年前就开始做世界模型的团队”(国内外没几家);
  • 2026年后新成立的团队大多是蹭风口——世界模型是系统工程,从零开始太晚;
  • 不担心00后“小天才”:单靠天才追不上,需要长期积累和团队协作。

五、融资与行业判断:为什么选国资和产业资本?

  • 融资选择:本轮主要是国资(深报一本、陕西高新投)和产业资本(安宇基金等),原因:
  • 国资:有政策背书、资源协同;
  • 产业资本:直接带场景和订单;
  • 这些资本更有耐心(没有存续期压力),适合世界模型这种长期研发项目;
  • 行业未来:技术路线会收敛(像大语言模型最终找到Transformer架构),世界动作模型是最接近“第一性原理”的路线;社会最终奖励“真正付出的人”,而非投机者。

这篇报道本质上是讲一个“懂商业的技术创业者”如何在AI赛道里找对方向——既不脱离技术(靠成建制研发),又不忽视市场(早期商业化+筛选订单),试图在理想主义(做长期技术)和现实主义(赚钱活下去)之间找平衡。