核心内容总结
阿里在视频生成模型赛道同时推进两个功能高度重合的模型——HappyHorse和Wan 3.0:前者出身淘天实验室,主打商业场景;后者来自通义体系,侧重基础能力。尽管两者最初路线不同,但随着Wan 3.0迭代,功能(文生/图生视频、编辑等)和用户群体逐渐重叠,甚至在同一平台用不同价格竞争。目前团队已合并到同一事业部,却仍各自更新模型,造成资源浪费。文章认为,视频生成模型烧钱且商业模式未稳定,阿里应尽早合并两者,集中资源突破核心能力,而非继续无意义的内部赛马。
一、内部赛马:从“合理尝试”到“资源内耗”
一开始,阿里让两个团队走不同路线是有道理的:
- Wan 属于通义大模型体系,像“通用工具箱”,强调技术底层能力和开发者生态,适合做基础研究;
- HappyHorse 来自淘天实验室,像“场景专用工具”,主打广告、短剧等商业场景,更贴近用户需求。
但现在情况变了:
- 功能重合:Wan 3.0把HappyHorse的核心能力(如原生音频、人物一致性)都吸收了,甚至价格更便宜(720P每秒0.6元 vs HappyHorse的0.9元);
- 团队合并:今年6月,两个团队已被整合到吴泳铭负责的Token Foundry事业部,组织上早该协同;
- 客户重叠:都在阿里的百炼平台上抢同一批企业和创作者客户。
继续赛马就像“家里有两台洗衣机,功能差不多,却要分开买洗衣液、占地方,还互相抢插座”——不仅浪费钱和人力,还让用户 confusion(不知道选哪个)。
二、视频模型赛道:天生不适合“长期赛马”
视频生成模型和互联网产品不一样,它有两个特点决定了不能一直内部竞争:
1. 烧钱烧资源:训练视频模型需要海量数据、超算算力,每一次迭代都是真金白银砸出来的。两个模型分开训练,等于双倍成本做同一件事;
2. 技术路线趋同:现在视频模型的核心能力(时长、画质、多模态输入)大家都在追,HappyHorse和Wan 3.0已经处在同一水平,差异只是“口味偏好”(比如这个擅长人物,那个擅长镜头),不是“代际差距”(比如智能手机 vs 功能机)。
就像两个人一起爬山,一开始走不同路,但到了半山腰发现路越来越近,再分开走就是浪费体力——不如合并路线,一起冲顶。
三、没有“长板”的全能和低价,都是“伪优势”
不管是Wan 3.0还是HappyHorse,都没有一项“让用户非用不可”的核心能力:
- Wan 3.0 说自己能生成30秒视频、支持PPT输入,但用户真正需要的是“生成的内容一次能用”——如果人物动作僵硬、场景跳帧,即使功能再多,用户还是要反复生成,总成本反而更高;
- HappyHorse 主打广告和短剧,但如果人物一致性不够(比如前一秒穿红衣服后一秒变蓝),商品还原不准(比如口红颜色不对),商家根本不敢用;
- 低价陷阱:Wan 3.0的720P更便宜,但如果生成10次才得到一条可用视频,总费用反而比HappyHorse更高。用户要的是“性价比”,不是“单价低”。
举个例子:你去剪头发,一个理发师说“我什么发型都能剪,还便宜”,但剪出来的效果每次都不一样;另一个理发师只擅长剪短发,但剪得又快又好——你会选哪个?视频模型也是一样,没有长板,全能和低价都是空的。
四、合并最优解:底层统一,上层分工
文章建议阿里这么做:
- 底层合并:把Wan作为统一的基础模型,吸收HappyHorse在商业场景(如广告、短剧)和人物表现上的经验,集中资源把核心能力(比如人物一致性、动作自然度)做到行业顶尖;
- 上层保留品牌:HappyHorse继续作为面向创作者的产品品牌,负责做模板、工作流(比如一键生成广告脚本),让用户用起来更方便。
这样既避免了重复造轮子,又能兼顾技术深度和用户体验——就像手机厂商,底层芯片统一研发,上层可以做不同系列的手机(比如华为的Mate和P系列),各有侧重但共享核心技术。
五、阿里的“思维惯性”:前AI时代的赛马不适用了
阿里以前做互联网产品(比如电商、社交)时,喜欢用内部赛马(比如多个团队做类似APP)来快速试错,赢者通吃。但AI模型不一样:
- 互联网产品试错成本低(写个APP代码花不了多少钱),但AI模型试错成本极高(训练一次可能要几百万);
- 互联网产品靠“快速迭代功能”取胜,AI模型靠“核心技术突破”取胜——你得先把“地基”打牢(比如模型的生成质量),才能盖高楼(拓展场景)。
所以阿里现在的问题,是还没从“互联网产品思维”切换到“AI模型思维”——继续赛马,只会分散资源,错过在视频模型赛道建立优势的机会。
最后一句话总结
阿里与其让两个模型互相抢客户,不如把它们拧成一股绳,集中力量做一件“别人做不到的事”——这才是在AI时代胜出的关键。