虎嗅

让几万个AI替人类试错,一门“预演未来”的生意正在崛起

该文章尚未提供 Français 解读,以下为中文版内容。

核心内容总结

AI用户模拟是用成千上万AI智能体(像“数字人”)仿真人类群体的决策行为,形成能“预测未来”的沙盘。这项技术能预测美国大选、优化电商策略、测试AI产品,硅谷顶级VC已投几亿美元支持相关初创公司。它不是单一技术,而是从数据生成到群体预测的五层架构;目前在电商领域落地最快,能帮商家省成本提收入;不能替代传统A/B测试,但能做“预飞检查”筛选无效方案;未来还可能实现更真实的数字孪生(比如让逝去的家人“活”过来)。

一、用户模拟到底是啥?五层架构讲明白

用户模拟不是“猜未来”的魔法,而是分五步搭建的“数字沙盘”:

  • 第一层:数据模拟:给AI练手的“假素材”。比如模拟用户的邮件、文档、购物记录,解决真实数据不够的问题(像Google内部用这个训练Gmail助手)。
  • 第二层:交互模拟:测试AI会不会“翻车”。给AI智能体设定不同性格(比如暴躁用户、礼貌用户),和AI产品对话,看它会不会说违规的话(比如Google用这个测试智能音箱)。
  • 第三层:旅程模拟:模拟用户完整行为路径。比如你逛淘宝,从看到广告→点进去→犹豫→加购物车→忘了付款,这些连续动作都能被AI模拟。
  • 第四层:个体深度模拟:像“克隆”一个人。通过两小时深度访谈+问卷,让AI不仅模仿外貌,更模仿这个人的思维和行为(比如斯坦福的Simile能解决“嘴上说支持民主党,实际投特朗普”的“说做不一”问题)。
  • 第五层:群体预测:模拟一群人的决策。用几千个智能体交互,预测大选结果、市场趋势(比如Aaru能快速复现调研结果,相关性达0.9)。

二、硅谷为啥砸钱?“预测未来”太诱人

2025年用户模拟成了硅谷最火赛道,Simile和Aaru两家公司合计融了几亿美元,原因很简单:

  • Simile(斯坦福出身):靠“深度个体模拟”出圈。他们做过虚拟小镇实验,让几十个智能体自主社交;还解决了行为科学的“说做不一”问题——通过访谈让AI更准预测真实行为(比如用户嘴上讨厌某产品,实际会买)。
  • Aaru(宏观视角):和安永合作,能一天完成原本数月的调研。但也有局限:只能预测“已发生的调研”,像萨克拉门托市长选举这种小概率事件,难度就大了。

硅谷投钱是赌“预测未来”的终极能力——谁能让AI更准模拟人类,谁就能在商业、政治等领域抢得先机。

三、电商先“吃螃蟹”:模拟用户购物帮商家赚钱

UserApproved(另一家初创公司)选了电商赛道,因为购物行为相对好模拟:

  • 怎么玩? 接入商家的真实数据(比如Google Analytics、Shopify),再让AI智能体在虚拟环境里“购物”——比如模拟用户看到促销→点视频→忘了付款的路径。
  • 输出啥? 每天给商家建议:“今天改3个地方, revenue能涨5万美元”(比如调整促销文案、优化视频位置)。
  • 为啥有效? 它不是罗列数据,而是直接给“总监级”决策——帮商家省掉试错成本,不用盲目做A/B测试。

四、能替代A/B测试吗?是“预飞检查”不是“终结者”

很多人问:用户模拟能取代A/B测试吗?答案是“不能,但能让它更高效”:

  • 问题在哪? 直接让大模型扮用户打分,容易“夸张”——比如改一句文案,AI可能说“B比A好10倍”,但真实用户根本没感觉;而且大模型有偏见,样本多也没用。
  • 价值在哪? 做“预飞检查”——比如商家本来要测10个方案,用模拟先筛掉7个明显不行的,剩下3个再做真实A/B测试,省时间、省流量、省成本。

五、技术难点和未来:让AI“故意犯错”+数字孪生

用户模拟的技术挑战不少,但未来想象空间大:

  • 技术难点
  • 让AI“故意犯错”:比如模拟不聪明的用户(GPT太聪明,总是把问题解决得太好,得让它“装笨”);
  • 保持行为一致:比如模拟用户逛淘宝几百步,不能中途“人格分裂”(得靠记忆系统和反思机制)。
  • 未来展望
  • 商业决策彩排:比如新品上市前,先模拟用户反应;财报会议前,模拟投资者提问;
  • 数字孪生2.0:现在的数字孪生只是“长得像”,未来能让它“思维像”——比如让逝去的家人“活”过来,和你聊天、做决策,而不是单纯回答问题。

用户模拟不是“水晶球”,但它正在成为决策的“基础设施”——帮我们在不确定中找到方向,这可能是AI的第三次浪潮(第一次信息检索、第二次内容生成、第三次行为预测)。

(全文用大白话拆解,避免专业术语,希望非财经人士也能轻松看懂~)