第一财经

WAIC观察|当AI开始捕捉人类情绪,多模态情感识别步入物理世界

该文章尚未提供 日本語 解读,以下为中文版内容。

核心内容总结

2026年人工智能大会(WAIC)上,多模态情感识别成为大模型技术的新方向——AI不再只“听懂话”,还要“读懂情绪”(从语音、图像、文字等多种方式感知人的情绪)。众多厂商展示了相关技术(如声音人格测试、情绪感知大模型、带情绪的AI音乐),并尝试落地到教育智能体、AI硬件(机器人、耳机、眼镜)等场景。虽然这项技术的商业前景广阔,但目前仍处于初期阶段,面临数据标注难、识别准确性不稳定等挑战,同时行业也在思考如何构建健康的人机交互关系。

一、多模态情感识别成AI新赛道,厂商们都在做什么?

这次大会上,不少公司都亮出了“情绪感知”的新本领:

  • 模思智能:推出“声音人格测试机”——对着麦克风说话,AI能从你的语速、语气、节奏里分析情绪,生成一张“声音人格卡”(比如你是“温和型”还是“急躁型”)。
  • Soul:自研了SoulX大模型,专门做“情绪感知+多模态交互”,能给机器人、内容创作等行业提供方案(比如让机器人根据你的情绪调整说话方式)。
  • 昆仑万维:发布音乐大模型Mureka v9.5&O3,主打“把普通人模糊的灵感变成有情绪的歌”——比如你说“想要一首失恋后治愈的歌”,AI能生成带悲伤又温暖的旋律,还强调要做“最不像AI的AI音乐”。

简单说,这些技术的核心是让AI从“听内容”升级到“懂情绪”,不再是冷冰冰的工具。

二、情感识别已经用起来了?教育和硬件先试水

目前这项技术已经在一些场景落地:

  • 教育智能体:爱学AI学习智能体就是例子——它能实时捕捉学生的情绪波动(比如是不是走神了、有没有不耐烦),然后调整教学话术和节奏。比如你上课打哈欠,它可能会说“我们休息1分钟再继续吧”,而不是硬讲。技术负责人说,这是“问答工具变学习伙伴”的必经之路。
  • AI硬件:人形机器人(比如心言机器人)开始融合情感大模型;AI耳机、玩具、眼镜也接入了语音情绪识别功能。MiniMax声音实验室的工作人员说,用户现在不满足于“AI能说话”,更想要“AI说话的语气像人”——比如你不开心时,AI能温柔安慰,而不是机械回应。

三、为啥要搞情感识别?关系到AI能不能走进日常生活

模思智能的CMO说,这项技术的商业空间很大:

  • 传统场景:比如AI客服,如果能感知用户的愤怒情绪,就不会机械重复“请稍等”,而是及时安抚,提升服务质量。
  • 未来场景:当AI进入智能座舱(汽车里的AI)、陪伴设备(比如老人陪护机器人)时,情绪感知直接决定用户体验——比如你开车时生气,AI可能会播放舒缓的音乐,而不是继续导航。

说白了,AI只有“懂情绪”,才能真正融入物理世界,而不是停留在手机里的APP。

四、技术还嫩着呢,有啥拦路虎?

虽然趋势很好,但目前技术还不成熟:

  • 识别不稳定:大会现场噪音大、人偶尔结巴或语气变化,都会影响AI判断情绪的准确性(比如把“无奈的叹气”当成“生气”)。
  • 数据难搞:情感数据不像文字、图片那样好标注——比如“开心”有很多种(大笑、微笑、窃喜),很难大规模高质量地给AI训练。
  • 落地慢:就像AI眼镜的眼动追踪技术,大家早看到趋势,但花了好几年才成熟。情感识别也需要时间优化,不是一蹴而就的。

五、不止技术,还要想“人机怎么相处才健康”

作家陈楸帆说,AI的“最后一公里”不是技术本身,而是“怎么构建健康的人机关系”。比如:

  • AI会不会过度解读人的情绪?(比如你只是累了,AI却以为你抑郁)
  • 人机交互的边界在哪里?(AI能不能知道你所有的情绪隐私?)

这些问题比技术突破更值得思考——毕竟,我们要的是“懂情绪的AI伙伴”,而不是“窥探情绪的AI监控者”。

最后一句话总结

多模态情感识别是AI走向“更像人”的关键一步,现在已经看到苗头,但要真正走进日常,还得解决技术难题,同时想清楚“人机该怎么相处”。这既是机会,也是挑战。