在与用户的实时对话中,AI能否及时感知情绪?模型给出的“高置信度”结论,又是否经得起推敲?
围绕这些问题,来自蚂蚁集团与浙江大学的研究团队提出了面向流式视频情绪理解的框架TRACE。该框架通过持续跟踪模型情绪判断的变化过程,让情绪理解兼顾识别效果与响应效率。
团队同时构建了面向流式评测的数据集StreamMER,并在StreamMER、MELD和MER2024上验证了方法的有效性。
在StreamMER上,TRACE将仅使用在线音频判断的准确率从59.87%提升至69.47%,显著减少了多模态推理调用。
论文已被EMNLP 2026 Main Conference接收。
随着多模态大模型的发展,AI已经能够结合表情、声音和语言内容识别情绪。然而,现有研究大多采用离线设置:模型先获得完整视频、音频或对话文本,再输出情绪标签。
真实的人机交互提出了不同要求。在实时视频对话、具身交互和远程会议等场景中,信息不断到来,系统需要在观察尚不完整时形成判断,并随着新证据及时调整。
这带来了三个关键挑战:
因此,流式情绪理解需要回答的不只是“这是什么情绪”,还包括:现在的判断是否可靠,是否值得继续等待,以及是否需要更多证据?
为研究不完整观察下的情绪理解,团队基于《老友记》前两季构建了StreamMER数据集。
StreamMER保留了局部对话背景、说话人互动和场景信息,支持研究模型如何随着输入逐步到来形成情绪判断。
数据集具有以下特点:
StreamMER使研究者能够同时考察模型“识别得准不准”“何时作出判断”以及“为判断付出了多少计算成本”。
TRACE的核心洞察是:判断是否可靠,不仅取决于模型此刻有多自信,也取决于这个判断是如何形成的。
例如,模型连续多次判断为“悲伤”,与模型先后在“喜悦”“惊讶”“悲伤”之间切换,即使最终置信度相同,其可靠性也可能不同。
论文中的验证子集分析显示:
这些结果说明,预测轨迹中的波动能够提供单次置信度之外的信息。同时,轨迹不稳定的样本往往更能从上下文重判中获益:在发生一次类别切换的样本中,上下文重判带来74次有效纠正,而将原本正确的判断改错的情况为19次。
基于这一发现,TRACE综合分析置信度、预测分布的不确定性、类别切换和分布稳定性等信息,同时估计两个问题:
这使系统能够更有针对性地分配推理资源,将复杂的多模态分析用于更需要补充证据的样本。
TRACE由三个相互衔接的模块构成。
在线模块以Qwen2.5-Omni-3B为基础,持续处理音频前缀,利用语调、停顿、节奏和能量变化等线索,形成随时间更新的情绪概率分布。
训练时,团队对不同长度的音频前缀进行监督,并根据观察进度分配权重,让模型学习在证据尚不完整时形成初步判断。
系统根据情绪判断轨迹、错误风险和预期纠正收益,在三种动作中动态选择:
当系统请求重判时,基于Qwen2.5-Omni-7B的模块结合当前话语的多模态信息、前文背景、历史摘要和已有预测轨迹重新分析。
该模块不仅输出情绪标签,还生成判断依据,并更新对话摘要,为后续话语提供背景信息。在线设置仅使用已到达的信息,后续话语只用于离线对比分析。
通过上述设计,TRACE让稳定样本沿低延迟路径完成判断,让存在歧义的样本获得更充分的分析。

团队在StreamMER上开展流式评测,并在MELD和MER2024的离线多模态情绪理解设置下进行补充验证。

在StreamMER上,TRACE相较仅在线判断提升了9.60个百分点,同时避免了44.42%的上下文重判调用。在MELD和MER2024上,TRACE也分别减少了45.37%和41.79%的重判调用,体现了按需推理的价值。
效率方面,论文报告TRACE的实时因子(推理耗时与输入时长之比)为0.091,低于全量上下文重判的0.127,降幅约为28.3%。在流式决策策略实验中,TRACE的平均决策时间为3.10秒,全量重判策略为4.05秒。
这些结果表明,系统可以通过判断“哪些样本需要进一步分析”,在识别效果与计算成本之间取得更好的平衡。


论文展示了一个具有代表性的案例:随着音频逐步输入,模型的预测从“喜悦”转向“惊讶”,判断轨迹并不稳定。
当TRACE触发上下文重判后,模型结合带有指责意味的语气、直视的目光以及对质式对话内容,将情绪修正为“愤怒”。
另一个案例中,在线预测在“惊讶”“焦虑”和“愤怒”之间波动。引入语言内容与对话背景后,模型最终将情绪判断为“惊讶”。
这些案例体现了TRACE的作用:通过预测变化发现歧义,再用相关证据帮助模型修正判断。

这项研究为流式多模态系统设计提供了以下启示。
第一,单次高置信度不足以证明判断可靠。跟踪预测是否稳定、是否反复切换,能够为系统提供更丰富的可靠性信号。
第二,根据预期收益按需调用复杂推理。通过同时估计出错风险与纠正收益,系统能够将更多计算资源用于难以判断的样本。
第三,上下文的相关性比数量更重要。论文的上下文范围实验显示,加入前文能够改善情绪识别;继续加入后文并未带来进一步提升。这提示系统应选择与当前情绪相关的证据,并遵守在线场景的信息可用范围。
TRACE将流式视频情绪理解建模为一个持续形成、评估和修正判断的过程。通过StreamMER数据集、预测轨迹可靠性建模和选择性上下文重判,团队验证了在不完整观察下兼顾识别效果与推理效率的可行路径。
未来,这一方向仍可进一步探索更精准的调用策略、更丰富的真实交互数据,以及对复杂、细微情绪表达的理解能力,为实时多模态交互提供更及时、更可靠的情绪感知支持。
论文名称:Emotion Understanding in Streaming Video with Trajectory-Aware Reliability
论文链接:https://arxiv.org/abs/2608.26786
文章来自于"量子位",作者 "蚂蚁集团安全实验室"。