[AVSR_论文精读]Watch or Listen: Robust Audio-Visual Speech Recognition
Watch or Listen 论文解读:双模态同时受损?首个提出视听双重可靠性打分的鲁棒 AVSR 框架
一、论文背景介绍
- 论文标题:Watch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring
- 发表会议:CVPR 2023 (Highlight)
- 所有作者均来自韩国科学技术院(KAIST)电气工程学院的 Image and Video Systems Lab。
想象这样一个场景:你在看一段新闻视频,麦克风收音断断续续(音频受损),更糟糕的是主持人还时不时用手或话筒挡住嘴巴(视觉受损)——你的大脑会怎么处理?你会本能地在"看"和"听"之间动态切换——嘴巴被挡住时就多靠耳朵听,环境嘈杂时就多看嘴唇,两者都不行时就靠上下文猜。
但现有的 AVSR(音视频语音识别)模型几乎全都不会这样做。它们只考虑了音频被噪声污染的情况,默认视觉输入永远是干净的。这篇论文是首个指出双模态同时受损问题的工作,并提出了一个简洁优雅的解决方案——可信度打分模块(AV-RelScore)。
二、Abstract — 摘要
传统的 AVSR 研究有一条默认假设:音频可能被噪声破坏,但视频(唇部区域)永远是干净的。在这个假设下,视觉信息被当作"救命稻草",用来补充被噪声污染的音频。
但这篇论文用一个简单的实验打破了这一幻想。作者在 LRS2 数据集上测试了已有 AVSR 模型(Conformer、V-CAFE)在三种受损场景下的表现:
| 受损场景 | 预期表现 | 实际表现 |
|---|---|---|
| 仅音频受损 | AVSR > ASR | ✅ 符合预期 |
| 仅视觉受损 | AVSR > VSR | ⚠️ 表现下降,不如直接用 ASR |
| 双模态同时受损 | AVSR 应互补 | ❌ AVSR 比纯 ASR 还差! |
第三个发现是这篇论文的起点:当音频和视频同时出现噪声时,现有 AVSR 模型的表现甚至不如纯音频模型(ASR)。 这意味着你费了很大力气引入视觉信息,结果在真实复杂场景下反而帮倒忙。
针对这个问题,论文提出了两个核心贡献:
- 视听双模态受损建模(Audio-Visual Corruption Modeling):首次在训练时同时模拟音频噪声和视觉噪声(嘴唇遮挡 + 模糊 + 高斯噪声)。
- 视听可信度打分模块(AV-RelScore):让模型自己学会判断每一帧的音频和视频"哪个更可靠",对可信度高的数据提高信任程度,对可信度低的则减少依赖。
三、方法介绍
3.1 问题分析:为什么现有模型在双模态受损时表现差?
作者首先做了一个系统的鲁棒性分析(Figure 3),直接使用预训练好的 Conformer 和 V-CAFE 模型,不经过任何针对性微调,测试它们在三种受损场景下的表现:
场景一:仅音频受损(加 babble 噪声)
- 结果:AVSR 模型表现很好——视觉信息有效补充了音频的不足。
- 这符合所有人的预期。
场景二:仅视觉受损(嘴唇遮挡 + 模糊 + 噪声)
- 结果:VSR 模型直接崩溃(WER 从 48.1% 飙到 76.4%)。AVSR 模型也受到明显影响(Conformer 从 4.9% 涨到 10.0% WER)。
- 更关键的是:在这种场景下,纯 ASR 模型的 4.6% WER 反而优于 AVSR 模型。这说明当你确定视频有扰动时,不如直接关掉视频只用音频。
场景三:双模态同时受损
- 结果:这是一个反直觉的发现。在 -5dB 到 5dB 的强噪声区域,所有 AVSR 模型的 WER 都高于纯 ASR 模型。尤其是 V-CAFE——它原本的设计是用视觉信息去增强受损音频——当视觉也受损时,表现反而最差。
- 作者的结论直截了当:在双模态受损场景下,当前的 AVSR 模型还不如纯 ASR 模型。
这个发现直接引出了核心问题:如何让 AVSR 模型在双模态同时受损时仍然保持优势?
3.2 视觉受损建模:让模型"见多识广"
音频加噪是 AVSR 领域的常规操作,但视觉受损建模几乎没人做过。这篇论文设计了两种贴近现实的视觉受损方式:
遮挡建模(Occlusion):
- 使用 NatOcc 数据集中的自然遮挡物(水果、甜点、杯子等日常物品)。
- 将遮挡贴片随机贴在嘴唇区域,模拟话筒遮挡、手遮挡等真实场景。
- 关键设计:遮挡不是覆盖整个视频,而是随机出现 N 次(最多 3 次),每次覆盖 30%-50% 的片段——这模拟了真实场景中"时挡时不挡"的情况。
噪声建模(Noise):
- 高斯模糊(Gaussian blur):模拟镜头失焦、编码错误。
- 加性高斯噪声:模拟传输干扰、低光照条件。

图-1 论文 Figure 1 & Figure 2:视觉受损建模示例。左侧展示了 NatOcc 自然遮挡物(苹果、瓶子、蛋糕、杯子等)贴在嘴唇区域的效果;右侧展示了高斯模糊和高斯噪声的视觉效果。这两种受损方式模拟了真实场景中话筒遮挡、镜头失焦、传输干扰等情况。
3.3 AV-RelScore:让模型学会"该信谁"
这是论文最核心的创新,也是我读完最受启发的部分。
设计灵感:人类在嘈杂环境中理解他人说话时,会天然地对两种感官信号进行"可信度评估"——耳朵听不清时多看嘴唇,嘴巴被遮住时多靠耳朵,两者都不行时靠上下文推理。AV-RelScore 就是给模型装上了这个能力。
技术架构:
图-2 论文 Figure 4:AV-RelScore 整体框架。输入视频和音频分别经过视觉前端(3D CNN + ResNet18)和音频前端(1D ResNet18)提取特征,随后送入 AV-RelScore 进行逐帧可信度打分,通过 Emphasis Function 强调可靠特征、抑制受损特征,最后在 Multimodal Attention with Conformer Encoder 中进行跨模态融合,由 Transformer Decoder 完成文本预测。
整个 AVSR 框架由三部分组成(Figure 4):
-
模态前端:
- 视觉前端:3D CNN + ResNet18,提取唇部视频特征。
- 音频前端:1D ResNet18,提取音频特征。
- 两者都输出 T×DT \times DT×D 维的特征序列。
-
AV-RelScore 可信度打分模块(Figure 5):
- 音频流可信度打分:对音频特征 faf_afa 通过三层 1D 卷积 + Sigmoid,输出音频可信度分数 sa∈[0,1]T×Ds_a \in [0, 1]^{T \times D}sa∈[0,1]T×D。
- 视觉流可信度打分:同理,对视觉特征 fvf_vfv 输出视觉可信度分数 sv∈[0,1]T×Ds_v \in [0, 1]^{T \times D}sv∈[0,1]T×D。
- 分数含义:0 = 该帧/时刻的模态特征完全不可靠,1 = 完全可靠。
-
特征强调函数(Emphasis Function):
f~=f+f⊙s\tilde{f} = f + f \odot sf~=f+f⊙s- 这是一个残差连接式的门控机制——可靠的特征被保留甚至增强,不可靠的特征被抑制。
- 被强调后的特征 f~a\tilde{f}_af~a 和 f~v\tilde{f}_vf~v 送入下一步。
-
多模态注意力编码器:
- 将 f~a\tilde{f}_af~a 和 f~v\tilde{f}_vf~v 沿时间维度拼接为 [f~a,f~v]∈R2T×D[\tilde{f}_a, \tilde{f}_v] \in \mathbb{R}^{2T \times D}[f~a,f~v]∈R2T×D。
- 送入 Conformer Encoder 进行跨模态注意力建模。
- Conformer 的全局注意力可以让可靠模态的特征去"帮助"不可靠模态的特征。
- 最终取前 TTT 个输出特征,通过 Transformer Decoder 完成文本预测。
为什么这个设计巧妙?
- 时间粒度:可信度打分是逐帧(per time step)的,而不是整段视频的。这意味着当遮挡或噪声只影响部分时刻时,模型可以不损失其他时刻的信息。
- 模态互补:当视觉可信度低时,跨模态注意力会自然地更多依赖音频特征,反之亦然。
- 上下文补偿:当两个模态同时不可靠时,Conformer 可以通过捕捉上下文来推断被破坏的语音内容。
3.4 损失函数
训练损失非常简洁——Joint CTC/Attention Loss,没有花哨的多任务权重:
L=−λlogpa(y∣x)+(1−λ)logpc(y∣x)L = -\lambda \log p_a(y|x) + (1-\lambda) \log p_c(y|x)L=−λlogpa(y∣x)+(1−λ)logpc(y∣x)
其中 λ=0.9\lambda = 0.9λ=0.9,pap_apa 是注意力解码器的损失,pcp_cpc 是 CTC 损失。解码时额外融合一个在 LRS2 + LRS3 + LibriSpeech + Voxforge + TED-LIUM 3 + Common Voice 上训练的外部语言模型,通过 shallow fusion 方式集成。
四、实验设置
4.1 数据集
| 数据集 | 规模 | 说明 |
|---|---|---|
| LRS2 | ~142,000 句 | BBC 电视节目,学术基准 |
| LRS3-TED | ~150,000 句(439h) | TED 演讲,更大规模 |
4.2 受损设置
音频受损:babble 噪声,SNR 范围 -5dB 到 20dB + 干净音频。
视觉受损(三种类型):
| 类型 | 具体设置 |
|---|---|
| 遮挡(Occlusion) | NatOcc 贴片,最多出现 3 次,覆盖 30%-50% 片段 |
| 噪声(Noise) | 高斯模糊(kernel=7, σ∈[0.1,2.0])+ 高斯噪声(最大方差 0.2) |
| 遮挡+噪声 | 两者组合 |
双模态受损:对随机 chunk 同时注入音频受损和视觉受损,模拟"时而音频坏、时而视频坏、时而都坏"的真实场景。
4.3 模型与训练
| 组件 | 配置 |
|---|---|
| 视觉前端 | 3D CNN + ResNet18(LRW 预训练) |
| 音频前端 | 1D ResNet18(LRW 预训练) |
| AV-RelScore | 3 层 1D Conv + BN + ReLU + Sigmoid |
| Conformer Encoder | 12 层,256 维,2048 FFN,8 头注意力,kernel=31 |
| Transformer Decoder | 6 层,256 维,2048 FFN,8 头注意力 |
训练采用课程学习(Curriculum Learning):先训练短片段(≤100 帧),逐步增加到 150、300、600 帧。硬件:4 张 RTX 3090 GPU。
五、实验结果与分析
5.1 双模态受损下的核心结果
这是全篇最重要的实验结果(Table 1)。在 LRS2 和 LRS3 上,对比不同方法在三种视觉受损 + 六种音频 SNR 条件下的 WER:
| 方法 | LRS2 平均 WER(遮挡+噪声, -5dB) | LRS3 平均 WER(遮挡+噪声, -5dB) |
|---|---|---|
| ASR | 4.17 | 2.53 |
| VSR | 69.61 | 71.52 |
| Conformer (AVSR) | 5.03 | 3.03 |
| V-CAFE (AVSR) | 4.69 | 3.67 |
| AV-RelScore | 4.25 | 2.95 |
但仅看干净条件下的平均 WER 不能说明全部问题。真正体现 AV-RelScore 优势的是强噪声场景:
在 LRS2 上,遮挡+噪声视觉受损,-5dB 音频 SNR:
- Conformer: 20.15% WER
- V-CAFE: 14.07% WER
- AV-RelScore: 13.36% WER
在 LRS3 上,同样条件:
- Conformer: 11.82% WER
- V-CAFE: 10.04% WER
- AV-RelScore: 9.41% WER
AV-RelScore 在所有强噪声(-5~5dB)条件下均超过了包括 ASR 在内的所有基线方法。 这意味着在双模态受损建模 + 可信度打分的作用下,AVSR 真正实现了"1+1>2"——而不是"1+1<1"。
5.2 纯音频受损场景:也是最优
为了进一步验证 AV-RelScore 的鲁棒性,作者还在传统 AVSR 的实验设定下做了测试——即全部音频都加噪、视觉保持干净(Figure 6)。结果显示 AV-RelScore 在强噪声条件下(-5 到 5dB SNR)依然最优。这说明可信度打分机制在单模态受损时同样有效。
5.3 消融实验:三层架构缺一不可
在 LRS2 双模态受损条件下(-5dB 音频 SNR + 遮挡+噪声视觉):
| 架构变体 | WER (%) |
|---|---|
| 基线(Conformer,无 AV-RelScore) | 20.15 |
| + 多模态注意力编码器(无打分) | 13.70 |
| + 多模态注意力 + AV-RelScore(完整模型) | 13.36 |
每增加一个组件都有显著收益。多模态注意力(跨模态 Conformer)带来了最大的提升(-6.45% WER),因为它让模型可以在模态间"参考"另一方。可信度打分在此基础上再压榨出 0.34% 的提升——虽然看似不大,但这是在已经很强的基线(13.70%)上的进一步优化。
5.4 可信度打分的可视化:它真的学到了!
这是整篇论文最有说服力的分析(Figure 7)。作者可视化了 AV-RelScore 在不同受损场景下输出的可信度分数:
- 遮挡刚好盖住嘴唇时:视觉可信度分数骤降(红色条几乎为 0),音频可信度分数保持高位(绿色条)。
- 遮挡在嘴唇附近但没有直接盖住时:视觉可信度分数仍然较高。
- 遮挡逐渐消失时:视觉可信度分数逐步回升。
- 音频被噪声污染时:音频可信度分数下降,视觉可信度分数上升以补充。
这就说明 AV-RelScore 不是瞎打分的——它精确地学到了"什么情况下该信谁"。而且两个模态的可信度分数呈现良好的互补关系:一个低时另一个高,确保了任何时候至少有一个可靠的信息源。
5.5 干净环境下的结果:不影响正常表现
有些时候,"防干扰"的设计会以损害正常场景下的性能为代价。但 AV-RelScore 不存在这个问题:
| 方法 | LRS2 WER (%) | LRS3 WER (%) |
|---|---|---|
| TM-Seq2Seq | 8.5 | — |
| CTC/Attention | 7.0 | 7.2 |
| LF-MMI TDNN | 5.9 | 6.8 |
| EG-Seq2Seq | 4.7 | 4.5 |
| RNN-T | 4.5 | 3.4 |
| Conformer | — | 3.2 |
| V-CAFE | 4.1 | 2.8 |
| AV-RelScore | 4.1 | 2.8 |
在完全干净的数据上,AV-RelScore 依然达到了 SOTA 水平(与 V-CAFE 持平)。这证明了可信度打分机制不会"误伤"正常数据——当两个模态都干净时,模块会给两者都打出高分,模型正常工作。
六、讨论与未来方向
作者在论文中没有展开太多未来工作,但从前面的分析中可以自然延伸出几个方向:
-
更细粒度的受损建模:目前的视觉受损建模还比较粗(整块遮挡、全局模糊),现实中可能有更复杂的受损模式(如部分像素噪声、运动模糊)。未来可以引入更丰富的视觉数据增强。
-
动态权重学习:AV-RelScore 目前是用 1D CNN 独立地对每个模态打分,未来可以探索更显式的模态间交互——比如让视觉打分也参考音频特征,实现真正的"交叉评估"。
-
扩展到多模态大模型:可信度打分的思想完全可以推广到更一般的多模态学习场景——视频理解、多模态对话等。让模型自己判断"什么时候该看什么",是一个极具通用性的思路。
-
长尾受损场景:目前的训练数据中,受损和干净样本是随机混合的。未来可以引入 harder negative mining,让模型专门针对最容易混淆的受损情况进行训练。
七、个人思考与总结
这篇论文改变了什么认知?
如果说 MultiAVSR 是"做减法"——用更简单的设计击败复杂方案,那么这篇 Watch or Listen 就是 “发现新问题” ——指出整个领域忽略了一个关键的场景。
具体来说,它带来的认知转变有两点:
| 旧的默认认知 | 这篇论文的回应 |
|---|---|
| 视觉输入默认是干净的,AVSR 只需要处理音频噪声 | 视觉完全可以被遮挡或污染,双模态同时受损是真实世界中常见的 |
| AVSR 模型天然比 ASR 鲁棒,因为多了一个模态 | 在双模态受损场景下,现有 AVSR 甚至比纯 ASR 更差。鲁棒性不会自动获得,需要专门设计 |
可信度打分思路的深远意义
我个人认为这篇论文最值得学习的地方,不是它在 LRS2/LRS3 上拿了多少 WER,而是 "可信度打分"这个思路本身。
这个思路的精妙之处在于:它没有试图去修复受损的信号(修复很难且容易引入伪影),而是退一步——先判断信号"可不可信",再决定用多少。 这是一种更务实、更稳健的策略。
可信度打分还顺带解决了多模态融合的一个核心难题:两个模态怎么融合?传统方法是直接拼接或加权求和,但权重是固定的。AV-RelScore 则提供了动态的、逐帧的、数驱动的权重——这天然地让模型学会了"什么时候多依赖视觉、什么时候多依赖音频"。因此,可信度打分不仅提高了鲁棒性,还实质性地提升了模态融合的质量。
此外,这个思路具有很强的通用性:
- 自动驾驶中,摄像头脏了/被雨淋了,雷达数据就更可信。
- 医疗诊断中,CT 和 MRI 互相补充,某张片子质量不佳时可以依赖另一种模态。
- 多模态对话中,用户说话含糊时多关注画面,画面不清晰时多依赖声音。
局限性
- 双模态受损建模只覆盖了遮挡物遮挡和噪声,现实中还有很多其他类型(如光照剧烈变化、说话人侧脸/转头)。
- 可信度分数目前没有直接监督——全靠最终的识别损失反向传播。在某些高度模糊的场景下,模型可能无法准确判断"到底哪个模态更可信"。
- 实验仅限英语,多语言场景有待验证。
- AV-RelScore 的额外计算开销(三层 1D Conv × 2)虽然不大,但在需要极致推理速度的场景下仍需考量。
一句话总结
Watch or Listen 首次提出了 AVSR 中双模态同时受损的问题,用视觉受损建模让模型见多识广,用可信度打分让模型学会"该信谁"——以极其优雅的方式解决了此前 AVSR 模型在真实复杂场景下"多模态反而减分"的尴尬。
本博客基于 “Watch or Listen: Robust Audio-Visual Speech Recognition with Visual Corruption Modeling and Reliability Scoring” 论文(CVPR 2023)撰写,文中实验结果和图表数据均来源于原论文。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)