摘要

本周围绕多模态视觉token压缩方法MMTok开展复现与测试工作,重点验证其在Qwen2.5-VL-7B-Instruct模型上的性能保留效果与推理效率。实验发现,当视觉token保留比例降至5%时,模型在OCR及局部细节识别任务中出现显著退化(如将“MMTok”读作“MM TO”),表明现有压缩方法虽能保留粗粒度语义,却可能破坏结构完整性与空间参考系。基于这一观察,计划系统评估MMTok在不同视觉任务中的局限性,并准备利用GQA等数据集开展对比实验,为后续改进方法提供依据。

Abstract

This week focused on reproducing and testing the multimodal visual token compression method MMTok, specifically evaluating its performance retention and inference efficiency on the Qwen2.5-VL-7B-Instruct model. Experiments revealed that when the visual token retention ratio drops to 5%, the model exhibits significant degradation in OCR and fine-grained detail recognition tasks (e.g., misreading “MMTok” as “MM TO”). This indicates that existing compression methods may preserve coarse-grained semantics but damage structural integrity and spatial reference systems. Based on these observations, systematic evaluation of MMTok’s limitations across different vision tasks is planned, with preparation underway to conduct comparative experiments using datasets such as GQA, providing a foundation for subsequent improvements.

1、MMTok复现

1.1 测试

从论文看,Qwen-2.5-VL-7B 上,MMTok 在 20% / 10% / 5% 保留率下的平均性能保留率分别是 94.6% / 88.5% / 79.0%。作者还特别强调,Qwen 本身已经有 dynamic resolution 和 token compression,但 MMTok 仍然还能继续压,而且在 20% 时还能保留接近 95% 的原始性能。

这次测试的目标是先做一个 小规模、可运行、可对比 的验证,确认:

Qwen2.5-VL-7B-Instruct + MMTok 能否正常工作
在不同视觉 token 保留比例下,回答质量会不会明显下降
不同压缩比例下,推理延迟是否有改善
在这里插入图片描述
在这里插入图片描述
小样本复现暴露了一个现象:
当 retain_ratio 从 0.2/0.1 继续压到 0.05 时,模型并不是先丢掉“图像大意”,而是先丢掉局部细节/OCR 能力,例如把 “MMTok” 读成 “MM TO”。这提示一个问题:

现有方法可能保住了“语义相关性”,但没有保住“结构完整性”。

这和近期工作 Nüwa 的观察是一致的:现有 token pruning 在 VQA 上往往还能维持性能,但在 visual grounding 上会明显退化;作者把原因归结为 pruning 破坏了全局空间参考系,也就是 spatial integrity。

同时,Qwen2.5-VL 天生擅长文档解析、图表理解、对象定位,并且使用 dynamic resolution,这使它非常适合作为“强 baseline”来检验:一个剪枝方法是否真的保住了结构敏感能力,而不只是保住粗粒度语义。

1.2 下一步准备

验证命题:

低预算下,现有方法是不是确实优先损害 OCR / 局部结构任务?

已经在自己的 Qwen 小样本里看到这个苗头了:
0.2、0.1 还能稳定读出 MMTok
0.05 开始把它读成 MM TO

所以下一步最应该做的是把这个现象系统化:

找数据集跑 baseline、MMTok、你后续的 StructTok
先证明“问题真的存在”

只要这个 probe 成立,后面方法就很自然了。

现在下载了GQA数据集,然后还在挑选数据集和修改代码。
在这里插入图片描述

总结

本周通过对MMTok的复现测试,验证了其在Qwen2.5-VL-7B模型上的实际表现,并获得了关键发现:低视觉token保留比例下,模型在OCR和局部结构识别任务中的性能退化早于语义理解任务。这一现象与Nüwa等近期工作指出的“空间完整性破坏”相吻合,说明现有token pruning方法更倾向于保语义而非保结构。基于此,下一步将系统化这一观察,利用GQA等数据集进行定量评估,以证明问题的普遍性,并为设计兼顾结构与语义的压缩策略提供实验依据。目前已完成部分数据集下载和代码适配,后续将完善对比实验。

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐