过去,视觉理解与内容生成往往由不同模型分别完成:一个模型负责“看”,另一个模型负责“画”。但在真实任务中,两者往往天然联系在一起——模型需要先理解场景、对象和关系,再根据这些理解完成生成或修改。过去,这些步骤往往需要在不同模型之间切换和协同;理解生成一体化,则希望让模型在“看懂”之后,还能够继续“动手”。

近日,上海人工智能实验室发布新一代多模态统一模型Intern Lumina U2,进一步推动“理解”与“生成”在同一个模型中实现统一。U2基于全离散扩散建模路线,在统一框架中同时支持文本问答、图像理解、文生图、图像编辑、视频理解和3D理解等任务,让一个模型既能“看懂”视觉世界,也能进一步“生成”和“修改”视觉内容。

这背后并不是简单地把多个功能拼在一起。U2希望做得更彻底:不仅让理解和生成共享同一个模型,还让文字和视觉信息采用统一的表示方式、统一的学习方式和统一的训练目标。换句话说,不再是文字按照一种方式学习、图像按照另一种方式生成,而是尽可能把它们放进同一套全离散扩散框架中进行建模。在此基础上,不同模态能够进一步共享模型中的知识、语义表示与推理能力。

除了模型本身,Intern Lumina U2也将这条技术路线进一步推进到大规模工程实践。模型全面适配昇腾硬件产品,并在昇腾千卡级集群上完成端到端训练与评测,成功打通大规模理解生成一体化模型在昇腾AI基础软硬件平台上的训练闭环。通过一系列软硬件协同优化,训练效率提升1.85 倍。

代码仓库:

https://atomgit.com/InternLM/InternLumina-U2-code

模型仓库:

https://ai.atomgit.com/InternLM/InternLumina-U2

组织地址:

https://atomgit.com/InternLM

图片图片

统一框架下的性能鸿沟SUMMARY

近年来,MMaDA、Lumina-DiMOO等工作开始探索基于离散视觉Token的多模态统一建模路线:将语言与视觉信息共同表示为离散Token序列,并在统一模型中同时支持视觉理解与图像生成任务。这些探索验证了一条具有潜力的技术路径——当语言和视觉拥有统一的离散表示后,文本问答、图像理解、图像生成和图像编辑等任务可以在同一套模型框架中完成,理解与生成不再必须依赖彼此独立的模型体系。

然而,从“能够离散统一”走向“高性能离散统一”,仍然存在明显距离。一方面,在视觉理解任务上,现有离散理解生成统一模型,与自回归视觉语言模型相比,在细粒度感知、OCR、图表理解以及复杂视觉推理等任务上仍存在性能差距。另一方面,在图像生成任务上,统一模型与DiT架构为代表的生成模型相比,在视觉质量、细节表达等方面仍有较大的提升空间。

这一差距并不只是任务数量或训练规模的问题,也与统一模型如何表示和预测视觉内容有关:视觉表示本身的信息容量。在传统单码本方案中,一个视觉位置通常对应一个离散类别。在固定Token数量下,语义、纹理、文字、几何结构和高频细节需要共同竞争有限的表示空间。另一类离散—连续混合方案虽然能够保留更丰富的生成细节,但通常需要为理解和生成引入不同的表示、目标或解码路径。

相比于简单选择离散或连续表征路线,统一模型的设计更需要重新思考“一个视觉位置应该由什么来表示、模型应该如何预测它”。为此,Intern Lumina U2在单码本全离散和离散—连续混合建模之外,探索了一条多码本全离散路径:用多个互补码本提升视觉信息容量,并以“空间并行、码本深度自回归”的方式完成视觉内容预测。结合多码本的统一时空表示(同一坐标框架下编码图像、视频与 3D),Intern Lumina U2无缝扩展到全视觉模态任务,统一图像、视频与3D感知,建立一个能够共同理解二维内容、动态过程与三维空间的视觉底座。

从图文统一,走向通用视觉智能

Intern Lumina U2将“统一”的范围从图像理解和图像生成进一步扩展到多视觉模态、多任务形态与多硬件生态,探索面向通用视觉智能的一体化技术路线。

图片

一个模型,覆盖理解、生成与编辑

Intern Lumina U2在同一模型框架中支持多种语言与视觉任务:

文本问答:保持语言模型的通用知识、推理与对话能力;

文生图:根据自然语言指令生成具有语义一致性与视觉表现力的图像;

图像理解:识别图像内容,并完成视觉问答、OCR、图表分析与数学推理;

图像编辑:基于文本指令或视觉条件对图像内容进行修改;

视频理解:理解视频中的时序变化、事件过程与跨帧语义;

3D理解:面向三维场景与对象建模空间结构和视觉语义。

从静态图像到动态视频,从二维内容到三维空间,从视觉感知到内容生成,Intern Lumina U2将过去分散在不同模型中的能力整合到统一框架中,使模型能够在多种视觉输入和任务之间灵活切换。

多码本视觉表示:提升视觉信息承载能力

视觉分词器决定了模型能够如何“看见”世界,也决定了模型生成图像时能够如何“表达”世界。传统单一码本将一个视觉位置压缩成一个类别变量,接口简洁,但在固定 Token 数量下,语义、纹理、文字和几何细节都必须共享有限的表示容量。Intern Lumina U2 采用AToken 多码本视觉分词器,以8组离散码本协同编码每个视觉位置,共同描述其语义与细节信息,在可控的 Token 序列长度下提升视觉表示的信息容量与细节表达能力,为理解和生成任务提供更加有效的视觉基础。

相比单一码本表示,多码本机制通过码本级联的方式显著扩展了编码空间为模型保留更加充分的局部纹理、文字信息、几何结构与高频视觉细节。但也带来了新的建模问题:多个码本之间并不是相互独立的,不能简单地同时预测。

Intern Lumina U2因此对多码本的输入和输出分别进行了设计。输入侧为每个码本保留独立的Embedding,先将同一空间位置的多路表示拼接,再投影为一个模型Token。这样既保留了不同码本的身份和分工,又不会让主干序列长度随码本数量成倍增加。输出侧采用空间并行、码本深度自回归的分工。dLLM主干同时处理多个空间位置;对于每个被掩盖的位置,多码本AR Head再按照码本顺序预测其中的多个离散码。

图片

( a )  Intern Lumina U2 多码本输入侧设计

图片

( b )  Intern Lumina U2 多码本输出侧设计

在此基础上,Intern Lumina U2进一步统一视觉Token与语言Token的建模接口,使视觉理解与图像生成能够共享模型能力,并通过联合训练促进不同视觉任务之间的能力迁移。

架构优化:兼顾理解精度与生成质量

Intern Lumina U2采用16BA1B的稀疏MoE架构,以LLaDA-2.0 MoE Diffusion LLM为语言骨干,将其block diffusion建模方式、稀疏专家容量和语言能力进一步扩展到视觉任务。针对不同模态的数据结构和任务目标,团队对模型架构、视觉表示方式以及多任务训练策略进行了系统优化,使模型既能够处理需要细粒度识别和复杂推理的视觉理解任务,也能够完成高质量图像生成与指令式图像编辑。

这套设计通过视觉文本联合建模与多任务协同训练,让语言、图像、视频和3D任务共享模型中的通用知识、语义表示与推理能力,从而提升模型的整体泛化能力。

昇腾:完成千卡级端到端训练闭环

统一模型不仅是一个算法问题,也是一个系统工程问题。模型能力不仅取决于模型算法,也取决于其能否在真实的大规模计算基础设施上完成稳定、高效的训练与部署。

Intern Lumina U2系统适配了昇腾硬件产品,覆盖模型训练、评测和推理等全流程环节,为基于昇腾硬件的多模态模型研究与应用提供支持。

在昇腾千卡级集群训练中,上海AI实验室联合昇腾团队进一步从计算、通信和显存三个方向展开优化。在计算效率上,通过实施了系统性的算子融合优化,引入FLA和GMM等融合算子,有效解决MOE稀疏架构及长序列训练的访存瓶颈问题,显著降低片内外的访存交互与Kernel Launch频次,提升计算效率。

图片

在分布式通信上,针对HSDP进行多轮分片寻优,精准平衡通信耗时与显存占用开销。在显存容量上,昇腾NPU相对有限的显存容量暴露出原有显存分配策略中的效率瓶颈,为此引入Gradient Checkpointing等显存优化手段,在显著降低显存占用的同时,大幅提升单卡可支持的最大序列长度。

图片

经过上述一系列系统性优化,昇腾千卡级集群的训练效率提升1.85倍。这一结果意味着,理解生成统一模型不仅能够在昇腾AI基础软硬件平台上运行,还能够完成从模型训练、优化到评测的大规模端到端训练闭环。

成绩单:理解与生成同步提升

Intern Lumina U2展现出全面且均衡的性能优势,在视觉理解与图像生成等核心任务上均取得了优异的性能。其中,细粒度视觉识别与复杂推理是最突出的强项:在 ChartQA(86.52)与 CharXiv-DQ(83.65)等图表理解任务中稳居 InternVL-U、LLaDA2.0-Uni 等统一模型之上;面对更具挑战性的数学推理场景,在MathVision(33.22)与DynaMath(56.37)上不仅超越了上述统一模型,更进一步领先多模态理解模型InternVL3-8B;在检验模型幻觉与一致性的评测基准HallusionBench(62.15)上,其表现同样印证了良好的视觉鲁棒性。

这种优势并不局限于静态图像。Intern Lumina U2在VideoMME(51.26)上超过Show-o2、LLaVA-Mini等统一模型,在3D MM-Vet(41.8)上也优于同等规模的ShapeLLM,显示出其跨模态理解能力向时序与空间维度的良好延展。

图像生成侧的表现同样亮眼:Intern Lumina U2在TIIF-Bench(Short)上取得 84.60分,领先InternVL-U、Lumina-DiMOO等模型,并在DPG-Bench上进一步取得了87.10的高分;在图像编辑评测基准ImgEdit(3.83)中,Intern Lumina U2依然保持对上述模型的领先优势。

这些结果表明,多码本视觉表示与统一架构优化不仅拓展了模型的任务边界,也能够有效提升视觉理解与图像生成等核心能力。统一建模并不意味着牺牲单项性能,而有望通过共享视觉表示、知识与推理能力,促进不同任务之间的协同提升。

开放共享:推动统一多模态模型进一步发展

Intern Lumina U2 希望不仅展示一个模型,也提供一套能够被进一步研究和复现的统一建模基础。Intern Lumina U2 将开放基于昇腾的代码/模型权重/技术报告/训练与推理工具,为统一多模态建模、昇腾AI基础软硬件平台适配以及多视觉模态研究提供可复现的技术基础。

期待 Intern Lumina U2 能够帮助研究者进一步探索:

如何利用多码本视觉表示突破统一模型的性能瓶颈;

如何在同一模型中统一语言、图像、视频与 3D 等多模态信息;

如何让视觉理解、生成与编辑能力在统一训练中协同提升;

如何在昇腾硬件产品上高效训练和部署多模态模型。

未来展望:面向更完整的视觉智能

从Lumina-DiMOO对全离散理解生成统一的探索,到Intern Lumina U2引入MoE和多码本视觉表示,技术路线背后的核心问题始终没有改变:  如何让理解和生成真正共享同一种表示、同一个模型和同一套能力。

Intern Lumina U2展示了一条面向通用视觉模型的可扩展路径:  以统一视觉表示连接不同模态,以统一模型承载理解、生成与编辑,以统一训练促进不同能力协同,并通过软硬件协同将模型能力扩展到真实的大规模计算环境 。 Intern Lumina U2 选择多码本全离散统一建模作为区别于单码本全离散和离散—连续混合方案的第三种工程路径,押注离散生成与理解统一模型的长期潜力。

U2并不是统一模型的终点。未来,昇腾将助力上海AI实验室持续拓展全视觉模态的建模与生成能力,探索更复杂的跨模态任务、交互形式和推理过程,让统一模型进一步拥有“共享表示、共享知识、共享推理,并最终共享理解与生成世界的能力”,向更通用的视觉智能与AGI不断前进!

Logo

AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。

更多推荐