![]()
在多模态 AI 技术飞速发展的当下,上海人工智能实验室(Shanghai AI Laboratory)联合上海交通大学、南京大学、悉尼大学等 7 所高校及科研机构,共同研发推出新一代多模态生成与理解模型 Lumina-DiMOO。该模型凭借创新的全离散扩散架构与高效的跨模态对齐技术,在文本生成图像、图像编辑、图像理解等核心任务中实现性能突破,为多模态 AI 的产业化应用开辟新路径。目前,Lumina-DiMOO 已在 GitHub 开源,同步上线技术演示平台,吸引全球开发者关注。
全离散扩散架构:重构多模态数据处理逻辑
Lumina-DiMOO 的核心创新在于采用 “全离散扩散架构”,区别于传统多模态模型常用的自回归(AR)或混合 AR – 扩散架构,该架构能将文本、图像等不同模态数据统一转化为离散 token 进行处理,大幅提升跨模态数据的整合效率与对齐精度。通过离散化建模,模型可更精准捕捉不同模态数据的语义关联,例如在文本生成图像任务中,能更准确理解 “奶油质地的深色饮品置于暮光下的户外咖啡桌” 这类复杂描述中的场景细节与材质特征。
为进一步优化性能,研发团队还为 Lumina-DiMOO 设计了专属的 “Max Logit-based Cache”(ML-Cache)缓存机制。实测数据显示,在 A800 GPU 环境下,启用 ML-Cache 后,768×1536 分辨率图像的生成时间从 58.2 秒缩短至 32.2 秒,采样效率提升近 2 倍,同时保证生成质量无明显下降。这种 “架构创新 + 工程优化” 的组合,让模型在处理高分辨率、复杂场景任务时兼具速度与精度优势。
对比学习赋能:实现跨模态深度理解
Lumina-DiMOO 通过对比学习技术,构建了文本与图像、图像与图像间的精细关联网络,解决了传统多模态模型 “模态错位”“语义偏差” 等痛点。在图像理解任务中,模型能准确识别图像中的实体属性、空间关系及场景氛围,例如对 “繁忙城市街道上的黄铜乐器” 图像,不仅能识别出乐器类型,还能感知场景的动态感与环境音效关联。
从性能指标来看,Lumina-DiMOO 在多个权威 benchmark 中表现突出:在 GenEval Benchmark(生成与理解综合评估)中,其总体得分达到 0.88,超越 GPT-4o(0.84)、BAGAL(0.82)等主流模型;在 DPG Benchmark(离散生成评估)中,总体得分 86.04,在属性识别(92.08)、关系理解(94.31)等细分维度排名第一;在 OneIG-EN Benchmark(跨模态对齐评估)中,文本与图像的对齐得分 0.816,语言理解得分 0.551,均处于开源模型领先水平。
全场景能力覆盖:从生成到理解的一站式解决方案
Lumina-DiMOO 具备 “生成 + 理解” 双核心能力,覆盖多模态领域 10 余种关键任务,形成完整的技术闭环:
- 生成类任务:支持文本生成图像(最高分辨率 1024×1024)、图像编辑(添加 / 移除 / 替换元素、风格迁移)、可控生成(基于深度图、骨骼图、边缘图的精准生成)、多视角生成(同一物体不同角度渲染)等,例如用户输入 “吉卜力风格的雪山湖泊”,模型可生成符合动画美学的场景图像,并支持调整光影、季节等细节。
- 理解类任务:可完成图像描述、视觉问答、属性识别、关系推理等,例如面对包含多种珠子价格表的图像,模型能准确计算 “4 公斤椭圆形珠子 + 5 公斤星形珠子” 的总价(18 美元),展现出视觉与文本推理的深度融合能力。
在实际应用场景中,这些能力可广泛落地:设计领域,设计师可通过文本快速生成产品概念图,并基于草图进行风格迁移;电商领域,商家能上传商品图,自动生成不同场景下的展示图像;教育领域,模型可将静态教材插图转化为带场景描述的动态讲解素材,提升教学效果。
开源生态构建:降低多模态技术应用门槛
为推动多模态技术的普及与迭代,上海 AI Lab 联合研发团队将 Lumina-DiMOO 完整开源,提供模型 checkpoint(Hugging Face 可下载)、推理代码、部署教程及示例数据集。开发者通过简单的 Python 命令即可启动功能,例如文本生成图像任务,仅需配置 prompt、分辨率、采样步数等参数,30 秒内即可获得生成结果;针对企业级需求,模型还支持多 GPU 并行推理(DDP 模式),满足大规模生成任务需求。
此外,团队制定了清晰的开源迭代计划,后续将陆续发布 Gradio 演示工具、基准测试代码、微调教程及自监督训练代码,同时建立开发者交流群,提供技术支持。这种开放协作模式,不仅能吸引全球开发者参与模型优化,还能为中小企业、科研机构提供低成本的多模态技术解决方案,加速技术从实验室走向产业界。
作为上海 AI Lab 在多模态领域的重要成果,Lumina-DiMOO 的推出不仅填补了开源全离散扩散多模态模型的空白,更通过 “高性能 + 易使用 + 全开源” 的特点,为多模态 AI 的产业化发展提供新范式。未来,随着模型在更多场景的落地与优化,有望进一步推动数字内容创作、智能设计、人机交互等领域的技术变革。
