![]()
商汤科技正式发布并开源 日日新 SenseNova U1 系列原生理解生成统一模型。该模型基于商汤自主研发的 NEO-unify 架构,在单一模型架构中统一多模态理解、推理与生成能力,目标是让AI不再依赖多个模块拼接完成不同任务,而是在统一框架内完成图像理解、语言推理与视觉生成。商汤官方信息显示,SenseNova U1 系列于2026年4月28日正式发布并开源。
与传统多模态模型相比,SenseNova U1 的最大特点在于“原生统一”。传统方案通常需要视觉编码器、生成模块、适配器等多个组件配合,系统链路较长,理解和生成之间容易出现信息损耗。而 SenseNova U1 通过统一表征空间,把语言与视觉信息作为一个复合整体进行建模,让模型在理解图像、进行推理和生成画面时拥有更一致的内部表达。
SenseNova U1是什么?
SenseNova U1 是商汤日日新大模型体系中的原生多模态统一模型系列,主要面向图像理解、图文推理、图像生成、连续图文创作和空间智能等场景。根据商汤官方介绍,SenseNova U1 能够将语言与视觉信息作为统一的复合体直接建模,实现语言和视觉信息的高效协同,让理解与生成能力同步增强。
简单来说,SenseNova U1 不只是“能看图”的模型,也不只是“能画图”的模型,而是把“看懂、思考、生成”放在同一套模型架构中完成。这意味着它可以先理解图像内容、空间关系和用户意图,再基于这些理解生成更自然、更准确的图像结果。
例如,用户可以让模型理解一张室内图的空间布局,再要求它生成同一空间下的不同装修风格;也可以让模型分析一张商品图,再生成对应的营销海报、场景图或图文内容。相比单独调用图像理解模型和图像生成模型,统一架构有助于减少中间转换带来的信息偏差。
NEO-unify架构:从模块拼接走向单一模型统一
SenseNova U1 的核心技术基础是 NEO-unify 架构。商汤官方介绍称,NEO-unify 架构去除了传统方案中的视觉编码器和变分自编码器,重新构建统一表征空间,并将其深入融入每一层计算中,从而实现多模态理解、推理与生成的统一。
这类架构设计的价值在于,它让模型不再把“理解”和“生成”拆成两个割裂阶段。传统多模态系统常见做法是先用视觉模型提取图像特征,再交给语言模型理解,最后再调用生成模型输出图片。这个过程虽然可行,但不同模块之间需要适配,信息传递容易出现损耗。
SenseNova U1 则尝试在模型内部建立统一的语言与视觉表示,让模型能够原生处理语言和图像信息。Hugging Face 模型页也介绍,SenseNova U1 是一个在单体架构内统一多模态理解、推理和生成的新系列原生多模态模型。
告别插件式AI,多模态能力更自然
“告别插件式AI”是 SenseNova U1 最适合传播的卖点之一。所谓插件式AI,是指一个系统背后由多个不同模块拼接而成,例如一个模型负责看图,一个模型负责回答,一个模型负责生成图片,一个适配器负责连接不同模态。这类系统虽然可以完成任务,但架构复杂,协同成本高。
SenseNova U1 的思路是把多模态理解、推理与生成能力放进同一个框架中,让模型以更自然的方式处理跨模态信息。商汤官方表示,SenseNova U1 在保留语义丰富度的同时,也能维持像素级视觉保真度,并实现连续性的图文创作输出。
对于用户来说,这种能力带来的体验变化很直接:模型不只是“根据提示词画图”,而是能更好理解图片中的结构、语义、对象关系和创作意图,再生成更符合上下文的结果。
SenseNova U1 Lite率先开源
此次发布中,商汤同时开源了 SenseNova U1 Lite 系列。公开资料显示,SenseNova U1 Lite 已在 GitHub 和 Hugging Face 平台开放,全球开发者可以下载、部署和二次开发。
GitHub README 显示,本次开源的 SenseNova U1 Lite 系列包含两个规格:SenseNova U1-8B-MoT 和 SenseNova U1-A3B-MoT,并提供对应权重入口。
轻量版率先开源,对于开发者生态非常重要。大型多模态模型通常对算力要求较高,如果只有闭源API或超大模型版本,开发者很难进行本地测试和二次开发。SenseNova U1 Lite 的开放,可以让研究人员、AI应用开发者、内容工具团队和企业用户更快评估模型能力,并探索更多落地场景。
图像生成与图文创作能力提升
SenseNova U1 的一个核心应用方向是图像生成与图文创作。由于模型在统一架构内同时具备理解和生成能力,它可以更好地处理复杂视觉任务,例如参考图编辑、图文一致性生成、连续创作、场景重绘和风格转换。
公开报道提到,在通用图像生成测试中,SenseNova U1 Lite 在图像生成质量上可比肩部分大型闭源模型,并且在推理响应速度方面具有优势。
对于内容创作者来说,这类能力可以用于AI海报、产品图、社交媒体封面、广告素材、插画生成、品牌视觉延展和图文内容生产。对于企业用户来说,它也适合接入电商、营销、设计、教育和办公系统,提升视觉内容生成效率。
空间智能与具身智能成为重要方向
SenseNova U1 不只面向图像生成,还强调逻辑推理与空间智能。商汤官方介绍称,在逻辑推理与空间智能等方向上,SenseNova U1 能够理解物理世界中的复杂布局与精细关系;未来还可以为机器人提供具身大脑,在单一模型闭环内完成从复杂环境感知、逻辑推演到任务执行的全过程。
这意味着 SenseNova U1 的潜在价值不仅在于“生成图片”,还可能延伸到机器人、自动驾驶、智能硬件和空间交互等领域。
例如,在机器人场景中,模型需要理解摄像头画面中的物体位置、空间关系和任务目标,再生成动作规划。统一的多模态理解与生成能力,有助于机器人在复杂环境中更好感知和决策。
在自动驾驶场景中,车辆需要理解道路结构、交通参与者、动态障碍物和复杂环境变化。具备空间智能的多模态模型,有机会为未来车载AI、驾驶辅助和座舱智能提供更强的理解基础。
对智能硬件和自动驾驶有什么价值?
智能硬件和自动驾驶都属于高度依赖多模态感知的场景。智能眼镜、机器人、车载系统、AI摄像头和空间计算设备,都需要AI同时处理图像、文字、语音、位置、动作和环境信息。
SenseNova U1 这类原生多模态统一模型,可以为这些设备提供更一致的感知与生成能力。例如智能眼镜可以实时理解用户看到的画面,并给出解释、提醒或操作建议;车载AI可以理解驾驶环境和用户需求,辅助完成导航、提醒和服务;机器人可以结合视觉画面和语言指令完成操作任务。
相比多个模块拼接,统一模型在系统复杂度、信息一致性和响应效率方面更具优势。这也是 SenseNova U1 被关注的重要原因。
SenseNova U1适合哪些应用场景?
1. AI图像生成与编辑
SenseNova U1 可用于文生图、图生图、参考图编辑、风格转换、广告图生成和社交媒体视觉创作。统一架构有助于提升生成结果与用户意图的一致性。
2. 多模态问答与图像理解
模型可以理解图片内容、空间关系、场景细节和文字信息,适合用于图像问答、商品识别、文档图片分析、教育答疑和视觉助手。
3. 连续图文创作
SenseNova U1 可支持更自然的连续图文创作,例如故事绘本、漫画分镜、产品说明图、教程图和多页视觉内容生成。
4. 智能硬件
智能眼镜、AI摄像头、空间计算设备和智能终端可以借助原生多模态模型提升视觉理解和即时反馈能力。
5. 机器人与具身智能
模型可用于复杂环境感知、空间关系理解、任务推理和动作规划,为机器人智能操作提供基础能力。
6. 自动驾驶与车载AI
在自动驾驶和智能座舱中,多模态模型可以帮助系统理解道路场景、车内外环境和用户需求,提升车辆智能交互与场景感知能力。
开源对开发者有什么意义?
SenseNova U1 Lite 开源后,开发者可以更直接地测试模型能力,并基于具体业务进行二次开发。GitHub 开源仓库提供了模型说明、权重入口和相关使用信息,Hugging Face 上也已上线 SenseNova U1 相关模型合集。
对于AI开发者来说,开源意味着可以更快验证模型在图文生成、图像理解、多模态推理、内容创作和空间智能任务中的表现。对于企业团队来说,开源轻量版也有助于评估本地部署、私有化应用和行业定制的可行性。
对多模态AI行业有什么意义?
SenseNova U1 的发布,说明多模态AI正在从“能力拼接”向“架构统一”发展。过去,很多系统通过多个模型组合实现复杂功能,但这种方式在效率、稳定性和一致性上存在限制。SenseNova U1 尝试在单一模型架构中统一理解、推理和生成,让多模态AI更接近自然协同。
这对行业的影响主要体现在三个方面。
第一,降低系统复杂度。统一模型有助于减少模块之间的适配成本。
第二,提升信息一致性。语言与视觉信息在同一表征空间中处理,可以减少跨模块转换带来的信息损失。
第三,拓展应用边界。图像生成、机器人、智能硬件、自动驾驶等场景都需要更强的多模态理解与生成能力。
总结
商汤科技发布并开源 SenseNova U1 系列原生理解生成统一模型,基于 NEO-unify 架构,在单一模型框架内统一多模态理解、推理与生成能力。相比传统插件式或拼接式多模态系统,SenseNova U1 更强调语言与视觉信息的原生协同,能够在理解图像、进行推理和生成内容时保持更一致的表达。
此次 SenseNova U1 Lite 轻量版率先开源,并已在 GitHub 和 Hugging Face 平台开放,为开发者提供了测试、部署和二次开发入口。
从应用方向看,SenseNova U1 不仅适合AI图像生成、图文创作和多模态问答,也有望在空间智能、机器人、智能硬件和自动驾驶等领域发挥作用。随着开源生态推进,SenseNova U1 有机会成为开发者探索原生多模态AI应用的重要模型基础。
