
今天,商汤科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。
今天,商汤科技正式开源轻量级、原生统一多模态大模型 SenseNova U1.5 Lite。与预览版(U1.5 Lite Preview)呈现的原生统一多模态模型能力相比,正式版更关注的是,这些能力能否更准确、更稳定地进入真实视觉创作流程。
模型重点围绕真实视觉任务重新完善训练数据、任务设计与后训练流程,强化视觉质量、复杂指令遵循、文字与布局、原生4K、图像编辑和精细视觉控制等,提供更高可控性、更高清、更高性价比的能力工具,推动 AI 视觉生成真正跨越到“稳定完成真实视觉交付”的新阶段。
目前模型已面向全球开源,开发者与创作者可直接部署体验。
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
SenseNova Studio在线体验:https://unify.light-ai.top/
更完整的视觉创作能力,告别AI创作瓶颈
“精心写了 25 分钟的详细 Prompt,模型却只能解析 1k 字符,不得不花半小时删减细节”;“只想改掉图里的一只杯子,AI 却把背景和主角的脸一起换了”。
这些几乎是每个创作者都遇到过的“崩溃瞬间”。过往几年,行业往往把重点放在卷“画面美感”和“写实感”上;但在实际生产流程中,真正的核心问题是:模型能否精准执行你的完整意图?
SenseNova U1.5 Lite 解决了这一难题:
- 3-4k 字符超长复杂指令遵循:打破大多数开源模型在指令超过 1k 字符时易崩溃、遗漏细节的瓶颈。SenseNova U1.5 Lite 原生支持 3-4k 上下文长度,能够同时处理主体、数量、空间关系、文字、布局、风格等多重约束,提升复杂视觉任务的执行稳定性。
- 更高质量的视觉生成:改善整体构图、色彩、材质、光影、真实感和局部细节,减少“局部正确但整体完成度不足”的情况。
- 更可靠的原生图像编辑:增强主体身份、空间结构、版式关系和非编辑区域的保持,同时提升局部修改、元素替换、文字精修和多参考图编辑能力。
- 更好的文字与复杂布局:加强中英文文字、海报、信息图、品牌视觉及多文本排版能力,从“生成内容”进一步走向“组织完整视觉表达”。
- 更精细的视觉控制:支持 Bounding Box、Visual Marker 以及单图、多图参考等方式,对指定区域和对象进行更准确的编辑。
- 原生4K高分辨率输出:在高分辨率生成中兼顾整体构图与极精细的肌理、微小文字与光影折射。
实战演练:真实场景深度还原
我们挑选了最能考验“硬实力”的创作场景,带你看 SenseNova U1.5 Lite 如何搞定真实交付。
场景一:复杂视觉表达
1、创意海报与封面生成:
展现出极佳的美学完成度与高对比度质感。具备高精度的复杂布局能力,可精准掌控文字与留白节奏;在处理文字与物体的空间遮挡时,能够维持光影的自然连贯,充分展现了原生多模态对三维空间叠加关系的深刻理解。






2、高密度信息图生成:
保证中英文、数据等丰富细节的准确无误;通过多层级结构化空间映射,完美串联各类标签和信息,实现了复杂信息可视化图表的高质量一次性交付。



3、高清细节与艺术质感:
在建筑结构、人像肌理、艺术画作笔触等复杂场景中,展现出媲美摄影与大师画作的细腻质感。








场景二:原生图像编辑
1、布局与风格可控编辑
- 草图/线稿转复古暖色漫画:精准遵循超长复杂指令,保留线稿分镜与人物轮廓,上色与材质补充自然细腻。
prompt:请把这张手绘草图渲染成一幅复古暖色调的手绘漫画风格插图,背景带有米黄色纸张质感,整体光影温馨,突出烛光下的专注氛围。构图上保持草图的版式,中心是主场景,周围环绕五个带编号的分镜面板。左上角用巨大的毛笔字体写上主标题“敲击灵魂的机械轴”,下方加一个绿色标签写上“每一颗轴,都是我与世界对话的方式。”。中心画面里,戴着护目镜的少年正在烛光下用螺丝刀组装键盘,桌上有印着“BUILD SOUL”的马克杯和散落的轴体,少年上方的对话框写“深夜の工作台,只有我、烛光,还有这些小家伙。”,旁边黑猫的对话框写“又在折腾键盘啊?喵~”。右上角的面板①展示绿色金属键盘外壳,标题写“① 选个靠谱的‘壳’!”,下面配文“定制金属外壳,沉甸甸的安全感!”。右侧中间的面板②展示四种颜色的机械轴体,标题写“② 挑选心仪的‘轴’!”,配文“红轴轻盈,茶轴均衡,青轴清脆...总有一款击中灵魂!”。右下角的面板③特写拔键器取下键帽的动作,标题写“③ 拔键器,yyds!”,加上拟声词“咔哒!”,配文“拔键、换轴、换键帽,自由才是机械键盘的浪漫!”。左侧中间的面板④展示一堆反光的透明键帽,标题写“④ 透明键帽,透出光芒!”,配文“灯光透过键帽的那一刻,整个世界都温柔了。”。左下角的面板⑤展示发出温暖背光的组装完成的键盘,标题写“⑤ 大功告成!”,配文“每一次敲击,都是灵魂的回响!”。底部中间的画面是少年兴奋敲击键盘的动态特写,加上绿色爆炸框文字“这就是属于我的声音!♡”,底部写上拟声词“哒哒哒哒哒!!”。右下角角落画一只小猫看着蜡烛,气泡里写“机械键盘的魅力,在于创造,更在于热爱。喵~”。


- 跨主题迁移且保持排版:深度理解原海报的版式框架,切换主题后仍能保持完美的视觉结构。
prompt:沿用参考图的复古印刷风格,生成一张天文台公众开放日主题海报。


2、多参考图融合生成
- 融合核心元素与场景重组:如“橘猫骑摩托坐在咖啡馆内”,提取多图核心特征(主体、风格、光影),在全新空间中自然重组,光影与比例浑然天成。




编辑后
- 美食海报重组:多张美食图融合为一张完整海报,自动匹配一致的背景、餐盘质感与环境光,并完美植入排版文案。






编辑后
- 信息图参考元素替换:保留原海报中的所有元素,同时替换图中的乐队成员,并将下方板块重新排列,添加曲目和新的划线元素。
prompt:Edit Image 1 using Images 2 and 3 as content references rather than pasted rectangular images. Replace the framed band silhouettes with all five Radiohead members from Image 2, transformed into the poster’s distressed monochrome halftone style. Reflow the four lower feature blocks into a compact left column and add an ESSENTIAL LISTENING list on the right using Image 3 only for wording and hierarchy. Render the new list directly on the same continuous black distressed background with matching off-white type; do not retain any white or cream card background. Preserve all original text and all other poster elements.




编辑后
3、信息图编辑
- 变换风格主体保持不变:
prompt:将整张海报改为蓝银色高科技工业风,保持所有文字内容、机器人主体和信息布局不变。


- 局部属性修改:
prompt:将植物周围Cd、Pb、Zn、Cu、As五个圆形标签改为砖红色,文字保持米白。


4、文字编辑
- 黑板菜单局部文字替换:
prompt:将黑板菜单上“Summer Drinks”标题下方第一行、位于白色三角形符号右侧的黄色手写体文字“快乐柠檬水”替换为红色手写体文字“草莓啵啵奶茶”,保持原有粉笔质感和笔触风格,严格保留黑板上其余所有文字(包括价格5.00)、插图(柠檬、咖啡杯、冰棍)、木框结构及背景绿植环境不变。


- 多处精准文字重写:
prompt:在画面中央超大砖红色主标题,将 "PEARL" 替换为 "HORIZON"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在左上英文地点标题,将 "ORIENTAL PEARL TOWER" 替换为 "SHANGHAI LANDMARK"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在左上英文地点副标题,将 "SHANGHAI, CHINA" 替换为 "CITY OF HARMONY"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在右上中文地点标题,将 "东方明珠" 替换为 "城市之光"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在左侧城市宣言第一句,将 "A SYMBOL OF SHANGHAI." 替换为 "A BEACON OF VISION."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在右侧城市宣言第一句,将 "DESIGNED FOR HARMONY." 替换为 "BUILT FOR TOMORROW."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在建筑底部中文大标语,将 "时代的瞭望 · 城市的明珠" 替换为 "城市的节奏 · 未来的地标"。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。 在底部英文宣言,将 "A LANDMARK OF VISION. A BEACON OF SHANGHAI." 替换为 "A LANDMARK OF TOMORROW. A BEACON OF THE CITY."。若该区域足够显眼、清晰且边界简单,则逐字呈现,不得增删或改写字符;若文字过小、被遮挡、严重透视或位于复杂纹理中,则保留原文,不要为完成替换而重绘背景。


5、指定区域与局部精细编辑
prompt:将红框中的“WHY IT MATTERS”模块完整翻译为中文,保留原有图标、层级和排版;红框仅作定位,输出中不要保留红框。


prompt:Follow the marks and overall hints on the image to creatively transform this scene, making it moody, sophisticated midnight lounge vibe; remove the annotations when done.


8B 参数架构突破:不只是“更多”能力,还是“更稳定”和“更高性价比”
作为8B参数的轻量化模型,SenseNova U1.5 Lite在指令遵循与图像编辑保持度上超越了同量级模型,并在文字渲染与复杂布局上达到了媲美超大规模商业模型的交付水平。

面对不同视觉任务,业界通常采用显式 Router(路由)或多专家协同机制将渲染、美学、编辑分发给不同模型。但这大幅增加了系统开销与推理时延。
SenseNova U1.5 Lite 基于NEO-unify统一架构,打破了这一传统定式:
- 解耦训练与交付(MOPD 蒸馏):训练阶段针对文字、美学、编辑独立训练专家模型(Expert);交付阶段,通过多专家在线策略蒸馏技术(MOPD),将多专家能力无损融合至单体 8B 模型中。
- 理解与生成双向反哺:视觉语义理解与空间建模形成的认知直接反哺生成,使其自然消化多层级指令,同时在多模态理解榜单上保持强劲表现。
- 极致性价比:8B 参数量支持单卡流畅运行,无须 Router 频繁切换,单次 Pass 即可兼顾语义理解与像素生成,极大降低调用成本与推理延迟。

在 OneIG(EN、ZH)、LongText(EN、ZH)、BizGenEval(Easy、Hard)、CVTG、IGenBench 与 Qwen-Image-Bench 上的生成延迟与平均性能对比。
此外,正式版强化了任务导向的强化学习(RL)后训练,聚焦优化三大关键维度:
- 指令遵循(Instruction Compliance):轻松解析超长 Prompt,精准执行严苛的多重复杂限制。
- 视觉偏好(Visual Preference):全面优化构图、材质与光影,提升画面质感与视觉完成度。
- 编辑保持(Editing Preservation):实现像素级局部修改,完美保留非目标区域的内容与结构。
这种复杂指令跟随与精细编辑能力,使得 SenseNova U1.5 Lite 可以无缝支持多轮迭代修改而不跑偏。这真正打破了单次生成的局限,让轻量级模型参与长流程的持续创作与二次改造成为可能。
让开源创作从“能看”走向“能用”
多模态是AI迈向物理世界与真实生产力的必经之路。商汤 SenseNova U1.5 Lite 开源的初衷,正是希望为全球开发者与创作者提供一个轻量、统一、极具性价比且高可控的生产力工具。
欢迎前往 GitHub / Hugging Face 部署体验,与我们共同繁荣开源生态!
GitHub:https://github.com/OpenSenseNova/SenseNova-U1
Hugging Face:https://huggingface.co/collections/sensenova/sensenova-u15
魔搭社区:https://modelscope.cn/models/SenseNova/SenseNova-U1.5-8B-MoT
SenseNova Studio在线体验:https://unify.light-ai.top/
+++
关于商汤
作为人工智能软件公司,商汤科技以“坚持原创,让AI引领人类进步”为使命,旨在持续引领人工智能前沿研究,持续打造更具拓展性更普惠的人工智能软件平台,推动经济、社会和人类的发展,并持续吸引及培养顶尖人才,共同塑造未来。
商汤科技拥有深厚的学术积累,并长期投入于原创技术研究,不断增强行业领先的多模态、多任务通用人工智能能力,涵盖感知智能、自然语言处理、决策智能、智能内容生成等关键技术领域,同时包含AI芯片、AI传感器及AI算力基础设施在内的关键能力。
商汤科技业务涵盖生成式AI、视觉AI和创新业务,以高效率、低成本、规模化的AI创新和落地,打通商业价值闭环,引领人工智能进入工业化发展阶段。商汤前瞻性打造新型人工智能基础设施——商汤AI大装置SenseCore,打通算力、算法和平台,并在此基础上建立“商汤日日新SenseNova”大模型及研发体系,以低成本解锁通用人工智能任务的能力。此外,商汤科技持续领跑计算机视觉市场,商汤方舟 SenseFoundry以多年积累计算机视觉能力,辅以前沿多模态大模型,为国内外各行业提供更加稳定高效的视觉Al支撑。
商汤倡导“发展”的人工智能伦理观,并积极参与有关数据安全、隐私保护、人工智能伦理道德和可持续人工智能的行业、国家及国际标准的制订,与多个国内及多边机构就人工智能的可持续及伦理发展开展了密切合作。商汤《AI可持续发展道德准则》被联合国人工智能战略资源指南选录,并于2021年6月发表,是亚洲唯一获此殊荣的人工智能公司。
目前,商汤科技已于香港交易所主板挂牌上市。商汤在香港、上海、北京、深圳、成都、杭州、西安、新加坡、曼谷、吉隆坡、利雅得、阿布扎比、迪拜、首尔等地设立办公室。另外,商汤科技在德国、泰国、印度尼西亚、菲律宾等国家均有业务。更多信息,请访问商汤科技网站、微信、微博和领英。
媒体联络及查询
商汤科技
邮箱:pr@sensetime.com



