来源:量子位查看原文 ↗
原文版权归来源方所有,本站仅作收录、翻译或格式整理。
事实脉络
解读与影响
商汤科技近日预览了其轻量级开源模型 SenseNova U1.5 Lite,该模型以原生 4K 分辨率图像生成能力、8B-MoT 参数规模及精准的局部编辑功能,在技术社区引发关注。
SenseNova U1.5 Lite 是商汤自研 NEO-Unify 架构下的一个早期预览版本。其核心思路是将语言理解、视觉语义和像素生成融合在同一个模型内,从而覆盖视觉理解、推理、生成与编辑等多项任务[来源:sohu.com]。在仅有 8B-MoT 参数的轻量身形下,该模型展现出了对复杂指令的承接能力,能够处理长篇、多约束、层次化和结构化的视觉指令。这意味着用户可以用更接近自然语言的方式描述需求,比如指定画面中的物体位置、颜色、文字内容及其排版风格。
除了高分辨率直出,该模型在文字与版式生成上表现突出,尤其适用于海报、信息图表、品牌视觉等高信息密度内容的创作[来源:sohu.com]。从量子位发布的演示案例来看,模型生成的图片在放大后,画面中的文字与图像元素依然能保持较高的清晰度与细节。此外,其“指哪儿改哪儿”的编辑能力也是一大亮点——用户可以通过红框、坐标或标记点等方式,对生成图片的局部进行精准修改,或进行多图组合与局部文字替换,这为需要反复迭代的创意设计工作流提供了便利。
作为一款开源模型,SenseNova U1.5 Lite 的发布降低了开发者与创作者使用高分辨率 AI 生图工具的门槛。与此前一些闭源商业模型不同,开源策略允许社区在其基础上进行微调与二次开发,有望催生更多面向特定场景(如电商设计、游戏资产生成)的定制化应用。不过,原文未提供该模型具体的开源协议、完整技术报告或后续正式版发布时间表,这些信息仍有待商汤方面进一步披露。