商汤科技宣布开源SenseNova U1.5-Lite-Preview,这是一款将视觉理解、图像生成和编辑放在同一模型中的多模态模型,采用8B-MoT规模,支持原生4K图像生成。
该模型相比SenseNova U1提升了局部纹理、细节和真实质感表现,也能更准确地生成中英文文字和复杂版式。商汤还称,模型在图像编辑时能够更好地保持主体身份和空间结构。
用户可以通过边界框、视觉标记和多张参考图控制生成与编辑结果。SenseNova U1.5-Lite-Preview目前已在GitHub、Hugging Face和ModelScope开放,仍属于预览版本。





