商汤开源8B多模态模型,支持原生4K图像生成
创始人
2026-08-21 14:56:29
0

商汤科技开源SenseNova U1.5-Lite-Preview,这是一款将视觉理解、图像生成和编辑放在同一模型中的多模态模型,采用8B-MoT规模,支持原生4K图像生成。

该模型相比SenseNova U1提升了局部纹理、细节和真实质感表现,也能更准确地生成中英文文字和复杂版式。商汤还称,模型在图像编辑时能够更好地保持主体身份和空间结构。

用户可以通过边界框、视觉标记和多张参考图控制生成与编辑结果。SenseNova U1.5-Lite-Preview目前已在GitHub、Hugging Face和ModelScope开放,仍属于预览版本。

相关内容

热门资讯

AI进化速递丨DeepSeek... ①DeepSeek上新多模态模型:多模态视觉理解模型DeepSeek-V4-Flash-Vision...
开源共享赋能创新 中国AI智惠... 央视网消息(焦点访谈):在2026世界人工智能大会暨人工智能全球治理高级别会议开幕式上,习近平主席提...
原创 A... 路透社曝出独家消息,美国向三十多个国家发送信函,试图逼迫各国在中美AI之间做出二选一,如果参与中国主...
开源证券:给予华秦科技买入评级 开源证券股份有限公司王加煨,马智焱近期对华秦科技进行研究并发布了研究报告《2026年中报业绩点评:业...
陈丹青:AI这事儿,我根本没资... “我一直在画画,但不想办展。除了教书那几年,我从来在‘艺术界’之外,界内的动静,我不知道的。手机上关...
百万奖金怎么拿?这有一份202... 由开源中国主办的2026上海开源软件应用创新大赛已正式启动报名,作为上海市的年度重磅技术赛事,本次大...
AI硬件周报:理想汽车八个月1... 本期速览:1.宇树科技登陆科创板首日收涨460%;2.理想汽车八个月12位核心高管离任;3.字节Se...
光轮智能亮相WRC,发布全球首... 8月19日至23日,2026世界机器人大会(WRC2026)在北京北人亦创国际会展中心举行。光轮智能...
造AI的人比用AI的人更分裂:... 文|思策智库2006年,李飞飞在普林斯顿一间不算宽敞的办公室里,跟学生说了一句当时听起来有点“反算法...
AI进入“干活”时代 ,办公赛... TalkingData发布|解读中国AI应用市场。随着人工智能技术的深度落地与用户习惯的快速养成,国...