商汤发布 SenseNova U1 Infographic-V3 开源模型,新增局部文字与风格编辑能力,显著提升信息图可编辑性。
📝 详细摘要
文章介绍了商汤科技最新开源的信息图生成模型 SenseNova-U1-8B-MoT-Infographic-V3(简称 Infographic-V3)。该模型在继承 V2 强大的图文融合、复杂排版与结构化视觉表达能力的基础上,首次加入信息图编辑功能,支持局部文字修改、整体风格切换以及全局布局调整,使得用户能够在不重新生成的情况下对图像进行精细打磨。文章通过多组前后对比图示展示了文字替换、风格迁移、布局美化等具体编辑案例,并给出了在 WeEdit 和 Qwen-Image-Bench 两个基准上的评测结果,表明模型在文字编辑和综合图像生成方面表现优秀。最后指出团队正在探索让模型实现自我检查与自我纠错的闭环,以进一步提升一次性交付高质量视觉内容的能力。模型权重及文档已在 Hugging Face、ModelScope 等平台开放下载。
💡 主要观点
- Infographic-V3 首次加入信息图编辑能力,支持局部文字和全局风格修改。 用户无需重新生成整张图,只需标注区域或使用自然语言 Prompt,即可在保持原有版式和视觉结构的前提下完成文字替换、风格迁移等操作。
💬 文章金句
- 新版本延续了 V2 强大的信息图生成能力,并首次加入信息图编辑能力:当画面整体已经令人满意时,用户无需推倒重来,只需针对局部文字或整体风格进行修改,即可继续完善作品。
- 让好图不再因小错作废。
- 在编辑榜单 WeEdit 上,Infographic-V3 均分为 5.89 分,表现为开源模型中的最优。
- 为了获得稳定的信息图编辑能力,技术团队没有只在后训练上调整,而是回到 MT(中期训练)阶段重新设计训练路径。
- 目前 SenseNova U1 信息图增强版 V3(SenseNova-U1-8B-MoT-Infographic-V3)已面向全球用户开源。
📊 文章信息
AI 初评:82
来源:GitHubDaily
作者:GitHubDaily
分类:人工智能
语言:中文
阅读时间:10 分钟
字数:2469
标签: AI 模型, 信息图, 图像编辑, 开源模型, 商汤科技