SenseNova-U1.5 升级到 4K,修好了商汤无编码器 AI 的分块接缝
一条五阶段流水线,把四个强化学习专家蒸馏进一个支持 4K 输出的 8B 开源模型

商汤本周发布了 SenseNova-U1.5 的技术报告。这是一个 80 亿参数的原生多模态模型,在单一架构内处理图像理解、生成和编辑 —— 既没有视觉编码器,也没有变分自编码器。这份报告由 65 名研究人员组成的团队于 9 月 10 日发布在 arXiv 上,并入选了 HuggingFace 9 月 11 日的每日论文精选。它记录了一条五阶段训练流水线:从原始像素和文本出发,构建一个通用视觉智能系统,而不借助目前支撑大多数图像生成模型的任何预训练视觉模块。论文最有分量的主张 —— 一个直接从原始像素学习的模型,可以把理解过程中获得的结构性知识迁移到视觉创作任务上 —— 把这个领域的争论从理论推进到了有实证支撑的阶段。
论文想要弥合的那道架构分野
今天的大多数视觉 AI 系统,都由两个分别训练的子系统拼装而成。在感知一侧,CLIP 或 SigLIP 这类预训练视觉编码器把原始图像转换成高层语义特征向量。在生成一侧,变分自编码器把图像压缩到一个紧凑的潜空间,让扩散模型或流匹配模型能在其中高效运作。例如,DeepSeek 的 Janus-Pro 模型 为理解和生成保留了完全独立的参数通路:感知走 SigLIP 编码器,合成走 VQ 分词器。BAGEL、FLUX.1-Dev,以及包括 GPT-4o 图像能力背后在内的大多数商业图像生成器,都依赖某种形式的这种拆分。
这种拆分是务实的:在大规模数据集上训练出来的编码器和 VAE 提供了强大的起点,能降低微调所需的算力。但商汤认为,它在结构上是有局限的。当理解和生成在不同的表示空间里运作 —— 一个为语义抽象优化,另一个为像素级保真优化 —— 两个系统就很难共享各自学到的东西。感知无法直接指导生成;生成也无法直接指导感知。两者之间的任何迁移,都需要一个显式的桥接层或架构交接,这会带来额外的工程复杂度和潜在的信息损失。
SenseNova-U1.5 走的是另一条路。它在单一 transformer 骨干内同时处理原始图像像素和文本 token,从零开始学习一个共享表示。模型从不通过一个单独优化的潜空间,把控制权从编码器交给解码器。理解和生成从一开始就在同一套参数上共同训练,团队把这种设计称为 NEO-unify。
延伸阅读:DeepSeek V4 Flash Vision Exp:以文本模型的价格打开多模态智能体工作流
架构究竟如何运作
模型的视觉处理从一对卷积投影开始,把每张输入图像总共下采样 32 倍,每个 32×32 像素区域产生一个视觉 token。二维正弦位置编码保留空间坐标,得到的 token 序列被送进处理文本 token 的同一个 transformer 骨干。这一步没有任何预训练视觉编码器参与。视觉 token 和文本 token 被投影到一个共享的隐藏空间里,联合处理。
在生成方面,SenseNova-U1.5 直接在像素空间里做流匹配,而不是在 VAE 潜空间里。这一点意义重大:模型不是先在一个压缩的瓶颈里生成、再向外解码,而是学会把带噪的像素序列直接去噪成连贯的图像。训练目标结合了三种损失:用于文本预测的自回归交叉熵、以速度场为监督的像素空间流匹配,以及用来保证生成图像结构和文字一致性的 LPIPS 感知损失。
模型采用 Mixture-of-Transformers(MoT)设计,而不是单一的无差别骨干。干净的图文 token 和带噪条件的生成 token 交错排在同一条序列里,两类 token 各有独立的注意力投影、归一化和前馈参数。关键在于,这两条流共享自注意力,因此理解状态和生成状态可以在每一个 transformer 层通过跨流注意力交换信息 —— 无需单独的融合模块。从干净上下文到生成 token 的注意力是允许的;从生成状态回到干净上下文的注意力则被显式屏蔽,以防随机噪声污染感知表示。
解决分块接缝问题
SenseNova-U1.5 的前代 SenseNova-U1 证明了无编码器的像素空间生成是可行的,但在高分辨率下遇到了一个结构性问题。由于 U1 用一个独立的 MLP 头分别解码每个 32×32 视觉 token,相邻 token 在图像形成的最后阶段无法共享信息。在标准分辨率下,这还能得到可接受的结果。到了 4K,瑕疵就变得明显:分块边界处的接缝、跨边缘的纹理断裂,以及随分辨率升高而加剧的几何不一致。
U1.5 用一个轻量级的空间解码器取代了逐分块的 MLP。过程分几步:模型先把骨干输出的隐状态序列重新排成二维空间网格,再分三个阶段做 Pixel Shuffle 上采样,上采样倍数分别为 2、2 和 8。每个上采样阶段之间,用 3×3 卷积让相邻 token 区域的信息在像素最终确定之前传播开来。结果是,分块边界附近的颜色、纹理和几何是联合确定的,而不是各自独立确定的,这在只增加少量计算开销的前提下大幅减少了接缝瑕疵。模型现在支持从 512×512 到 4096×4096 的原生分辨率合成。
分辨率本身也成了一个显式的条件信号。随着图像尺寸增大,有效噪声幅度会变化,一个在某一分辨率上训练的朴素模型,泛化到另一个分辨率时效果很差。U1.5 用一个感知分辨率的噪声尺度嵌入来解决这个问题,把归一化参考分辨率从 U1 的 2048×2048 扩展到 4096×4096。这个嵌入在每次前向传播中直接加到扩散时间步的表示上,让去噪网络明确感知到随分辨率变化的噪声统计特性。
「先专精、后统一」的后训练策略
这篇论文在结构上最新颖的贡献,不是架构改动,而是后训练方法 —— 团队称之为「先专精、后统一」。视觉创作涵盖奖励信号根本不同的多种任务:审美偏好、文字清晰度、复杂版式设计和细粒度图像编辑,各自需要不同的优化激励。作者认为,在一个策略里同时优化这四者,会让相互竞争的梯度纠缠在一起,稀释各任务特有的收益。
解决办法是用强化学习分别训练四个专家模型,再通过多专家同策略蒸馏,把它们的能力合并进基础模型。
四个强化学习专家各自用任务专属的数据、奖励函数、采样策略和正则化来训练。审美专家使用 HPSv3++ 人类偏好奖励模型,并结合 PaddleOCR 的文字保真度打分,用保系数采样(CPS,η=0.7)在推演中引入随机探索。OCR 专家专攻中英双语文字渲染,使用一种多重集交并比奖励,对缺失、重复或畸形的字符施加惩罚。编辑专家在一个五维奖励上训练,其中分别衡量指令完成度、编辑后的视觉质量、未修改区域的保留程度,以及适用时的文字渲染 —— 各维度取最小值来汇总,这样任何一项高分都掩盖不了某项关键失败。信息图专家经历三个阶段:OCR 热身阶段、在精选偏好对上优化审美质量的直接偏好优化(DPO)阶段,以及结合 OCR 与 HPSv3++ 的最终交替奖励阶段。
四个专家训练完成并冻结后,由同策略蒸馏把它们的能力迁移进基础模型。学生模型生成自己的去噪轨迹;在每个采样的时间步,把学生预测的速度场,与冻结的专家从同一起始状态出发给出的预测进行比较。损失函数在对学生轨迹施加停止梯度的前提下,最小化这两个速度场之间的 L2 距离,从而避免在整条去噪链上做完整的反向传播。一套渐进式的 Beta 分布时间步调度方案,逐步把优化重心从早期的高噪声步骤 —— 它们确立全局构图 —— 移向后期的低噪声步骤,后者负责打磨文字保真度和精细细节。这防止学生模型过拟合于粗略结构,而忽视了排版质量。
SenseNova-U1.5 在竞争格局中的位置
统一多模态模型领域一直在同时朝两个方向发展。Janus-Pro、BAGEL、Show-o 和 OmniGen2 这类模块化混合模型保留了独立的编码器和 VAE 组件,但试图通过共享注意力或路由机制来统一理解与生成。它们已经取得了很强的基准数字;4B 参数的 OmniGen2 在其自己的评测中报告了 88.81 的 DPG-Bench 总分。原生模型 —— 不经过中间分词器、直接处理原始像素 —— 构成了一个规模较小但在增长的群体。SenseNova-U1.5 是迄今文档最详尽、且公开权重的 8B 原生模型。
根据商汤为 U1(直接前代)报告的基准,按团队自己的表格,该模型在 GenEval 组合生成上得分 0.91,在同一评测中胜过 Qwen-Image 的 0.87、BAGEL 的 0.82 和 FLUX.1-Dev 的 0.82。在文字渲染方面,U1 在中英多区域文字基准 CVTG-2K 上取得了 0.940 的词准确率。截至本文发稿,这些数字均来自公司自行进行的评测,尚未被第三方独立复现。U1.5 与闭源模型(GPT-Image-2、Qwen-Image2-Pro、Seedream 5.0)的基准对比见于论文的表格,其中加了提示词增强的 U1.5 在 Qwen-Image-Bench 总分上得 60.13,高于闭源的 GPT-Image-1.5 的 59.65 —— 但同样,这些数字由公司报告,应视为有待独立复现的主张。
最有意义的竞争差距不在标题级基准上,而在 8B 规模下的能力覆盖面。多数 8B 级开源模型要么擅长理解、要么擅长生成;两者兼顾的更少。SenseNova-U1.5 声称在单一模型检查点内涵盖了图像理解、最高 4K 的生成、支持多参考输入的指令式图像编辑、图文交错生成,以及中英双语排版。
尚未验证的部分,以及这项技术仍有欠缺的地方
论文中有几项主张,需要经过独立评测才能被视为确立的结果。U1.5 在编辑基准(ImgEdit、GEdit-Bench、WeEdit、OmniRef-Bench、RISEBench)和图文交错生成基准(OpenING、VBVR-Pro-Bench)上的分数虽然出现在论文中,但都是公司自行评测的。论文没有纳入第三方或外部评测团队 —— 对这个阶段的技术报告而言这很常见,但也限制了对比较性主张的信心。
训练数据的构成只有笼统的描述 ——「精心整理的生成与编辑数据」「高质量的真实与合成数据」—— 数据集的确切来源、规模和授权,在论文公开版本中并没有完整列出。想要复现训练流水线的研究者,在开源代码发布完成之前需要这些信息。
论文也指出了架构上的局限。GenEval 的属性绑定维度 —— 检验生成图像是否在组合场景中把属性正确分配给了对应的物体 —— 在 U1 上,这一项仍低于 OneCAT 和 Mogao 在该基准上的表现。尚不清楚 U1.5 是否完全弥合了这一差距。在可供审阅的论文部分中,没有单独给出 U1.5(而非 U1)的理解基准分数。最后,论文没有描述模型的安全评测方法;arXiv 提交的版本中既没有红队报告,也没有对抗鲁棒性方面的披露。
训练代码发布与下一步
商汤在论文中表示,训练代码 —— 涵盖监督微调、强化学习后训练和同策略蒸馏 —— 将会开源,但没有给出时间表。SenseNova-U1 系列的 GitHub 仓库已经托管了配置文件、推理代码和 ComfyUI 工作流集成;训练代码的发布将大大提升研究社区的可复现性,因为论文中描述的多专家强化学习与蒸馏流水线,比标准 SFT 工作流复杂得多。
论文的结论指出了一个超越图像生成的方向:SenseNova-U1 已经在视觉-语言-动作(VLA)任务和世界建模上展示了初步结果,这表明一个原生统一的表示,最终有可能成为具身智能系统的基础 —— 那种需要在共享计算架构内感知、推理和行动的机器人。U1.5 缩小了当前模块化系统在图像合成质量上所能达到的水平,与无编码器架构所能产出的水平之间的差距;如果长期目标是一个涵盖感知、想象、规划和物理行动的单一表示,这一点最为要紧。「先专精、后统一」的后训练策略能否扩展到那些下游场景,还是会产出难以在不互相干扰的情况下整合的专家,是下一代实验需要回答的问题。