跳转至

arXiv 2026-06-27

标题 作者 发布日期 PDF链接 摘要
DanceOPD:基于策略的生成场蒸馏 Wei Zhou 2026-06-25 PDF 现代图像生成需要一个统一的模型来整合多种能力,包括文生图(T2I)、局部编辑和全局编辑。然而,这些能力往往难以自然对齐且相互冲突。例如,编辑操作会降低T2I性能,而全局编辑与局部编辑之间也会相互干扰。因此,如何有效组合这些能力已成为图像生成模型训练的核心挑战。为解决这一问题,我们提出DanceOPD——一种面向流匹配模型的在线策略生成场蒸馏框架。该框架将每个样本路由至单一能力场,查询一个低噪声的学生诱导状态,并通过简单的速度均方误差目标进行训练。通过将每个能力源定义为共享流状态空间上的速度场,学生模型能够基于自身展开状态查询的场来学习组合专家能力。该框架还可吸收算子定义场(如无分类器引导)。在T2I、编辑、真实感场吸收和CFG吸收上的综合实验表明,我们的方法改进了多能力组合,在保持锚点生成质量的同时强化了目标能力。我们相信这项工作为流匹配模型中的生成场蒸馏建立了实用路径。
提问、求解、生成:基于自一致性奖励的自进化统一多模态理解与生成 Ritesh Thawkar 2026-06-25 PDF 大多数统一的大规模多模态模型(LMMs)虽同时支持视觉理解与图像生成,仍依赖精心设计的后训练监督信号,如人工标注、偏好标签或外部奖励模型。我们探究统一LMM能否仅利用无标注图像自主提升这两项能力。为此提出自演进训练框架,包含三个内部角色:提出者(Proposer)生成视觉问题,求解者(Solver)回答问题并评估答案,生成者(Generator)合成图像。训练仅使用自洽性信号,无需人工标注、偏好标签或任务训练的外部奖励/评判模型。为稳定学习过程,我们引入求解者令牌熵(STE)——基于令牌级预测不确定性的连续难度信号,在样本级自洽性失效时仍具效用。针对图像生成,设计多尺度内部评估方案,融合问答忠实度评分与循环一致性描述。这构建了求解者中介耦合机制:更强的视觉理解能力可提升生成评估可靠性,并强化内部训练信号。该框架在扩散模型BLIP3o、整流流模型BAGEL及自回归模型VARGPT-v1.1架构中保持相同的角色分解、奖励逻辑与训练策略,仅需各基础模型的原生提示与生成接口。在八项理解指标上,本方法持续超越对应基线模型。在BAGEL上,MMMU指标绝对提升3.5%,GenEval图像生成性能从82%提升至85%。代码与模型已公开。
世界行动模型通过循环生成重放实现持续模仿学习 Manish Kumar Govind 2026-06-25 PDF 超越预测机器人动作,世界动作模型(WAMs)还能生成未来的视觉观测。基于这一生成能力,我们提出循环生成回放(REGEN)——一种持续模仿学习框架,通过合成伪回放轨迹,使机器人策略无需存储原始人类示范即可演练先前学过的任务。在持续适应过程中,REGEN递归调用WAM,仅依据先前任务指令和当前任务观测来合成伪回放轨迹。在仿真和真实世界操作场景的实验中,REGEN相比顺序微调将灾难性遗忘降低了高达50%,同时性能接近需要访问真实回放数据的特权经验回放方法。最后,我们分析了限制生成回放的因素,将长时程视觉退化与动作-观测不一致性确定为主要瓶颈。我们的研究结果确立了WAMs作为无需存储示范的持续机器人学习的有前景基础。
在自进化大型多模态模型中更加关注视觉标记 Shravan Venkatraman 2026-06-25 PDF 近期,自进化大型多模态模型(LMMs)因能在纯无监督环境下提升视觉推理能力而受到关注。然而,现有自进化LMMs中的多角色自博弈与自一致性奖励机制仅优化答案一致性,却无法确保解码器关注视觉内容,反而依赖统计语言先验生成自一致输出。这导致一种我们称为"视觉欠条件化"的持续性失效模式——解码器在生成过程中依赖语言先验而非图像信息,表现为对视觉标记的注意力不足。因此,当前自进化LMMs在图像描述、视觉问答等视觉-语言理解任务中表现欠佳。为解决该问题,我们提出VISE(视觉不变性自进化),一种纯无监督自进化框架,通过两种互补的不变性奖励直接约束模型的视觉条件化策略:几何不变性奖励强制模型在已知变换下保持空间一致性,语义不变性奖励则通过要求模型在预测区域被扰动时识别证据缺失,从而惩罚无证据支持的生成。VISE在单一模型内运行,无需专家角色、外部奖励模型或标注数据,仅使用原始无标签图像进行训练。在18个基准测试上的实验证明了该方法的有效性。以Qwen3-VL-2B为基础模型,VISE在COCO上提升+16.85 CIDEr,在TextCaps上提升+19.66 CIDEr,将物体幻觉降低5.0 Chair-I分,并能在四个模型家族及不同规模间泛化。我们的代码和模型已开源至https://mbzuai-oryx.github.io/VISE。
DnA:面向视觉任务的去噪注意力机制 Ron Campos 2026-06-25 PDF 多头注意力机制中的softmax激活函数是视觉感知任务中基于注意力模型的事实标准。然而,标准softmax可能产生噪声注意力模式,这会稀释相关特征并降低其性能。本文提出去噪注意力(Denoising Attention, DnA),其核心机制为:首先,正向查询识别属于正确类别的图像特征,负向查询识别紧密关联但无关的图像特征。随后,DnA将这些交互投影到主角度更大的两个不同子空间,促进子空间分离并提升可判别性。基于ViT-B骨干网络,我们提出的DnA在ImageNet-1K上相比基线获得0.8%的绝对增益。我们进一步展示了在多个视觉理解任务上的改进,包括视频变换器(1.8%)和视频大语言模型(0.5%)的视频理解任务。大量实证分析验证了涉及两个交互子空间的设计选择以及DnA的去噪效果。
不要止步于模式!通过特征自引导缓解预训练流模型中的多样性崩溃 Pradhaan S Bhat 2026-06-25 PDF 最先进的流模型能够根据文本或图像提示生成令人惊艳的图像。然而,在相同条件下生成多个样本时,这些模型会出现多样性崩溃的问题。现有方法要么通过潜在引导(效果有限)来解决,要么依赖样本选择(需要外部奖励模型,导致显著的推理时间开销)。本文提出了一种高效、无需训练的自我引导机制,在不依赖额外奖励模型的情况下缓解多样性崩溃。具体而言,我们在批量生成过程中通过特征自我引导分散流模型的内部特征。此外,为使特征保持在流形附近,我们引入了一个流形正则化步骤,将这些分散的特征投影回数据流形,从而在保持与输入条件对齐的同时实现多样化生成。该方法可作为即插即用模块无缝集成到预训练流模型中,仅增加极小的推理成本。实验表明,在多种条件流模型(包括多步和少步文本到图像、深度到图像以及参考图像生成)中,该方法在保持保真度的同时显著提升了多样性。
无需真实答案的强化学习可提升大语言模型性能 Yingyu Lin 2026-06-25 PDF 基于可验证奖励的强化学习(RLVR)在训练大语言模型时通常依赖真实答案来分配奖励,这限制了其在真实解未知任务中的应用。我们提出了一种基于排序诱导的可验证框架(RiVER),该框架无需真实解即可在基于分数的优化任务上训练大语言模型,通过确定性执行反馈作为连续值监督信号。将群体相对强化学习应用于此类连续奖励时,我们识别出两个关键挑战:一是"规模主导",即跨测试实例未校准的分数幅度会扭曲策略更新;二是"频率主导",即反复采样的次优解可能压倒罕见但更优的候选解。RiVER通过校准奖励整形应对这些挑战,采用实例间比较并强调排名靠前的求解器,同时为其他有效解保留有界反馈。我们在12个AtCoder启发式竞赛任务上训练,并在算法工程基准(ALE-Bench)、LiveCodeBench和USACO上评估。RiVER使Qwen3-8B和GLM-Z1-9B-0414在ALE评级排名中分别提升8.9%和9.4%。更重要的是,尽管仅基于分数任务训练且无任何真实解,RiVER在精确解基准(如LiveCodeBench和USACO)上仍使基础模型平均绝对提升2.4%和3.5%。相比之下,使用原始执行分数训练的基线虽能提升ALE评级,但无法迁移至精确解基准。这些结果表明,结合适当奖励校准的基于分数的优化任务,可作为无需真实解的有效通用编码能力训练环境。
PhysiFormer:学习在世界空间中模拟力学 Yiming Chen 2026-06-25 PDF 我们提出PhysiFormer,一种用于生成物理合理三维物体运动的扩散Transformer。与在视角相关的像素空间中运行的视频世界模型不同,PhysiFormer将物体表示为世界坐标系中的三维网格。给定初始顶点位置和速度,以及物体材质类型(刚性或弹性),该模型可采样未来的顶点轨迹。虽然相关神经物理方法依赖于特定设计的潜在空间或显式强制刚性和因果性,但PhysiFormer表明,通过将顶点轨迹预测直接视为世界坐标系中的单一去噪扩散过程,无需任何此类归纳偏置即可获得优异结果。概率化公式能够捕捉学习动力学中的不确定性,从而从初始条件生成多样化的合理未来,使该框架在存在未观测不确定性的应用中具有潜在价值。该模型采用时间、空间和物体维度分解的注意力机制以提高效率,无需显式物体编码即可实现排列不变的多物体推理。基于超过10万条模拟轨迹的训练,PhysiFormer可生成刚性和弹性力学行为,并泛化至混合材质场景、未见过的真实世界几何形状以及更多物体数量。在轨迹精度、刚性保持和基于动量的物理一致性方面,它显著优于自回归基线方法。我们的结果表明,坐标空间扩散是迈向机器人学、图形学和物理设计中视角不变、几何感知世界建模的有前景的一步。可视化结果、代码和模型可在https://yimingc9.github.io/physiformer获取。
自回归玻尔兹曼生成器 Danyal Rehman 2026-06-25 PDF 在统计物理中,热力学平衡态下分子系统的高效采样是一项标志性挑战。这一挑战推动了玻尔兹曼生成器(BG)的发展,它通过结合具有精确似然性的生成模型和重要性采样校正,能够快速生成无关联的平衡样本。然而,现代BG主要依赖归一化流(NF),这类方法要么因严格可逆性约束(离散时间)导致表达能力受限,要么因似然计算成本高昂(连续时间)而效率低下。本文提出自回归玻尔兹曼生成器(ArBG)——一种新型自回归建模框架——通过突破基于流的BG范式克服了这些局限。ArBG规避了流的拓扑约束,支持推理阶段的顺序干预,同时通过利用大型语言模型中的高效架构增强了可扩展性。实验表明,ArBG在所有基准测试中均显著优于基于流的模型,尤其在10残基的Chignolin等较大肽系统中表现突出。此外,我们基于ArBG框架训练了包含1.32亿参数的可迁移模型Robin,该模型将8残基系统的零样本能量误差E-W$_2$降低了超过60%,超越了此前最优水平。代码见链接:https://github.com/danyalrehman/autobg。
大语言模型中的序列概率与正确性:何时可能的答案是正确的? Johannes Zenn 2026-06-25 PDF 许多针对大型语言模型的解码方法,可理解为将概率质量向模型更倾向的输出转移——这种转移既可在词元局部层面进行,也可在序列全局层面实现。因此,这些方法的有效性取决于一个根本性问题:序列概率(即给定提示后生成内容的条件概率)何时能真正与正确性对齐?本文从四个维度系统量化了这种关系:跨解码方法、方法内超参数、数据集内提示-答案对、以及同一提示的重复响应。研究发现,在固定数据集的提示-答案对中,较高的序列概率往往能预测正确性。但这种关系通常无法推广至解码决策:通过调整超参数或改变解码方法来提升序列概率,并不能稳定提高准确率。此外,对于同一提示的不同响应,序列概率并非正确性的可靠指标。这些发现厘清了解码方法在何种情况下能/不能提升正确性,并为解码策略、自一致性及无验证器自我改进提供了实践指导。