跳转至

arXiv 2026-06-28

标题 作者 发布日期 PDF链接 摘要
DanceOPD:基于策略的生成场蒸馏 Wei Zhou 2026-06-25 PDF 现代图像生成需要一个能够统一多种能力的单一模型,包括文生图(T2I)、局部编辑和全局编辑。然而,这些能力很少能自然对齐,且常常相互冲突。例如,编辑往往会降低T2I性能,而全局编辑与局部编辑之间也会相互干扰。因此,如何有效整合这些能力已成为图像生成模型训练的核心挑战。为解决这一问题,我们提出DanceOPD——一种面向流匹配模型的在线策略生成场蒸馏框架。该框架将每个样本路由至单一能力场,查询一个低噪声的学生诱导状态,并通过简单的速度MSE目标进行训练。通过将每种能力源定义为共享流状态空间上的速度场,学生模型能够基于自身展开状态查询的场来学习组合专家能力。该公式还可吸收算子定义的场(如无分类器引导)。在T2I、编辑、真实感场吸收和CFG吸收上的综合实验表明,我们的方法改进了多能力组合,在保持锚点生成质量的同时增强了目标能力。我们相信这项工作为流匹配模型中的生成场蒸馏建立了一条实用路径。
提问、解决、生成:通过自一致性奖励实现自我进化的统一多模态理解与生成 Ritesh Thawkar 2026-06-25 PDF 大多数统一的大规模多模态模型(LMMs)虽同时支持视觉理解与图像生成,仍依赖精心设计的后训练监督信号,例如人工标注、偏好标签或外部奖励模型。我们探究统一LMM能否仅利用无标注图像自主提升这两项能力。为此提出一种自演进训练框架,包含三个内部角色:提议者(Proposer)生成视觉问题,求解者(Solver)回答问题并评估答案,生成者(Generator)合成图像。训练过程仅使用自洽性信号,无需人工标注、偏好标签或任务训练的外部奖励/评判模型。为稳定学习,我们引入求解者令牌熵(STE)——一种基于令牌级预测不确定性的连续难度信号,在样本级自洽性不可靠时仍保持有效性。针对图像生成,我们设计多尺度内部评估方案,将问答保真度评分与循环一致性描述相结合。这形成了求解者介导的耦合机制:更强的视觉理解能力带来更可靠的生成评估与更优质的内部训练信号。该框架在扩散模型BLIP3o、整流流模型BAGEL及自回归模型VARGPT-v1.1上保持相同的角色分解、奖励逻辑与训练流程,仅需各基础模型的原生提示与生成接口。在八项理解指标上,我们的方法持续超越对应基线模型。在BAGEL上,MMMU指标获得+3.5%的绝对提升,GenEval图像生成性能从82%提升至85%。代码与模型已公开发布。
世界行动模型通过循环生成重放实现持续模仿学习 Manish Kumar Govind 2026-06-25 PDF 超越预测机器人动作,世界动作模型(WAMs)还能生成未来的视觉观测。基于这一生成能力,我们提出循环生成回放(REGEN)——一种持续模仿学习框架,通过合成伪回放轨迹,使机器人策略无需存储原始人类示范即可演练先前学过的任务。在持续适应过程中,REGEN递归调用WAM,仅依据先前任务指令和当前任务观测来合成伪回放轨迹。仿真与真实世界操作实验表明,相比顺序微调,REGEN将灾难性遗忘降低高达50%,同时性能接近需要访问真实回放数据的特权经验回放方法。最后,我们分析了限制生成回放的因素,将长时程视觉退化与动作-观测不一致性确定为主要瓶颈。我们的研究确立了WAMs作为无需存储示范的持续机器人学习的有前景基础。
在自演进大型多模态模型中更加关注视觉标记 Shravan Venkatraman 2026-06-25 PDF 近期,自进化大型多模态模型(LMMs)因能在纯无监督环境下提升视觉推理能力而受到关注。然而,现有自进化LMMs中的多角色自博弈与自一致性奖励机制仅优化答案一致性,未能确保解码器关注视觉内容,反而依赖统计语言先验生成自一致输出。这导致一种我们称为"视觉欠条件化"的持续性失效模式——解码器在生成过程中依赖语言先验而非图像,表现为对视觉标记的关注不足。因此,当前自进化LMMs在图像描述、视觉问答等视觉-语言理解任务中表现欠佳。为解决该问题,我们提出VISE(视觉不变性自进化),一种纯无监督自进化框架,通过两种互补的不变性奖励直接正则化模型的视觉条件化策略:几何不变性奖励强制模型在已知变换下保持空间一致性,语义不变性奖励则通过要求模型在预测区域被扰动时识别证据缺失,惩罚无证据支持的生成。VISE在单一模型内运行,无需专家角色、外部奖励模型或标注,仅使用原始无标签图像训练。在18个基准测试上的实验证明了该方法的有效性。以Qwen3-VL-2B为基础模型,VISE在COCO上提升+16.85 CIDEr,在TextCaps上提升+19.66 CIDEr,将物体幻觉降低5.0 Chair-I分,并能在四种模型系列及不同规模间泛化。代码与模型已开源至https://mbzuai-oryx.github.io/VISE。
DnA:面向视觉任务的去噪注意力机制 Ron Campos 2026-06-25 PDF 多头注意力(MHA)中的softmax激活函数是视觉感知任务中基于注意力模型的事实标准。然而,标准softmax可能产生噪声注意力模式,这会稀释相关特征并降低模型性能。本文提出去噪注意力(Denoising Attention,简称DnA),其核心机制为:首先通过正向查询识别属于正确类别的图像特征,同时通过负向查询识别紧密关联但无关的图像特征。随后DnA将这些交互投影到具有更大主角度的两个独立子空间中,促进子空间分离并提升判别能力。基于ViT-B骨干网络,我们提出的DnA在ImageNet-1K上相比基线实现了0.8%的绝对增益。我们进一步展示了该方法在多个视觉理解任务中的改进效果,包括视频理解中的视频Transformer(提升1.8%)和视频大语言模型(提升0.5%)。大量实证分析验证了涉及两个交互子空间的设计选择以及DnA的去噪效果。
不要满足于模式!通过特征自引导缓解预训练流模型中的多样性崩溃 Pradhaan S Bhat 2026-06-25 PDF 最先进的流模型能够根据文本或图像提示生成令人惊叹的图像。然而,在相同条件下生成多个样本时,这些模型会出现多样性崩溃的问题。现有方法要么通过潜在引导(效果有限)来解决,要么依赖样本选择(需要外部奖励模型,导致推理时间开销显著增加)。在本研究中,我们提出了一种高效、无需训练的自我引导机制,无需额外奖励模型即可缓解多样性崩溃。具体而言,我们在批量生成过程中通过特征自我引导分散流模型的内部特征。此外,为使特征保持在流形附近,我们引入了一个流形正则化步骤,将这些分散的特征投影回数据流形,从而在保持与输入条件对齐的同时实现多样化生成。我们的方法可作为即插即用模块无缝集成到预训练流模型中,仅增加极小的推理成本。实验表明,该方法在多种条件流模型(包括多步和少步文本到图像、深度到图像以及参考图像生成)中显著提升了多样性,同时保持了生成保真度。
无需真实答案的强化学习可提升大语言模型性能 Yingyu Lin 2026-06-25 PDF 基于可验证奖励的强化学习(RLVR)在训练大语言模型时通常依赖真实答案来分配奖励,这限制了其在真实解未知任务中的适用性。我们提出了一种基于排序的可验证框架(RiVER),该框架无需真实解即可在基于分数的优化任务上训练大语言模型,通过确定性执行反馈作为连续值监督信号。将群体相对强化学习应用于此类连续奖励时,我们识别出两个关键挑战:一是"规模主导性",即未校准的测试实例分数幅度会扭曲策略更新;二是"频率主导性",即反复采样的次优解可能压倒罕见但更优的候选解。RiVER通过校准奖励塑造方法解决这些问题:采用实例级比较并强调排名靠前的求解器,同时为其他有效解保留有界反馈。我们在12个AtCoder启发式竞赛任务上训练,并在算法工程基准(ALE-Bench)、LiveCodeBench和USACO上评估。RiVER使Qwen3-8B和GLM-Z1-9B-0414在ALE评级排名中分别提升8.9%和9.4%。更重要的是,尽管仅在基于分数的任务上训练且完全无需真实解,RiVER在LiveCodeBench和USACO等精确解基准上仍使基础模型平均绝对提升2.4%和3.5%。相比之下,使用原始执行分数训练的基线虽能提升ALE评级,但无法迁移至精确解基准。这些结果表明,结合适当奖励校准的基于分数优化任务,可作为无需真实解的有效通用编码能力训练环境。
PhysiFormer:学习在世界空间中模拟力学 Yiming Chen 2026-06-25 PDF 我们提出PhysiFormer,一种用于生成物理合理三维物体运动的扩散Transformer。与在视角依赖的像素空间中运行的视频世界模型不同,PhysiFormer将物体表示为世界坐标系中的三维网格。给定初始顶点位置和速度,以及物体材质类型(刚性或弹性),该模型可采样未来的顶点轨迹。尽管相关的神经物理方法依赖于特设的潜在空间或显式施加刚性和因果性约束,PhysiFormer表明,通过将顶点轨迹预测直接转化为世界坐标系中的单一去噪扩散过程,无需任何此类归纳偏置即可获得优异结果。其概率公式能够捕捉学习动力学中的不确定性,从而从初始条件生成多样化的合理未来状态,使该框架在存在未观测不确定性的应用中具有潜在价值。模型采用时间、空间和物体维度分解的注意力机制以提高效率,无需显式物体编码即可实现置换不变的多物体推理。经过超过10万条模拟轨迹的训练,PhysiFormer能够生成刚性和弹性力学行为,并泛化至混合材质场景、未见过的真实世界几何形状以及更多物体数量的情况。在轨迹精度、刚性保持和基于动量的物理一致性方面,它显著优于自回归基线方法。我们的结果表明,坐标空间扩散是迈向机器人学、图形学和物理设计中视角不变、几何感知世界建模的有前景的一步。可视化结果、代码和模型可在https://yimingc9.github.io/physiformer获取。
自回归玻尔兹曼生成器 Danyal Rehman 2026-06-25 PDF 在热力学平衡状态下对分子系统进行高效采样是统计物理学中的一个标志性挑战。这一挑战推动了玻尔兹曼生成器(BGs)的发展,它通过结合具有精确似然性的生成模型和重要性采样校正,能够快速生成无关联的平衡样本。然而,现代BGs主要依赖归一化流(NFs),这些方法要么因严格的可逆性约束(离散时间)而表现力有限,要么因计算成本高昂的似然性(连续时间)而受限。在本文中,我们提出了自回归玻尔兹曼生成器(ArBG)——一种新颖的自回归建模框架——通过脱离基于流的BG范式来克服这些限制。ArBG规避了流的拓扑约束,支持顺序推理时的干预,同时通过利用在大型语言模型中有效的架构增强了可扩展性。我们通过实验证明,ArBG在所有基准测试中均显著优于基于流的模型,尤其是在较大的肽系统(如10残基的Chignolin)中表现突出。此外,我们推出了Robin——一个使用ArBG框架训练的1.32亿参数可迁移模型,该模型在8残基系统上将零样本能量误差E-W$_2$降低了超过60%,超越了先前的最优水平。代码可在以下链接获取:https://github.com/danyalrehman/autobg。
大语言模型中,何时可能的答案是正确的?关于序列概率与正确性的探讨 Johannes Zenn 2026-06-25 PDF 许多针对大型语言模型的解码方法,可以理解为将概率质量向模型更可能输出的结果转移——这种转移既可在词元级别局部进行,也可在序列级别全局进行。因此,这些方法的有效性取决于一个根本性问题:序列概率(即给定提示后生成内容的条件概率)何时能真正与正确性对齐?本文旨在从四个维度系统量化这种关系:不同解码方法之间、同一方法的不同超参数之间、数据集中不同提示-答案对之间,以及针对同一提示的多次响应之间。研究发现,在固定数据集的提示-答案对中,较高的序列概率往往能预测正确性。但这种关系通常无法推广至解码决策:通过调整超参数或改变解码方法来提升序列概率,并不能稳定提高准确率。此外,针对同一提示的不同响应,序列概率并非正确性的可靠指标。这些发现厘清了在何种情况下解码方法能够或不能提升正确性,并为解码策略、自一致性方法及无验证器自我改进提供了实践指导。