跳转至

arXiv 2026-06-26

标题 作者 发布日期 PDF链接 摘要
DanceOPD:基于策略的生成场蒸馏 Wei Zhou 2026-06-25 PDF 现代图像生成需要一个能够统一多种能力的单一模型,包括文生图、局部编辑和全局编辑。然而,这些能力很少能自然对齐,且常常相互冲突。例如,编辑往往会降低文生图性能,而全局编辑与局部编辑会相互干扰。因此,如何有效整合这些能力已成为图像生成模型训练的核心挑战。为此,我们提出DanceOPD——一种面向流匹配模型的在线策略生成场蒸馏框架。该框架将每个样本路由至单一能力场,查询一个低噪声的学生驱动状态,并通过简单的速度均方误差目标进行训练。当每个能力源被定义为共享流状态空间上的速度场时,学生模型通过在其自身展开状态上查询场来学习组合专家能力。该框架还能吸收如无分类器引导等算子定义场。在文生图、编辑、真实感场吸收和CFG吸收上的综合实验表明,我们的方法提升了多能力组合效果,在保持锚点生成质量的同时强化了目标能力。我们相信这项工作为流匹配模型中的生成场蒸馏建立了一条实用路径。
提问、求解、生成:基于自一致性奖励的自演进统一多模态理解与生成 Ritesh Thawkar 2026-06-25 PDF 大多数统一的大规模多模态模型(LMM)虽同时支持视觉理解与图像生成,仍依赖人工标注、偏好标签或外部奖励模型等后期监督。我们探究统一LMM能否仅利用无标注图像自主提升这两类能力。提出一种自演进训练框架,包含三个内部角色:生成视觉问题的提议者、解答并评估问题的求解者、以及合成图像的生成者。训练仅使用自洽性信号,无需人工标注、偏好标签或任务训练的外部奖励/评判模型。为稳定学习,引入求解者令牌熵(STE)——基于令牌级预测不确定性的连续难度信号,在样本级自洽性失效时仍具效用。针对图像生成,设计多尺度内部评估方案,融合问答忠实度评分与循环一致性描述。由此建立求解者介导的耦合机制:更优的视觉理解能力可提升生成评估可靠性,并增强内部训练信号。该框架在扩散模型BLIP3o、整流流模型BAGEL及自回归模型VARGPT-v1.1架构中保持相同的角色分解、奖励逻辑与训练流程,仅需各基础模型的原生提示与生成接口。在八项理解指标上,本方法持续超越对应基础模型。在BAGEL上,MMMU指标绝对提升3.5%,GenEval图像生成性能从82%提升至85%。代码与模型已公开。
世界行动模型通过循环生成回放实现持续模仿学习 Manish Kumar Govind 2026-06-25 PDF 超越预测机器人动作,世界动作模型(WAMs)还能生成未来的视觉观测。基于这一生成能力,我们提出循环生成回放(REGEN)——一种持续模仿学习框架,通过合成伪回放轨迹,使机器人策略无需存储原始人类示范即可演练先前学过的任务。在持续适应过程中,REGEN递归调用WAM,仅依据先前任务指令和当前任务观测来合成伪回放轨迹。仿真与真实环境操作实验表明,相比顺序微调,REGEN将灾难性遗忘降低高达50%,同时性能接近需要访问真实回放数据的特权经验回放方法。最后,我们分析了限制生成回放的因素,指出长时程视觉退化与动作-观测不一致性为主要瓶颈。研究结果确立了WAMs作为无需存储示范的持续机器人学习的有前景基础。
在自进化大型多模态模型中更关注视觉标记 Shravan Venkatraman 2026-06-25 PDF 近期,自进化大型多模态模型(LMMs)因能在纯无监督环境下提升视觉推理能力而受到关注。然而,现有自进化LMMs中的多角色自博弈与自一致性奖励机制仅优化答案一致性,未能确保解码器关注视觉内容,而是依赖统计语言先验生成自一致输出。这导致一种我们称为"视觉欠条件化"的持续性失效模式——解码器在生成过程中依赖语言先验而非图像,表现为对视觉标记的注意力不足。因此,当前自进化LMMs在图像描述、视觉问答等视觉-语言理解任务中表现欠佳。为解决该问题,我们提出VISE(视觉不变性自进化),一种纯无监督自进化框架,通过两种互补的不变性奖励直接约束模型的视觉条件化策略:几何不变性奖励强制模型在已知变换下保持空间一致性,语义不变性奖励通过要求模型在预测区域被扰动时识别证据缺失来惩罚无证据生成。VISE在单一模型内运行,无需专家角色、外部奖励模型或标注,仅使用原始无标签图像训练。在18个基准上的实验证明了该方法的有效性。以Qwen3-VL-2B为基础模型,VISE在COCO上提升+16.85 CIDEr,在TextCaps上提升+19.66 CIDEr,将物体幻觉降低5.0 Chair-I分,并泛化至四个模型系列及不同规模。代码与模型已开源:https://mbzuai-oryx.github.io/VISE
DnA:面向视觉任务的去噪注意力机制 Ron Campos 2026-06-25 PDF 多头注意力机制中的softmax激活函数是视觉感知任务中基于注意力模型的事实标准。然而,标准softmax可能产生噪声注意力模式,这会稀释相关特征并降低模型性能。本文提出去噪注意力机制(Denoising Attention, DnA),其核心在于:首先,正向查询识别属于正确类别的图像特征,负向查询则识别紧密关联但无关的图像特征。随后,DnA将这些交互投影到主角度更大的两个不同子空间,促进子空间分离并提升判别能力。基于ViT-B骨干网络,我们提出的DnA在ImageNet-1K上相比基线实现了0.8%的绝对增益。我们进一步展示了在多个视觉理解任务上的改进,包括视频理解中的视频Transformer(1.8%)和视频大语言模型(0.5%)。广泛的实证分析验证了涉及两个交互子空间的设计选择以及DnA的去噪效果。
不要止步于模式!通过特征自引导缓解预训练流模型中的多样性崩溃 Pradhaan S Bhat 2026-06-25 PDF 最先进的流模型能够根据文本或图像提示生成令人惊叹的图像。然而,在相同条件下生成多个样本时,这些模型会出现多样性崩溃的问题。现有方法要么通过潜在引导(效果有限)来解决,要么依赖样本选择,这需要外部奖励模型,从而带来显著的推理时间开销。在这项工作中,我们引入了一种高效、无需训练的自我引导机制,以缓解多样性崩溃,且无需额外的奖励模型。具体来说,我们在批量生成过程中通过特征自我引导分散流模型的内部特征。此外,为了保持特征接近数据流形,我们引入了一个流形正则化步骤,将这些分散的特征投影回数据流形,从而在确保与输入条件对齐的同时实现多样化生成。我们的方法可以无缝集成到预训练的流模型中,作为一个即插即用模块,仅增加微小的推理成本。实验表明,在多种条件流模型(包括多步和少步文本到图像、深度到图像以及参考图像生成)中,该方法在保持保真度的同时显著提升了多样性。
无需真实解法的强化学习可提升大语言模型性能 Yingyu Lin 2026-06-25 PDF 基于可验证奖励的强化学习(RLVR)在训练大语言模型时通常依赖真实答案来分配奖励,这限制了其在真实解未知任务中的应用。我们提出了一种基于排序的可验证框架(RiVER),该框架无需真实解即可在基于分数的优化任务上训练大语言模型,通过确定性执行反馈作为连续值监督信号。将群体相对强化学习应用于此类连续奖励时,我们识别出两个关键挑战:一是"规模主导",即跨测试实例未校准的分数幅度会扭曲策略更新;二是"频率主导",即重复采样的次优解可能压倒罕见但更优的候选解。RiVER通过校准奖励整形解决这些问题,采用实例级比较并优先考虑排名靠前的求解器,同时为其他有效解保留有界反馈。我们在12个AtCoder启发式竞赛任务上训练,并在算法工程基准(ALE-Bench)、LiveCodeBench和USACO上评估。RiVER使Qwen3-8B和GLM-Z1-9B-0414在ALE评级排名中分别提升8.9%和9.4%。更重要的是,尽管仅在基于分数的任务上训练且无任何真实解,RiVER在精确解基准(如LiveCodeBench和USACO)上也使基础模型平均绝对提升2.4%和3.5%。相比之下,使用原始执行分数训练的基线虽能提升ALE评级,但无法迁移至精确解基准。这些结果表明,结合适当奖励校准的基于分数的优化任务,可作为无需真实解的有效通用编码能力训练环境。
PhysiFormer:学习在世界空间中模拟力学 Yiming Chen 2026-06-25 PDF 我们提出PhysiFormer,一种用于物理合理三维物体运动的扩散Transformer。与在视角依赖的像素空间中运行的视频世界模型不同,PhysiFormer将物体表示为世界坐标系中的三维网格。给定初始顶点位置和速度,以及物体材质类型(刚性或弹性),该模型采样未来的顶点轨迹。虽然相关神经物理方法基于特定设计的潜在空间或显式强制刚性和因果性,但PhysiFormer表明,通过将顶点轨迹预测直接视为世界坐标系中的单一去噪扩散过程,无需任何此类归纳偏置即可获得优异结果。概率公式化捕获了学习动力学中的不确定性,使得从初始条件出发能够生成多样化的合理未来,这使该框架在存在未观测不确定性的应用中具有潜在价值。该模型采用按时间、空间和物体分解的注意力机制以提高效率,无需显式物体编码即可实现置换不变的多物体推理。经过超过10万条模拟轨迹的训练,PhysiFormer能够生成刚性和弹性力学,并泛化到混合材质场景、未见过的真实世界几何形状以及更多物体数量。它在轨迹精度、刚性保持和基于动量的物理一致性方面显著优于自回归基线。我们的结果表明,坐标空间扩散是迈向机器人学、图形学和物理设计中视角不变、几何感知世界建模的有前景的一步。可视化、代码和模型可在https://yimingc9.github.io/physiformer获取。
自回归玻尔兹曼生成器 Danyal Rehman 2026-06-25 PDF 在统计物理中,对热力学平衡态分子系统进行高效采样是一项标志性挑战。这一挑战推动了玻尔兹曼生成器(BGs)的发展,它通过结合具有精确似然性的生成模型与重要性采样校正,能够快速生成无关联的平衡样本。然而,现代BGs主要依赖归一化流(NFs),这类方法要么因严格的可逆性约束(离散时间)导致表达能力受限,要么因计算代价高昂的似然性(连续时间)而受限。本文提出自回归玻尔兹曼生成器(ArBG)——一种新颖的自回归建模框架——通过突破基于流的BG范式克服了这些局限。ArBG规避了流的拓扑约束,支持推理时的顺序干预,同时通过利用大型语言模型中有效的架构增强了可扩展性。我们通过实验证明,ArBG在所有基准测试中均显著优于基于流的模型,尤其在较大的肽系统(如10残基的Chignolin)中表现突出。此外,我们推出了Robin——一个基于ArBG框架训练的1.32亿参数可迁移模型,该模型将8残基系统的零样本能量误差E-W$_2$降低了超过60%,超越了此前的最优水平。代码可在以下链接获取:https://github.com/danyalrehman/autobg。
大语言模型中,何时可能的答案是正确的?关于序列概率与正确性的探讨 Johannes Zenn 2026-06-25 PDF 许多大型语言模型的解码方法可理解为将概率质量向模型更倾向的输出转移,这种转移既可在词元级别局部进行,也可在序列级别全局进行。因此其有效性取决于一个根本问题:序列概率(即给定提示后延续内容的条件概率)何时真正与正确性对齐?本文从四个层面系统量化了这种关系:跨解码方法、方法内超参数、数据集内提示-答案对、以及同一提示的重复响应。我们发现,在固定数据集内,较高的序列概率通常能预测提示-答案对的正确性。但这种关系通常无法迁移至解码决策:通过调整超参数或方法提升序列概率并不能可靠地提高准确率。此外,对于同一提示的不同响应,序列概率并非正确性的良好指标。这些发现厘清了解码在何种情况下能/不能预期提升正确性,并为解码策略、自一致性及无验证器自我改进提供了实践指导。