跳转至

arXiv 2026-07-18

标题 作者 发布日期 PDF链接 摘要
多步视觉推理的分层去噪 Zezhong Qian 2026-07-16 PDF 视频模型正逐步演变为视觉基础模型,但仍缺乏类人多步推理能力。流式自回归扩散模型虽高效但推理能力有限,而双向扩散虽能实现全局修正,却因密集帧级去噪导致推理成本高昂。这两种范式在复杂推理任务中均难以兼顾逻辑一致性与低延迟流式输出。我们提出HDR(层次化视觉推理去噪框架),通过将层次化隐变量融入因果视频生成实现多步推理。HDR将视频隐变量组织为树状层次结构,在流式输出前完成从粗到细的推理:粗去噪层保留不确定假设用于全局规划,细粒度层逐步将其精炼为具体视觉状态。稀疏层次注意力模式(SHAP)进一步降低了时序注意力成本。我们构建了包含分布外案例的分层多步视频推理基准,涵盖迷宫导航、汉诺塔、一笔画、滑块拼图、推箱子、倒水六类任务。与流式自回归扩散基线相比,HDR将成功率从34.22提升至60.29(相对提升76.2%),平均进度从76.00提升至89.56,展现出更一致的推理轨迹。HDR保持每隐变量0.70秒的低延迟流式输出,推理速度较双向扩散提升54.2倍。在仅使用2%训练数据时,HDR仍能保留82.9%的全数据性能(双向扩散为52.0%)。真实机器人实验进一步验证了HDR在物理交互与世界建模中的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。
分区、提示、聚合:语言模型中的统计自洽性 Patrik Wolf 2026-07-16 PDF 上下文学习通常被解释为一种条件推断形式,其中提示指定了上下文,模型的输出被视为对应条件分布的估计。如果这一解释成立,那么大语言模型的估计应满足基本的概率恒等式。特别地,全概率公式指出,先验加权的条件分布在总体任意有效划分上会聚合为总体层面的边缘分布。本研究探讨了大语言模型估计在多大程度上遵循这一自洽性原则。我们采用二叉树作为评估框架,递归地将总体划分为粒度逐渐精细的子群体。随后,通过提示大语言模型在上下文中以语言描述子群体特征,将所得估计重新聚合为总体层面估计,并比较不同粒度划分下的结果。将该方法应用于多个问题领域和前沿模型后,我们发现了基本一致性属性的广泛违背现象。对角色提示的深入研究表明存在一种我们称之为宏观谬误的模式:从更精细子群体响应重建的估计往往比直接总体层面估计更符合人类参考数据。这一效应在树结构变化和估计任务中持续存在,并可通过隐式提示部分恢复。这些发现共同表明,模型具备相关子群体知识,但未能可靠地将其传播到聚合估计中。这一差距将统计自洽性确立为评估大语言模型的一个未饱和、无参考标准的新准则。
RoboTTT:机器人策略的上下文扩展 Yunfan Jiang 2026-07-16 PDF 最近的机器人基础模型通常基于单步或短历史视觉运动上下文运行。我们提出测试时训练机器人策略(RoboTTT),这是一种机器人模型与训练方案,可将视觉运动上下文扩展至8000个时间步,比现有最优策略高出三个数量级,且推理延迟不增加。在此上下文长度下,我们解锁了新的机器人能力:通过人类视频演示实现一次性上下文模仿学习、实时策略改进、对扰动的鲁棒性,以及在多阶段长周期任务中更强的表现。我们还首次观察到,随着预训练上下文长度增加,闭环性能持续提升。RoboTTT的核心是将测试时训练集成到视觉-语言-动作策略等机器人基础模型中,形成一种序列模型,其循环状态由快速权重构成——这些参数在训练和推理过程中通过梯度下降更新,将历史信息压缩至权重空间,并检索上下文信息以实现长上下文条件化。为扩展训练上下文长度,该方案将序列动作强制与时间截断反向传播相结合。在具有挑战性的真实机器人操作任务中,RoboTTT相比单步上下文基线整体性能提升87%,并完整完成一项五分钟、十阶段的组装任务(所有基线均无法实现)。使用8000时间步上下文训练的RoboTTT,其表现比同模型使用1000时间步预训练时提升62%,表明上下文长度可作为机器人基础模型的新扩展维度。视频见https://research.nvidia.com/labs/gear/robottt/
MeanFlowNFT:将前向过程强化学习引入平均速度生成器 Yushi Huang 2026-07-16 PDF MeanFlow生成器通过预测时间区间内的平均速度实现快速少步采样,使其在高效生成领域具有吸引力。强化学习已成为将扩散模型和流模型与人类偏好及任务特定目标对齐的有力方法。其中,DiffusionNFT提供了一种高效的前向过程强化学习框架,无需反向过程轨迹或似然估计。然而,将此类强化学习方法应用于MeanFlow仍待探索。DiffusionNFT优化瞬时速度,而MeanFlow使用平均速度进行采样。为弥合这一差距,我们提出MeanFlowNFT。受连接平均速度与瞬时速度的MeanFlow恒等式启发,我们构建了诱导瞬时速度预测器。将DiffusionNFT目标应用于该预测器,使奖励优化在MeanFlow中具有明确定义。采样仍基于平均速度,保留了MeanFlow的快速少步生成特性。我们进一步证明MeanFlowNFT继承了DiffusionNFT的严格策略改进保证。在图像和视频生成上的实验表明,MeanFlowNFT持续改进基线模型。此外,它在大多数指标上(SD3.5-M上8项中的6项)优于先前最先进的强化学习调优少步生成器,且仅需少量采样步数即可超越多步强化学习调优扩散模型。例如,在Wan 2.1上,4步MeanFlowNFT达到84.33的VBench分数,超越50步LongCat-Video强化学习(82.57)。
SciDiagramEdit:从论文修订中学习编辑科学图表 Yasheng Sun 2026-07-16 PDF 在科研论文中编辑图表是日常研究工作中常规且耗时的环节:作者在修改稿件时,需要重新标注组件、调整面板布局、更新视觉风格。然而,通过自然语言指令自动化这一编辑流程颇具挑战性,因为科学图表是一种密集的信息图,其中示意图、数据图、照片、图注和箭头等异质视觉元素需遵循严格的视觉语法组合,以支撑特定论点。为此,我们提出SciDiagramEdit——一个从自然论文修订中学习、并基于图表可编辑矢量源操作的基准与技能进化框架,用户可在此框架中与智能体共同检查并协同编辑单个图形元素。我们的基准从arXiv版本历史中挖掘修订前后图表对,每对均对应作者自身的修订意图。为适应编辑指令的多样性,我们采用技能进化的智能体学习方式:智能体提议器通过多轮执行轨迹持续优化智能体的技能规范。由此产生的技能在保留验证集上逐步提升编辑准确率,证明自然论文修订可作为指令驱动图表编辑的有效训练信号。
在线神经时空记忆用于动态新视角合成 Baback Elmieh 2026-07-16 PDF 在线多视角流视频的新视角合成面临一个基本权衡:在严格实时约束下,既要维持持久的长时记忆以重建暂时遮挡区域,又要保证实时运行。虽然测试时训练(TTT)提供了强大的记忆机制,但标准模型要求每帧进行梯度更新的记忆操作以适应动态场景中的运动变化。频繁的记忆更新带来的计算开销阻碍了实时应用,且在长序列中可能导致不稳定。鉴于记忆更新的计算需求远高于记忆应用,且视频内容存在大量冗余,我们提出将这两个过程的频率解耦。本方法采用周期性记忆更新策略,同时逐帧应用记忆,通过跨视角注意力机制处理先前记忆状态与当前帧之间的形变。为锁定历史上下文,我们引入两个关键机制:辅助记忆损失强制模型持续内化场景信息,以及记忆缓存策略通过正则化活动权重防止灾难性漂移。实验表明,本方法在动态人体运动场景及分钟级在线记忆任务中均实现了实时且最先进的性能。
基于运动条件的多视角融合用于超声心动图心肌梗死定位 Guang Yang 2026-07-16 PDF 心肌梗死仍是全球主要死亡原因之一。超声心动图是评估心肌梗死的常用手段,其中局部室壁运动异常是关键指标。现有基于学习的心肌运动分析方法多采用手工特征或密集监督估计,但大量标注需求限制了其应用。基础模型近期改善了基于视觉的超声分析,然而多数方法仅处理单视图,且节段级定位在视图依赖的模糊性下仍不可靠,尤其在心尖切面。为此,我们提出MCF-Net,一种新颖的运动引导多视图融合框架,将心肌运动线索与基础模型表征相结合以定位梗死区域。视觉特征通过EchoPrime提取,该预训练超声基础模型可跨双视图共享。心脏运动采用极稀疏监督建模:单张标注模板帧跨视频传递以初始化点追踪,避免密集标注。运动导出的节段感知软掩码提供粗粒度空间先验,选择性增强困难心肌节段的特征。运动条件融合机制随后跨视图整合运动与视觉信息,在不覆盖强外观线索的前提下优化预测。在节段级心肌梗死定位任务中,MCF-Net达到72.4%的F1分数和84.9%的准确率,优于现有最优的运动仅、视觉仅及融合基线方法。
预训练数据可能通过计算宣传被投毒。 Victoria Graf 2026-07-16 PDF 对预训练数据进行投毒,可能使语言模型产生难以检测和消除的有害行为。此前针对预训练数据的投毒研究主要利用维基百科等成熟数据源,这类数据源无法体现预训练语料库典型的大规模与异质性特征,且忽视了投毒数据与数据筛选流程之间的相互作用。我们通过现有网络规模内容注入机制——公共讨论接口——证明投毒攻击在预训练数据上的可行性已超越此前的有限场景。此外,为衡量恶意内容在网络爬取及数据筛选后是否仍被保留,我们提出HalfLife这一新型分析方法,用于评估基于网络爬取的语言模型训练数据中对抗性内容的纳入情况。借助HalfLife,我们探索了通过开放讨论接口在网络规模下对预训练语料库实施投毒的可行性。本分析揭示了评估投毒内容是否被纳入预训练数据的重要性,并证实第三方网页内容可作为攻击语言模型预训练的潜在载体。
SceneBind:跨视觉、音频与语言绑定“什么”与“哪里” Mingfei Chen 2026-07-16 PDF 我们提出SceneBind,一种融合视觉、音频与语言的联合语义与3D空间理解的实景全模态表征。现有全模态编码器擅长实例级语义(即存在什么),但往往缺乏显式空间结构(即位于何处)。SceneBind通过将每个场景表示为语义-空间实体来弥补这一不足,结合全局语义嵌入与以物体为中心的语义-空间槽位。该表征显式捕捉物体级语义、空间属性及不确定性。我们进一步提出SceneBind匹配——一种融合全局场景相似性与物体对齐的语义-空间匹配方案,支持跨模态场景检索与物体定位。为训练与评估SceneBind,我们构建了包含结构化语义与空间标注的新型真实世界双耳视听数据集,并提出跨模态对齐语义与空间信号的训练协议。SceneBind兼容大规模预训练语义编码器,仅需少量额外标记即可实现轻量级空间建模。它在场景与空间检索任务中达到最优水平,同时支持向音视频定位等下游任务的强零样本迁移。
超越成功率:攻击与防御安全代理的成本感知评估 Paul Kassianik 2026-07-16 PDF 安全代理评估通常在高推理预算下衡量峰值攻击能力,重点关注漏洞发现、漏洞利用开发、渗透测试及CTF挑战完成。这类评估虽有用但不全面:在实际安全运营中,每个推理步骤、工具调用、遥测查询和情报补充请求都会消耗预算。我们通过成本-成功双维度视角,在攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战中评估语言模型安全代理。不同于仅报告最佳成功率,我们对比固定成本水平下的模型表现,并按推理开销与工具开销分解性能。结果显示红蓝队任务存在截然不同的扩展规律:攻击性CTF性能随测试时计算量增加而提升,开源权重模型在保持成本竞争力时可接近前沿专有系统;防御性SOC调查则呈现不同扩展模式——其成功更依赖规范的工具使用、遥测导航与选择性情报补充,而非单纯依赖推理预算。我们认为安全代理基准应同时衡量经济效率、运营适配性与任务成功率。成本感知的SOC原生评估能更清晰揭示哪些模型当前具有实用价值,以及防御代理仍需改进的方向。我们已搭建交互式网站展示研究成果:https://evals.frontier.security