跳转至

arXiv 2026-07-19

标题 作者 发布日期 PDF链接 摘要
多步视觉推理的分层去噪 Zezhong Qian 2026-07-16 PDF 视频模型正逐步演变为视觉基础模型,但仍缺乏类人多步推理能力。流式自回归扩散模型虽高效但推理能力有限,而双向扩散虽能实现全局修正,却因密集帧级去噪导致推理成本高昂。这两种范式在复杂推理任务中均难以兼顾逻辑一致性与低延迟流式处理。我们提出HDR(层次化视觉推理去噪框架),通过将层次化隐变量融入因果视频生成实现多步推理。HDR将视频隐变量组织为树状层次结构,在流式输出前实现从粗到细的推理:粗去噪层保留不确定假设用于全局规划,细粒度层逐步将其精炼为具体视觉状态。稀疏层次注意力模式(SHAP)进一步降低了时序注意力成本。我们构建了包含分布外案例的分层多步视频推理基准,涵盖迷宫导航、汉诺塔、一笔画、滑块拼图、推箱子、倒水六类任务。与流式自回归扩散基线相比,HDR将成功率从34.22提升至60.29(相对提升76.2%),平均进度从76.00提升至89.56,展现出更一致的推理轨迹。HDR保持每隐变量0.70秒的低延迟流式处理,推理速度较双向扩散提升54.2倍。在仅使用2%训练数据时仍能保留全数据性能的82.9%,而双向扩散仅保留52.0%。真实机器人实验进一步验证了HDR在物理交互与世界建模中的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/。
分区、提示、聚合:语言模型中的统计自洽性 Patrik Wolf 2026-07-16 PDF 上下文学习通常被解释为一种条件推断形式,其中提示指定了上下文,模型的输出被视为相应条件分布的估计。如果这种解释成立,那么大语言模型的估计应满足基本的概率恒等式。特别地,全概率公式断言,先验加权的条件分布在总体上的任何有效划分下会聚合为总体层面的边际分布。在本研究中,我们探究大语言模型的估计在多大程度上遵循这一自洽性原则。我们使用二叉树作为评估框架,递归地将总体划分为粒度逐渐精细的子群体。随后,我们通过上下文向大语言模型提供用语言描述的子群体信息,将得到的估计结果重新聚合为总体层面的估计,并比较不同粒度划分下的结果。通过跨问题领域和最先进前沿模型应用这一协议,我们发现了基本一致性属性的广泛违反。对角色提示的深入研究揭示了一种我们称之为宏观谬误的模式:从更精细的子群体响应中重建的估计往往比直接得到的总体层面估计更符合人类参考数据。这种效应在树结构和估计任务的变化中持续存在,并可通过隐式提示部分恢复。这些发现共同表明,模型拥有相关的子群体知识,但未能可靠地将其传播到聚合估计中。这一差距将统计自洽性确立为评估大语言模型的一个未饱和、无参考的标准。
RoboTTT:机器人策略的上下文扩展 Yunfan Jiang 2026-07-16 PDF 最近的机器人基础模型通常基于单步或短历史视觉运动上下文运行。我们提出测试时训练机器人策略(RoboTTT),这是一种机器人模型与训练方案,能将视觉运动上下文扩展至8000时间步,比现有最优策略高出三个数量级,且推理延迟不增加。在此上下文长度下,我们解锁了新的机器人能力:通过人类视频演示实现一次性上下文模仿学习、实时策略改进、对扰动的鲁棒性,以及在多阶段长周期任务中更强的表现。我们还首次观察到,随着预训练上下文长度增加,闭环性能持续提升。RoboTTT的核心是将测试时训练整合到视觉-语言-动作策略等机器人基础模型中,形成一种序列模型,其循环状态由快速权重构成——这些参数在训练和推理过程中通过梯度下降更新,将历史信息压缩至权重空间,并为长上下文条件检索上下文信息。为扩展训练上下文长度,该方案将序列动作强制与截断时间反向传播相结合。在具有挑战性的真实机器人操作任务中,RoboTTT相比单步上下文基线整体性能提升87%,并完整完成一项耗时五分钟、包含十个阶段的组装任务(所有基线均无法完成)。使用8000时间步上下文训练的RoboTTT,其表现比使用1000时间步预训练的同一模型高出62%,这表明上下文长度可作为机器人基础模型的新扩展维度。视频详见 https://research.nvidia.com/labs/gear/robottt/
MeanFlowNFT:将前向过程强化学习引入平均速度生成器 Yushi Huang 2026-07-16 PDF MeanFlow生成器通过预测时间区间内的平均速度实现快速少步采样,使其在高效生成领域具有吸引力。强化学习已成为将扩散模型和流模型与人类偏好及任务特定目标对齐的有力方法。其中,DiffusionNFT提供了一种高效的前向过程强化学习框架,无需反向过程轨迹或似然估计。然而,将此类强化学习方法应用于MeanFlow仍待探索。DiffusionNFT优化瞬时速度,而MeanFlow使用平均速度进行采样。为弥合这一差距,我们提出MeanFlowNFT。受连接平均速度与瞬时速度的MeanFlow恒等式启发,我们构建了一个诱导的瞬时速度预测器。将DiffusionNFT目标应用于该预测器,使得MeanFlow的奖励优化具有明确定义。采样仍基于平均速度,保留了MeanFlow的快速少步生成特性。我们进一步证明MeanFlowNFT继承了DiffusionNFT的严格策略改进保证。在图像和视频生成上的实验表明,MeanFlowNFT持续改进基线模型。此外,它在大多数指标上(SD3.5-M上8项中的6项)优于先前最先进的强化学习调优少步生成器,且仅需少量采样步数即可超越多步强化学习调优的扩散模型。例如,在Wan 2.1上,4步MeanFlowNFT达到84.33的VBench分数,超越了50步LongCat-Video RL的82.57。
SciDiagramEdit:从论文修订中学习编辑科学图表 Yasheng Sun 2026-07-16 PDF 在科研论文中编辑图表是日常研究工作中常规且耗时的环节:作者在修改稿件时需重新标注组件、调整面板布局、更新视觉风格。然而,通过自然语言指令自动化这一编辑流程颇具挑战性,因为科学图表是信息密集的图形化表达,其中示意图、数据图、照片、图注和箭头等异构视觉元素需遵循严谨的视觉语法组合,以支撑特定论点。为此,我们提出SciDiagramEdit——一个从自然论文修订中学习、并基于图表可编辑矢量源运行的基准测试与技能进化框架,用户可在此框架中与智能体协同检查并编辑单个图元。我们的基准测试从arXiv版本历史中提取修改前后的图表对,每对均对应作者自身的修订意图。为适应编辑指令的多样性,我们采用技能进化的智能体学习方式:智能体提议器通过多轮执行轨迹持续优化智能体的技能规范。最终形成的技能在保留验证集上逐步提升编辑准确率,证明自然论文修订可作为指令驱动图表编辑的有效训练信号。
在线神经时空记忆用于动态新视角合成 Baback Elmieh 2026-07-16 PDF 在线多视角视频流的新视角合成面临一个根本性权衡:在严格实时约束下,既要维持持久的长时记忆以重建暂时遮挡区域,又要保证操作效率。虽然测试时训练(TTT)提供了强大的记忆机制,但标准模型要求每帧进行基于梯度的记忆更新以适应动态场景中的运动变化。高频记忆更新的计算成本阻碍了实时应用,且可能导致长序列中的不稳定性。鉴于记忆更新的计算需求远高于记忆应用,且视频内容存在大量冗余,我们提出将这两个过程的频率解耦。本方法采用周期性记忆更新策略,同时以逐帧方式应用记忆,通过跨视角注意力机制处理先前记忆状态与当前帧之间的形变。为锁定历史上下文,我们引入两个关键机制:辅助记忆损失强制场景信息的持久内化,以及记忆缓存策略通过正则化活动权重防止灾难性漂移。实验表明,本方法在动态人体运动场景及分钟级在线记忆任务中均实现了实时且最先进的性能。
基于运动条件的多视角融合用于超声心动图心肌梗死定位 Guang Yang 2026-07-16 PDF 心肌梗死仍是全球主要死因之一。超声心动图作为广泛可用的评估手段,其关键指标为局部室壁运动异常。既往基于学习的心肌运动分析方法常采用手工特征或密集监督估计,但大量标注需求限制了应用。基础模型近期提升了基于视觉的超声分析,但多数方法仅处理单视图,且节段级定位在视图依赖的模糊性下仍不可靠,尤其在心尖切面。为此,我们提出MCF-Net,一种新颖的运动引导多视图融合框架,通过融合心肌运动线索与基础模型表征实现梗死定位。视觉特征由跨双视图共享的预训练超声基础模型EchoPrime提取。心肌运动通过极稀疏监督建模:单张标注模板帧跨视频传递以初始化点追踪,避免密集标注。运动导出的节段感知软掩码提供粗粒度空间先验,选择性增强困难心肌节段的特征。运动条件融合机制跨视图整合运动与视觉信息,在不覆盖强外观线索的前提下优化预测。在节段级心肌梗死定位中,MCF-Net达到72.4% F1分数与84.9%准确率,优于现有最优的运动仅用、视觉仅用及融合基线方法。
预训练数据可能通过计算宣传被投毒。 Victoria Graf 2026-07-16 PDF 对预训练数据进行投毒,可能使语言模型产生难以检测和消除的有害行为。此前针对预训练数据的投毒研究主要利用维基百科等成熟数据源,这类数据源无法体现预训练语料库典型的大规模与异质性特征,且忽视了投毒数据与数据筛选流程之间的相互作用。我们通过现有网络规模内容注入机制——公共讨论接口——证明投毒攻击在预训练数据中的可行性已超越此前的有限场景。此外,为衡量网络爬取及数据筛选后恶意内容是否被纳入,我们提出HalfLife这一新型分析方法,用于评估基于网络爬取的语言模型训练数据中对抗性内容的包含情况。借助HalfLife,我们探索了通过开放讨论接口对预训练语料库进行网络规模投毒的可行性。本分析揭示了评估投毒注入是否被纳入预训练数据的重要性,并证实第三方网页内容可作为攻击语言模型预训练的潜在载体。
SceneBind:跨视觉、音频与语言绑定“什么”与“哪里” Mingfei Chen 2026-07-16 PDF 我们提出SceneBind,一种融合视觉、音频与语言的联合语义与三维空间理解的实景全模态表征。现有全模态编码器擅长实例级语义(即存在什么),但往往缺乏显式空间结构(即位于何处)。SceneBind通过将每个场景表征为语义-空间实体来弥补这一不足,结合全局语义嵌入与以物体为中心的语义-空间槽位。该表征显式捕捉物体级语义、空间属性及不确定性。我们进一步提出SceneBind Matching,一种整合全局场景相似度与物体对齐的语义-空间匹配方案,支持跨模态场景检索与物体定位。为训练与评估SceneBind,我们构建了包含结构化语义与空间标注的新型真实世界双耳视听数据集,并提出跨模态对齐语义与空间信号的训练协议。SceneBind兼容大规模预训练语义编码器,仅需少量额外令牌即可添加轻量级空间建模。它在场景与空间检索任务上达到最优水平,同时实现向音频-视觉定位等下游任务的强零样本迁移能力。
超越成功率:面向成本的攻防安全智能体评估 Paul Kassianik 2026-07-16 PDF 安全智能体评估通常在高推理预算下衡量峰值攻击能力,重点包括漏洞发现、漏洞利用开发、渗透测试及CTF挑战完成情况。这类评估虽有用但不够全面:在运营安全场景中,每次推理步骤、工具调用、遥测查询和情报补充请求都会消耗预算。我们通过成本-成功双维度视角,在攻击性Cybench挑战和防御性Splunk BOTS v1调查挑战中评估语言模型安全智能体。不同于仅报告最佳成功率,我们对比固定成本水平下的模型表现,并按推理开销与工具开销分解性能。结果显示红蓝队任务存在不同的扩展规律:攻击性CTF性能随测试时计算量增加而提升,扩展的开源权重模型可在保持成本竞争力同时接近前沿专有系统;防御性SOC调查则呈现不同扩展模式——其成功更依赖规范工具使用、遥测导航与选择性情报补充,而非单纯推理预算。我们认为安全智能体基准应在任务成功率之外衡量经济效率与运营适配性。成本感知的SOC原生评估能更清晰揭示当前哪些模型具有实际可用性,以及防御型智能体仍需改进的方向。我们已搭建交互式网站展示研究成果:https://evals.frontier.security