| 多步视觉推理的分层去噪 |
Zezhong Qian |
2026-07-16 |
PDF |
视频模型正逐步演变为视觉基础模型,但仍缺乏类人多步推理能力。流式自回归扩散模型虽高效但推理能力有限,而双向扩散虽能实现全局修正,却因密集的帧级去噪导致推理成本高昂。这两种范式在复杂推理任务中均难以兼顾逻辑一致性与低延迟流式处理。我们提出HDR(层级去噪视觉推理框架),通过将层级隐变量融入因果视频生成实现多步推理。HDR将视频隐变量组织为树状层级结构,支持流式输出前的由粗到精推理:粗去噪层保留不确定假设用于全局规划,精细层逐步将其优化为具体视觉状态。稀疏层级注意力模式(SHAP)进一步降低时序注意力成本。我们构建了包含分布外案例的层级多步视频推理基准,涵盖迷宫导航、汉诺塔、一笔画、滑块拼图、推箱子、倒水六类任务。与流式自回归扩散基线相比,HDR将成功率从34.22提升至60.29(相对提升76.2%),平均进度从76.00提升至89.56,展现出更一致的推理轨迹。HDR保持0.70秒/隐变量的低延迟流式处理,推理速度较双向扩散提升54.2倍。在仅使用2%训练数据时仍保留全数据性能的82.9%(双向扩散为52.0%)。真实机器人实验进一步验证了HDR在物理交互与世界建模中的潜力。项目演示:https://hierarchical-diffusion-reasoning.github.io/ |
| 分区、提示、聚合:语言模型中的统计自洽性 |
Patrik Wolf |
2026-07-16 |
PDF |
上下文学习通常被解释为一种条件推断形式,其中提示指定了上下文,模型的输出被视为对应条件分布的估计。如果这一解释成立,那么大语言模型的估计应满足基本的概率恒等式。特别是,全概率定理断言,先验加权的条件分布在总体上的任何有效划分中会聚合为总体层面的边缘分布。本研究探讨了大语言模型的估计在多大程度上遵循这一自洽性原则。我们使用二叉树作为评估框架,递归地将总体划分为粒度逐渐精细的子群体。随后,我们通过提示大语言模型输入以语言描述的子群体上下文,将得到的估计结果重新聚合为总体层面的估计,并比较不同粒度划分下的结果。将该方法应用于多个问题领域和前沿模型后,我们发现基本一致性属性被广泛违反。对人物角色提示的深入研究揭示了一种我们称之为宏观谬误的模式:从更精细的子群体响应中重建的估计往往比直接的总体层面估计更符合人类参考数据。这一效应在树结构变化和估计任务中持续存在,并可通过隐式提示部分恢复。这些发现表明,模型具备相关的子群体知识,但未能可靠地将其传播到聚合估计中。这一差距将统计自洽性确立为评估大语言模型的一个未饱和、无参考标准的新准则。 |
| RoboTTT:机器人策略的上下文扩展 |
Yunfan Jiang |
2026-07-16 |
PDF |
近期机器人基础模型通常基于单步或短历史视觉运动上下文运行。我们提出测试时训练机器人策略(RoboTTT),这是一种机器人模型与训练方案,可将视觉运动上下文扩展至8000时间步,比现有最优策略高出三个数量级,且推理延迟不增加。在此上下文长度下,我们解锁了新的机器人能力:通过人类视频演示实现一次性上下文模仿、实时策略改进、对扰动的鲁棒性,以及在多阶段长周期任务中更强的表现。我们还首次观察到,随着预训练上下文长度增加,闭环性能持续提升。RoboTTT的核心是将测试时训练集成到视觉-语言-动作策略等机器人基础模型中,形成一种序列模型,其循环状态由快速权重构成——这些参数在训练和推理过程中通过梯度下降更新,将历史信息压缩至权重空间,并检索上下文信息以实现长上下文条件化。为扩展训练上下文长度,该方案将序列动作强制与时间截断反向传播相结合。在具有挑战性的真实机器人操作任务中,RoboTTT相比单步上下文基线整体性能提升87%,并完整完成了一项五分钟、十阶段的组装任务(所有基线均无法完成)。使用8000时间步上下文训练的RoboTTT,其表现比同模型使用1000时间步预训练时提升62%,这表明上下文长度可作为机器人基础模型的新扩展维度。视频见https://research.nvidia.com/labs/gear/robottt/ |
| MeanFlowNFT:将前向过程强化学习引入平均速度生成器 |
Yushi Huang |
2026-07-16 |
PDF |
MeanFlow生成器通过预测时间区间内的平均速度实现快速少步采样,使其在高效生成领域具有吸引力。强化学习已成为将扩散模型和流模型与人类偏好及任务特定目标对齐的有力方法。其中,DiffusionNFT提供了一种高效的前向过程强化学习框架,无需反向过程轨迹或似然估计。然而,将此类强化学习方法应用于MeanFlow仍待探索。DiffusionNFT优化瞬时速度,而MeanFlow使用平均速度进行采样。为弥合这一差距,我们提出MeanFlowNFT。受连接平均速度与瞬时速度的MeanFlow恒等式启发,我们构建了一个诱导的瞬时速度预测器。将DiffusionNFT目标应用于该预测器,使奖励优化对MeanFlow具有良好定义。采样仍基于平均速度,保留了MeanFlow的快速少步生成特性。我们进一步证明MeanFlowNFT继承了DiffusionNFT的严格策略改进保证。在图像和视频生成上的实验表明,MeanFlowNFT持续改进基线模型。此外,它在大多数指标上(SD3.5-M上8项中的6项)优于先前最先进的强化学习调优少步生成器,且仅需少量采样步数即可超越多步强化学习调优扩散模型。例如,在Wan 2.1上,4步MeanFlowNFT达到84.33的VBench分数,超越了50步LongCat-Video强化学习(82.57)。 |
| SciDiagramEdit:从论文修订中学习编辑科学图表 |
Yasheng Sun |
2026-07-16 |
PDF |
在科研论文中编辑图表是日常研究工作中常规且耗时的环节:作者在修改稿件时,需要重新标注组件、调整面板布局、统一视觉风格。然而,通过自然语言指令自动化这一编辑流程颇具挑战性,因为科学图表是一种密集的信息图,其中示意图、数据图、照片、图注和箭头等异构视觉元素需遵循严谨的视觉语法组合,以支撑特定论点。为此,我们提出SciDiagramEdit——一个从自然论文修订中学习、并基于图表可编辑矢量源操作的基准与技能进化框架,用户可在此框架中与智能体共同检查并协同编辑单个图元。我们的基准数据集从arXiv版本历史中挖掘修订前后的图表配对,每对均对应作者自身的修订意图。为适应编辑指令的多样性,我们采用技能进化的智能体学习方式:智能体提议器通过多轮执行轨迹持续优化智能体的技能规范。最终形成的技能在保留验证集上逐步提升编辑准确率,证明自然论文修订可作为指令驱动图表编辑的有效训练信号。 |
| 在线神经时空记忆用于动态新视角合成 |
Baback Elmieh |
2026-07-16 |
PDF |
在线多视角流视频的新视角合成面临一个根本性权衡:在严格实时约束下,既要维持持久的长时记忆以重建暂时遮挡区域,又要保证操作效率。虽然测试时训练(TTT)提供了强大的记忆机制,但标准模型要求每帧进行基于梯度的记忆更新以适应动态场景中的运动变化。高计算成本的记忆更新阻碍了实时应用,并可能导致长上下文中的不稳定性。鉴于记忆更新的计算需求远高于记忆应用,且视频内容存在大量冗余,我们提出将这两个过程的频率解耦。本方法采用周期性记忆更新,同时逐帧应用记忆,通过跨视角注意力机制处理先前记忆状态与当前帧之间的形变。为锁定历史上下文,我们引入两个关键机制:辅助记忆损失强制场景的持久内化,以及记忆缓存策略通过正则化活动权重防止灾难性漂移。实验表明,本方法在动态人体运动场景及分钟级在线记忆任务中均实现了实时且最先进的性能。 |
| 基于运动条件的多视图融合技术用于超声心动图心肌梗死定位 |
Guang Yang |
2026-07-16 |
PDF |
心肌梗死仍是全球主要死因之一。超声心动图是评估心梗的常用手段,其中节段性室壁运动异常是关键指标。现有基于学习的心肌运动分析方法多采用手工特征或密集监督估计,但大量标注需求限制了其应用。基础模型近期提升了基于视觉的超声分析性能,但多数方法仅处理单视图,且在视图依赖的模糊性下(尤其心尖切面)节段定位仍不可靠。为此,我们提出MCF-Net,一种新型运动引导的多视图融合框架,通过融合心肌运动线索与基础模型表征实现梗死定位。视觉特征由跨双视图共享的预训练超声基础模型EchoPrime提取。心肌运动建模采用极稀疏监督:通过单张标注模板帧跨视频传递初始化点追踪,避免密集标注。运动导出的节段感知软掩码提供粗粒度空间先验,选择性增强困难心肌节段的特征。运动条件融合机制进一步跨视图整合运动与视觉信息,在不覆盖强外观线索的前提下优化预测。在节段级心梗定位任务中,MCF-Net达到72.4% F1分数与84.9%准确率,优于现有最优的运动单模态、视觉单模态及融合基线方法。 |
| 预训练数据可能通过计算宣传被投毒。 |
Victoria Graf |
2026-07-16 |
PDF |
对预训练数据进行投毒,可能会给语言模型引入难以检测和缓解的有害行为。此前关于预训练数据投毒的研究主要利用维基百科等成熟数据源,这类数据源无法体现预训练语料库典型的大规模与异质性特征,且忽视了投毒数据与数据筛选流程之间的相互作用。我们通过现有的大规模网络内容注入机制——公共讨论接口——证明,预训练数据的投毒攻击在超越这一有限场景后依然可行。此外,为衡量恶意内容在网络爬取和数据筛选后是否被保留,我们引入HalfLife这一新型分析方法,用于评估基于网络爬取的语言模型训练数据中对抗性内容的纳入情况。我们借助HalfLife探讨了通过开放讨论接口在网络规模下对预训练语料库进行投毒的可行性。分析表明,评估投毒注入是否被纳入预训练数据至关重要,并证实第三方网页内容可能成为攻击语言模型预训练的潜在途径。 |
| SceneBind:在视觉、音频与语言中绑定“什么”与“哪里” |
Mingfei Chen |
2026-07-16 |
PDF |
我们提出SceneBind,一种融合视觉、音频和语言中联合语义与三维空间理解的真实场景全模态表征。现有全模态编码器擅长实例级语义(即存在什么),但往往缺乏明确的空间结构(即位于何处)。SceneBind通过将每个场景表示为语义-空间实体来弥补这一不足,将全局语义嵌入与以物体为中心的语义-空间槽位相结合。这种表征显式捕获物体级语义、空间属性及不确定性。我们进一步提出SceneBind Matching,一种整合全局场景相似性与物体对齐的语义-空间匹配方案,支持跨模态场景检索与物体定位。为训练和评估SceneBind,我们构建了包含结构化语义与空间标注的新型真实世界双耳视听数据集,并提出跨模态对齐语义与空间信号的训练协议。SceneBind兼容大规模预训练语义编码器,仅需少量额外令牌即可添加轻量级空间建模。它在场景与空间检索任务上达到最优性能,同时实现向音频-视觉定位等下游任务的强零样本迁移能力。 |
| 超越成功率:面向成本的攻防安全智能体评估 |
Paul Kassianik |
2026-07-16 |
PDF |
安全智能体的评估通常基于充裕推理预算下的峰值攻击能力,重点衡量漏洞发现、漏洞利用开发、渗透测试及CTF挑战完成度。这类评估虽有用但不全面:在实战安全场景中,每个推理步骤、工具调用、遥测查询及数据丰富请求都会消耗预算。我们通过成本-成功双维度评估语言模型安全智能体,测试对象包括攻击性Cybench挑战与防御性Splunk BOTS v1调查挑战。不同于仅报告最优成功率,我们在固定成本水平下对比模型,并按推理开销与工具开销分解性能表现。研究结果显示红蓝队任务呈现不同扩展规律:攻击性CTF性能随测试时计算量增加而提升,开源权重模型在保持成本优势的同时可接近前沿闭源系统;防御性SOC调查则呈现不同扩展模式——其成功更依赖规范工具使用、遥测导航与选择性数据丰富,而非单纯推理预算。我们认为安全智能体基准测试应在任务成功率之外,同步评估经济效率与实战适配性。基于成本感知的SOC原生评估能更清晰揭示当前模型的实用价值,以及防御型智能体仍需改进的方向。我们已搭建交互式网站展示研究成果:https://evals.frontier.security |