| Tetris3D:通过相互契合的物体生成3D场景 |
Jaeyeong Kim |
2026-10-07 |
PDF |
我们提出Tetris3D,一个用于单图像3D场景重建的生成框架,能够以场景形式恢复在物理和几何上一致的物体。现有方法通常独立生成物体或隐式地耦合它们,难以为确保相互交互的相邻物体之间细粒度空间兼容性提供充分指导。为解决这一问题,我们显式地将每个物体的生成条件建立在其周围物体的几何结构及其物理关系之上,引导其形状和姿态在场景中保持几何和物理上的合理性。此外,我们引入了ComOb,一个基于物理模拟的数据集,包含120万个场景,涵盖多样物体类别之间的物理交互,并带有逐物体网格和成对物理关系标注。在合成和真实世界场景上的综合实验表明,Tetris3D即使在交互区域被遮挡时也能恢复一致的物体形状和姿态,并在生成质量和物理稳定性方面均达到最先进性能。 |
| 永不回头:从第一人称视频理解三维物体记忆中的持久性 |
Shravan Chaudhari |
2026-10-07 |
PDF |
当我们在世界中活动并完成日常任务时,会遇到一些可能之后才会变得相关的物体。我们能够回忆起把某物放在哪里,或者容器里装了什么,即使当时并不知道之后会需要这些信息。在这里,我们研究一个具身助手如何通过观察一个人的日常活动,从第一人称视频中构建类似的记忆。我们提出 Ledger,一种持久的三维物体记忆,它结合了物体位置、其历史以及上下文描述。它关联整个录制过程中的观察,并在物体离开视野后仍保留它们,包括那些人从未触碰过的物体。它按静止位置对每个物体的观察进行聚类,并且只有在反复出现证据后才记录一次移动,从而减少定位噪声的影响。简短描述保留了诸如物体内容或支撑表面等细节。它将这些记录保存下来,以便之后回答空间问题,而无需访问原始图像或视频。我们的记忆将 HD-EPIC 准确率从 29.7% 提升到 42.6%,将 UCS-Bench 准确率从 33.8% 提升到 38.5%,并在返回预测上以 0.99 米的中位误差定位 Ego4D 物体。我们的分析识别出时间持久性、上下文描述和检索之间的互补作用。我们对每个包含多个场景的 100 条拼接流进行的研究,进一步暴露了检索和构建两方面的失败。与单场景流相比,逐场景构建部分恢复了跨场景变化中损失的性能。 |
| 在RLVR中将探索与优化解耦 |
Saif Punjwani |
2026-10-07 |
PDF |
现代语言模型在已训练好的检查点之上,通过可验证奖励的强化学习(RLVR)进行训练。RLVR 的一个关键承诺是发现新的推理策略。原则上,模型可以采样出其先前训练数据中不存在的新想法。然而在实践中,用强新颖性激励来增强 RLVR 收效有限,并且可能降低模型质量。由于可验证奖励只监督模型知识和行为中很窄的一部分,这类退化难以恢复。为此,我们在一个称为探索-蒸馏(ExpDis)的框架中将探索与优化解耦。我们用一个奖励中的新颖性 bonus 训练一个或多个探索者策略,对其轨迹进行正确性和质量过滤,并将其蒸馏到一个单独的学生策略中。随后,学生策略在没有新颖性 bonus 的情况下训练。我们重复上述过程若干轮,在探索与优化之间交替。这种解耦使我们能够积极地扩展探索,而不会降低学生策略。在七个数学推理基准和两个模型家族上,ExpDis 在相同的墙钟时间预算下优于 DAPO。此外,我们观察到 pass@$k$ 扩展性有所改善,这表明 ExpDis 产生的模型能够生成更多样化的正确解。 |
| EngramEdit:通过条件记忆实现大语言模型中的解耦知识更新 |
Hongru Cai |
2026-10-07 |
PDF |
条件记忆架构如DeepSeek Engram利用输入n-gram查找学习到的嵌入,以有限的额外计算扩展大语言模型(LLM)的容量。除模型扩展外,该架构已展现出将事实知识存储与通用计算解耦的潜力,为在保持Transformer主干固定的同时更新事实知识提供了一条有前景的路径。实现这一潜力具有挑战性,因为同一事实的不同表达可能激活不同的n-gram嵌入,而更新共享嵌入可能无意中改变模型对其他事实的预测。我们提出EngramEdit,通过条件记忆实现解耦知识更新。EngramEdit首先计算目标记忆表示,使模型在多种表达下预测更新后的事实。然后联合更新共享n-gram嵌入,使其在多种表达和编辑下匹配这些目标,并对频繁复用的嵌入施加更强的更新惩罚,以保留无关知识。实验表明,EngramEdit通过条件记忆实现独立的事实知识更新,达到近乎完美的编辑成功率。修订后的知识可用于未见过的表达和多跳推理,在思维链(CoT)提示下准确率接近最强基线的三倍。即使事实更新不断累积,无关知识和通用能力也基本得以保留。这些发现表明,EngramEdit将条件记忆转变为可编辑的知识接口,将其作用从模型扩展延伸至支持解耦知识更新。 |
| 基于交通和充电需求预测的联网自动驾驶车辆预测性路径重规划 |
Tony Kinchen |
2026-10-07 |
PDF |
在本文中,我们考虑混合交通中联网自动驾驶车辆(CAVs)的预测性重路由问题,并兼顾电动汽车充电需求。我们提供了一个框架,将扩散卷积循环神经网络(DCRNN)与一种考虑拥堵、CO2排放、路线长度和充电需求的路由策略相结合。DCRNN利用历史网络观测数据来预测交通状况和充电需求。这些预测随后用于评估符合条件的CAVs的可行备选路线。当备选路线能够保持与原始目的地的连通性并改善规定的路线成本时,路线变更被接受。我们在SUMO中,在五种CAV渗透率水平(从5%到45%)下,于受控交通中断场景中评估所提出的框架。我们将其性能与K最短路径路由、预测密度路由、V2X主动路由以及不进行重路由的参考场景进行比较。在所考虑的场景中,与参考场景相比,所提出的框架将平均行程时间指数降低约1.8%,并在主动路由方法中实现了最低的平均行程时间指数、最高的平均速度和最低的总CO2排放。在所有五种渗透率水平下,它接受了41次路线变更,而K最短路径路由为146次,V2X主动路由为153次。参考场景保持了较低的总排放和行驶距离,说明了拥堵缓解与重路由带来的额外行驶之间的权衡。 |
| 长WAM:扩展世界-动作模型的上下文 |
Wei Huang |
2026-10-07 |
PDF |
实时机器人控制需要足够的视觉历史来推断运动与任务进展,但处理这些历史会延迟动作。我们提出 Long-WAM,一个模型-系统框架,用于在实时控制约束下扩展因果世界-动作模型的上下文。我们的核心发现是:能够访问历史并不等同于真正利用历史:当视频基础模型以自回归方式预训练时,更长的历史带来的收益要大得多。我们首先从机器人视频和第一人称视频中学习无动作标签的因果预测,然后在世界-动作适配过程中保留这种从历史到未来的结构。在 RoboCasa GR-1 上,将上下文从 0.0 秒增加到 19.2 秒使成功率从 63.3% 提升到 78.7%,而双向预训练的初始化则没有净收益;机器人领域的自回归预训练进一步提高了 GR-1 和 LIBERO-Long 上的峰值成功率。Long-WAM 在 LIBERO-Long、RoboTwin 2.0 和 DOMINO 上也取得了所比较方法中的最佳结果。流式观测编码、异步执行和硬件特定加速使其能够在 RTX 5090、DGX Spark 和 Jetson AGX Thor 上部署而不牺牲未来预测;在 RTX 5090 上,每个动作块(包括未来视频潜在预测)耗时 107.4 毫秒。在 Unitree G1 和 YAM 上的实时部署支持动态和长时程操作,包括动态叠杯任务中 95% 的成功率,而 Pi0.5 和 Fast-WAM 在 20 次试验中均未成功。作为一个记忆驱动的执行器,Long-WAM 还能在复合任务中补充更高层的规划。 |
| 重尾噪声下的去中心化SGD:最优收敛速率与梯度裁剪的作用 |
Aleksandar Armacki |
2026-10-07 |
PDF |
重尾噪声在现代机器学习中已被广泛观察到,这促使人们采用梯度裁剪和归一化等方法。虽然这些方法在集中式设置中已被充分理解,但在去中心化设置中却知之甚少,因为在去中心化设置中,对局部梯度施加非线性会影响优化和共识。近期关于去中心化非凸优化的研究在重尾噪声下同时考察了裁剪和归一化,其中裁剪产生次优速率,而归一化需要局部动量或小批量才能收敛。这引出了一个问题:使用非线性的基线去中心化方法能否在重尾噪声下达到最优收敛速率?我们以裁剪去中心化随机梯度下降($\mathtt{DSGD}$)给出了肯定的回答。对于有界 $p$ 阶矩噪声下的光滑非凸代价函数,$p \in (1,2]$,我们证明裁剪 $\mathtt{DSGD}$ 在高概率和期望意义下均达到阶最优速率。此外,我们建立了智能体数量上的线性加速,据我们所知,这对于带裁剪的去中心化方法尚未被证明。关键的技术要素是对共识间隙的精细分析,该分析利用了裁剪的结构,将网络效应归入高阶项。我们的结果突显了去中心化设置中裁剪与归一化之间的一个重要区别:归一化 $\mathtt{DSGD}$ 可能无法收敛,而裁剪保留了幅度信息,使 $\mathtt{DSGD}$ 能够收敛并达到阶最优。数值实验验证了我们的理论。 |
| 行动前先重述:刻画并缓解视觉-语言-行动模型中的语言敏感性 |
Mikey Watts |
2026-10-07 |
PDF |
视觉-语言-动作模型(VLAs)对指令措辞极为敏感,并且不继承其构建所基于的视觉-语言模型的语言鲁棒性。一个词的修改就能使成功率变化数十个百分点:$π_{0.5}$ 对“switch on the stove”在 LIBERO 炉灶任务上 100% 成功,而对“switch on the hot plate”仅 2% 成功,一个用改述增强微调的 $π_0$ 检查点仍显示出高达 61 个百分点的波动。我们通过统计检验的单次编辑波动和 oracle 短语搜索来刻画这种敏感性,结果表明仅措辞一项就几乎弥合了分布内与分布外任务之间 21 个百分点的差距。随后我们在不修改策略的情况下降低这种敏感性。由于这种敏感性是系统性的,它可以被表达为显式规则:我们对少量训练任务的许多措辞进行评分,让一个大语言模型将证据提炼为十到二十条改述规则,并在部署时依据这些规则对每条传入指令重写一次。这些规则在十二个留出任务上,针对对抗性、VLM 生成和人类生成的措辞,将冻结的 $π_0$ 相对提升 16% 到 27%,增益集中在分布外任务上。该流程在 $π_{0.5}$ 和 LIBERO 上可复现,将微调内成功率从 93.6% 提升到 97.8%。该方法无需重新训练,也无需逐步验证,并可零样本应用于未见过的任务和指令。项目网站:https://sttawm.github.io/rephrase-before-you-act |
| GRACE:面向高效视频生成的生成感知潜在压缩 |
Jiyoung Kim |
2026-10-07 |
PDF |
高度压缩的视频自编码器为加速视频扩散模型提供了一种有效途径,因为扩散Transformer(DiT)在远更少的token上运行。然而,此类自编码器的训练颇具挑战,因为更高的压缩比会降低重建质量,而恢复质量需要更多通道,这已知会拖慢DiT的收敛。压缩后的潜变量也与DiT训练时所使用的潜变量不同,因此预训练的DiT必须以相当大的代价从头重新训练或进行适配。压缩DiT训练时所使用的自编码器似乎能保持兼容性,但仅针对重建进行优化仍会使潜变量偏离DiT已学到的分布。为解决这一问题,我们提出了面向高效视频生成的生成感知潜变量压缩(GRACE),这是一个两阶段框架,在压缩预训练视频自编码器的同时保持其与预训练DiT的兼容性。具体而言,我们保留来自预训练编码器的冻结基础潜变量,并学习一个残差潜变量以承载更强压缩下丢失的信息,同时在冻结DiT的特征空间中将压缩潜变量与预训练潜变量对齐,从而使自编码器针对生成进行优化。随后,我们通过轻量级微调与非对称去噪对DiT进行适配,其中基础潜变量先于残差潜变量被去噪。GRACE在480x832x81下将Wan2.1-I2V-14B的token数量减少8倍,延迟降低11.1倍,同时在VBench上达到与压缩前预训练流程相当的生成质量。 |
| 蒸馏图几何:从GNN到MLP的知识差距 |
Zhewei Chen |
2026-10-07 |
PDF |
GNN到MLP蒸馏旨在保留消息传递教师的预测精度,同时在推理时部署无图MLP。现有方法主要迁移节点级预测或使用基于置信度的重加权,但它们没有指明学生应在何处保留教师由图诱导的几何结构。我们表明,这一遗漏会导致学生表示空间中出现两种谱失效模式。在稀疏图上,学生会遭受谱欠拟合,缺失集中在边界区域附近的高能教师方向。在稠密图上,学生会遭受谱过拟合,保留教师通过聚合已坍缩的虚假方向。受能量加权师生对齐目标启发,我们提出图几何感知MLP(G^2MLP),一种由Ollivier-Ricci曲率引导的训练时蒸馏框架。曲率识别两种谱误差集中之处,并用于在预测级对齐与表示级对齐之间分配监督。部署后的模型仍是标准MLP,并且推理时无需访问图。在节点分类基准上,G^2MLP持续优于无图蒸馏基线,在两种情形下缩小师生秩差,并可无需架构改动迁移到图Transformer教师和链接预测。 |