跳转至

arXiv 2026-10-06

标题 作者 发布日期 PDF链接 摘要
世界模型在物理学中的最后考试 Mingju Gao 2026-10-06 PDF 视频世界模型能够生成视觉上逼真但物理上不一致的序列,这引发了人们对其在具身人工智能系统中用于预测和规划的可靠性的担忧。现有评估通常依赖基于模型的判断或参考视频,而直接的物理测试则主要聚焦于力学。我们提出了“世界模型物理终极考试”,这是一个基于测量的基准,用于评估视频世界模型中的物理一致性。该基准包含40项受控任务,涵盖力学、光学、流体、热学与相变现象、电磁学以及表面张力。每项任务将一张初始图像和一个生成提示与预定义的物理标准配对,从而能够在无需参考视频的情况下对可观测的物理关系进行可解释的测试。其评估器将任务可观测性筛选与任务特定的定量物理测量相结合。在1,280个视频上对八个视频生成模型进行的实验揭示了持续存在的物理不一致性以及任务之间的显著差异,最佳模型的总体得分为100分中的57.76分。对具有已知物理关系的合成视频进行评估,为测量模块在受控条件下的有效性提供了证据。在任务内排名和成对比较中,该评估器与人类判断的一致性也高于直接的视觉语言模型基线。通过将跨物理领域的覆盖范围与基于可测量证据的得分以及明确的测量局限性相结合,该基准为诊断物理不一致性并追踪朝着物理一致的视频世界模型所取得的进展提供了可解释的基础。
从单张图像构建罗马 Jiraphon Yenphraphai 2026-10-06 PDF 单图像场景生成旨在从单张图像生成完整的三维场景网格,包括相机未观测到的表面。尽管预训练的三维物体生成器编码了强大的形状先验,但它们主要针对固定规范体积中的孤立物体设计,并且由于户外场景的多样化三维数据相当有限,这些生成器大多聚焦于室内场景。在本工作中,我们提出了一种方法,重新设计这种以物体为中心的生成器,例如Trellis 2,使其能够同时适用于室内和户外场景,同时保留其先验。我们通过以下方式实现这一目标:(a) 将场景划分为相对于相机距离进行缩放的自适应块;近处的块具有较小的尺寸以保持更精细的细节,而远处的结构,例如建筑物,则由大块覆盖;(b) 使生成器通过提升图像特征并让模型感知自由空间、观测表面和未观测区域,来捕捉显式的二维-三维对应关系;(c) 合成约4,000个户外场景以扩展训练数据,因为现有的场景数据集大多是室内的。在Tanks and Temples、ScanNet++以及野外图像上的实验表明,我们的方法在室内和户外场景中的几何精度和感知质量方面均优于所有基线方法。
QF3:基于过滤Q梯度的快速流强化学习 Chung Min Kim 2026-10-06 PDF 流策略已成为从演示中学习机器人行为的标准策略类别,但强化学习对于改进预训练流策略或通过交互从头学习流策略仍然至关重要。我们提出了 QF3(带过滤 Q 梯度的快速流强化学习),一种在线离策略强化学习算法,它通过流匹配加上评论家的动作梯度来训练流策略,该梯度通过流输出的一步预测进行反向传播。为了将更新保持在评论家和该预测可靠的范围内,QF3 仅将评论家梯度应用于保持接近回放动作的动作维度。据我们所知,QF3 是首个从头训练人形机器人运动策略并将其零样本迁移到硬件的离策略流强化学习方法。结合高通量离策略训练方案,它训练人形机器人运动和运动跟踪策略的墙钟时间比 FPO++(一种最近的在线策略流强化学习方法)快 10 倍。我们进一步将 QF3 应用于在 ABC-Sim 和 Robomimic 任务上微调预训练的基于流的操作策略。这些结果表明,QF3 既能从头学习机器人策略,也能改进从演示中获得的策略。网站:https://qf3-rl.github.io/
共形预测集量化信息增益:一个理论视角 Kevin Zhang 2026-10-06 PDF 共形预测是一种流行的不确定性量化工具,它输出具有有限样本覆盖保证的预测集。虽然预测集大小常被用作不确定性的启发式度量,但这种解释的信息论基础仍然鲜为人知。在这项工作中,我们利用针对集合值预测量身定制的熵的决策论推广,提供了这样的基础。特别地,我们引入了一族基于共形预测集大小和覆盖率的广义信息度量。值得注意的是,香农互信息可以用这些度量给出精确的积分表示。然后我们表明,在标准分类设置中,额外信息带来的共形集大小缩减 (i) 被夹在该族中依赖于校准的成员之间,并且 (ii) 服从数据处理不等式,二者均在有限样本校准和模型误差项的意义下成立。总之,我们的结果在形式上将共形预测与经典信息论量联系起来,并证明了使用集合大小缩减作为信息增益度量的合理性。在实证方面,我们在 11 种分类设置中验证了我们的理论,并表明在贪心特征选择实验中,集合大小缩减和香农互信息可以对特征给出不同的排序。
PEARS:基于物理先验引导的高效自适应,通过失败推理与扩散引导实现触觉操作 Kun Song 2026-10-06 PDF 预训练机器人策略在部署过程中遇到分布外(OOD)条件时,性能可能会大幅下降,这促使人们通过真实世界交互进行后训练。然而,基于强化学习(RL)的后训练通常需要大量环境交互,这一负担在操作任务中尤为显著,因为每次试验可能缓慢、昂贵甚至具有破坏性。因此,我们提出 PEARS,一种物理先验引导的混合 RL 框架,用于在触觉反馈下对预训练策略进行样本高效的在线适应。在每个回合之后,其物理引导力推理(PFR)模块利用视觉语言模型(VLM)中编码的物理先验,从视觉结果和触觉交互历史中诊断失败,并更新适合任务的接触力边界。随后,一个高频混合力-位置控制器在接触过程中执行这些边界。作为补充,触觉条件扩散引导强化学习调整冻结流匹配策略的潜在噪声,以纠正自由空间运动和接触时机中的错误,而无需更新基础模型。在仿真中,PEARS 相比最强的逐任务基线将成功率提高了 12.4 至 37.4 个百分点。PEARS 还将达到某一成功阈值所需的交互回合数相比最快的基线减少了最多 53.2%。在真实世界实验中,PEARS 在白板擦除任务上达到 95% 的成功率,在移液管液体吸取任务上达到 90% 的成功率。这些结果表明,将 PFR 模块与策略引导相结合,可以加速适应,同时减少代价高昂的交互。项目网站见 https://song-kun.github.io/pears。
4D-HOF:用于前馈4D交互重建的手-物体流匹配 Shiqi Li 2026-10-06 PDF 现有的4D手-物体重建方法通常依赖于代价高昂的逐序列优化,而生成式方法一般从随机噪声合成交互,这可能导致交互预测不稳定。我们提出4D-HOF,一种前馈框架,能够从视觉基础模型产生的粗略但信息丰富的估计中重建4D手-物体交互。具体而言,我们学习一个条件流匹配模型,将基础模型导出的手-物体状态输运至交互流形,使模型能够以前馈方式校正平移、旋转和对齐中的误差。我们生成式表述的一个关键优势在于,它自然支持在输运过程中进行测试时引导。我们无需在重建后应用单独的事后优化,而是利用物理交互约束和观测到的2D证据直接引导演化中的生成状态,使重建作为生成过程本身的一部分得到细化。通过在不同数据集上训练生成模型,4D-HOF能够稳健地泛化到具有挑战性的野外场景。在域外基准上的实验表明,4D-HOF达到了最先进的性能,能够产生更稳定、更准确的4D手-物体重建。
IdeaAnchor:教LLM将文献转化为研究思路 Ziyu Chen 2026-10-06 PDF 科学研究通常始于综合一组相关论文中的思想,以识别空白并制定新方向。然而,训练语言模型执行这种基于文献的思想生成仍然具有挑战性,因为基于提示或反馈的现有方法缺乏关于论文应如何被综合的结构化监督。我们提出IdeaAnchor,一种训练LLM使用结构化规范作为特权信号来执行研究思想生成的范式。每个IdeaAnchor实例编码了每篇输入论文应如何被综合为一个成功思想,包括它们的功能角色、关系和目标综合标准。我们通过从已发表论文中挖掘实例来构建这一范式,捕捉真实思想如何从先前文献中涌现。然后,我们通过演示、自蒸馏和强化学习训练模型,并在推理时通过检索进一步增强生成。实验表明思想生成质量持续提升。我们的分析揭示了一种功能分解:基于锚点的训练增强创造性综合,检索增强细节阐述,而两者结合产生最佳性能。
DepthWorld:用于机器人操作的3D世界模型 Jai Bardhan 2026-10-06 PDF 世界模型为机器人领域提供了一种数据驱动的传统模拟器替代方案,其应用涵盖策略评估、改进与规划。所有这些用途都依赖于忠实的3D几何,然而当前基于视频的世界模型仅使用RGB进行训练,生成的推演逐帧看似正确,却无法组合成一致的3D世界。弥合这一差距需要在两个方面取得进展:面向操作的大规模3D监督,以及一种能够吸收这些监督而不破坏强大预训练视频先验的架构。我们提出了一种标定流水线,将学习到的立体深度与联合因子图相结合,汇集从同一物理机器人收集的所有回合,以恢复其共享运动学参数以及每个场景的外参。将其应用于DROID数据集,得到了DROID-3D,这是一个标定后的3D数据集,提供密集的度量深度和重新标定的多视角外参(在90%的回合中,外部相机的重投影误差小于0.7像素)。随后我们训练了DepthWorld,这是一个基于Stable Video Diffusion的世界模型,通过空间潜在分块联合预测多视角RGB和深度,同时保持预训练的变分自编码器(VAE)不变。在相同训练预算下,深度监督使RGB预测本身相比仅使用RGB的相同基线提升了+1.48 dB PSNR,同时为下游几何推理生成准确的度量深度。
ALIVE:面向首帧引导视频编辑的交互对齐物体插入 Zhenghong Zhou 2026-10-06 PDF 当前的视频编辑器可以插入物体,但往往难以让这些物体参与诸如被拿起或被操控等交互。我们提出了ALIVE,一个通过源视频内容进行连贯交互,使插入的物体“活起来”的框架,它仅使用编辑后的首帧和一个只命名所添加物体的指令。我们整理了35800个编辑对,将3D渲染、模型生成和真实世界视频与来自ROSE的通用编辑对相结合。每个编辑对在目标物体是否存在上有所不同,同时保持周围动作不变,从而教会编辑器协调的物体行为和源内容保持。我们进一步训练了一个视觉语言模型(VLM),以从相同的输入中预测交互引导。我们引入了ALIVE-interaction基准,使用统一的基于VLM的协议来评估交互保真度、源内容保持和视觉连贯性,并在通用视频物体插入基准上进行评估。在没有VLM引导的情况下,ALIVE在两个基准上分别将Overall较最强的已评估基线提高了43.9%和4.4%。VLM预测的引导在没有额外用户输入的情况下,进一步将ALIVE-interaction分数提高了0.95分。
Sherpa:教LLM自适应地教学 Weixian Xu 2026-10-06 PDF 大型语言模型已成为越来越有能力的问题解决者,但能够解决问题并不等同于能够教授问题。现有的将大语言模型训练为教师的方法依赖于演示、偏好数据或预先定义的教学标准,这些标准规定了什么是好的教学。然而,这些信号往往并不基于个体学生的学习成果,而有效的教学策略在不同学习者之间可能差异很大。为解决这一问题,我们提出了 Sherpa,一个多轮强化学习框架,它以大语言模型实例化多种学生原型,并以不同的学习偏好为条件,训练一个教师模型,通过直接最大化他们的学习成果来调整其教学。使用 Sherpa 训练的教师大语言模型使受教学生在所有原型上的表现平均提高了 20.5 个百分点。在 MathTutorBench 的评估下,Sherpa 将整体教学评分从 52.5% 提升至 79.2%,表明教学回应更好。我们的人类研究表明,在 79.6% 的成对比较中,训练后的教师比基础模型更受偏好。总之,Sherpa 训练大语言模型教师适应多样化的模拟学生,并更好地与人类教师保持一致,为 AI 导师教授真实学生铺平了道路。