| 未来动态三维重建:一种解耦自我运动的三维世界模型 |
Nils Morbitzer |
2026-06-16 |
PDF |
预测动态环境的演变对自主智能体至关重要。尽管生成式世界模型近期通过将自我运动与环境动态混合在图像平面中,在二维视频合成领域实现了高度逼真效果,但这些模型存在物理不一致性,例如物体变形或消失,尤其在长时间跨度下更为明显。本文提出FR3D——一种能够预测持续性三维潜在表征的世界模型,用于未来动态三维重建。与将世界视为基于图像特征序列的先前工作不同,FR3D明确解耦场景的三维演变与智能体轨迹,将推断的自我运动作为动作的潜在代理。这种解耦消除了自我运动与世界运动之间的歧义,确保未来几何一致性。此外,我们引入教师-学生蒸馏策略,利用现成基础模型的空间"常识",实现鲁棒的零样本泛化。大量实验表明,FR3D在多个数据集上基于单目观测的未来动态三维重建中表现优异,即使预测未来2秒的场景仍保持高性能。项目页面:https://fr3d-wm.github.io。 |
| 统一多模态自回归建模的关键在于共享上下文-视觉分词器 |
Wujian Peng |
2026-06-16 |
PDF |
统一多模态建模旨在将视觉理解与生成集成于单一系统之中。然而现有方法通常依赖两种不同的视觉分词器,这割裂了表征空间并阻碍了真正的统一建模。我们提出UniAR——一种统一自回归框架,其中单个离散视觉分词器作为理解与生成之间的关键桥梁,使模型能够在共享上下文中直接解读自身生成的视觉标记,无需额外重新编码。UniAR采用预训练视觉编码器,结合多层级特征融合与免查找的逐位量化方案,在保留高层语义与低层细节的同时,以最小成本扩展有效视觉词汇量。基于此,统一自回归模型采用并行逐位预测机制,联合预测空间分组的多层级视觉编码,显著缩短视觉序列长度并加速生成。最终,基于扩散的视觉解码器对离散视觉标记进行解码,生成高保真图像。通过大规模预训练、监督微调与强化学习,UniAR在图像生成与图像编辑任务上达到最优性能,同时在多模态理解基准测试中保持竞争力。项目页面访问地址:https://sharelab-sii.github.io/uniar-web |
| 视觉验证实现了推理时引导与自主策略改进 |
Mingtong Zhang |
2026-06-16 |
PDF |
部署于现实世界的机器人应从自身经验中学习并持续改进,这需要一套实践与反馈学习机制。本文提出VERITAS框架——一种面向通用机器人策略的生成器-验证器架构,用于推理阶段的策略引导与自我优化。我们采用预训练的通用机器人策略作为"生成器",并搭配无梯度的"视觉验证器"在推理阶段评估动作质量。该框架无需额外训练即可实现推理阶段策略引导,显著提升策略性能。实验表明,推理阶段验证机制无需新增示范数据即可持续超越原始通用策略。此外,验证生成的轨迹数据可为离线策略优化提供有效监督:基于验证自生成轨迹微调的策略可获得持续性能提升。值得注意的是,采用验证轨迹进行后训练能达到与专家示范相当的效率,且无需人工干预。研究结果凸显了推理阶段验证作为机器人部署中实用且可扩展的改进机制的价值。 |
| 变宽变压器 |
Zhaofeng Wu |
2026-06-16 |
PDF |
扩展模型规模,特别是深度和宽度,已显著推动了基于Transformer的语言模型的发展。然而,大多数架构在所有层中保持恒定宽度,尽管不同层可能承担不同的计算角色,但仍将固定的参数和计算预算均匀分配。在本研究中,我们通过提出一种×形> <former在语言建模损失上始终优于参数匹配的均匀基线模型。通过降低平均层宽度,该架构还减少了整体FLOPs(在拟合损失匹配缩放曲线下减少22%),并降低了KV缓存内存和I/O成本(减少15%)。在分析中,我们展示了这种瓶颈结构如何在残差流中产生定性不同的表征。总体而言,我们的结果表明,非均匀宽度分配能够实现更资源优化的语言模型缩放。 |
| MOCHI:协作性人机交互中的运动增强 |
Jiye Lee |
2026-06-16 |
PDF |
协作式人机交互展现出动态且复杂的运动模式,需要参与者与共享物体之间相互预判和持续调整。建模此类多人-物体交互(MHOI)场景需要以高质量数据采集为基础,但由于MHOI中人与人、人与物交互同时发生的固有复杂性,这一过程极具挑战。这种复杂性导致MHOI数据采集存在多种伪影:手部与物体接触错位、运动抖动与时间序列不一致、手指关节运动细节缺失或不完整。为解决这些问题,我们提出MOCHI(协作式人机交互运动增强)框架,这是一个两阶段噪声MHOI数据增强方案。该方法首先通过优化从含噪人体输入生成物理合理的手部抓取姿态,使抓取动作既符合物理规律又与身体姿态语义一致,随后将这些优化后的抓取扩展为完整的手-物交互序列。最终通过基于扩散模型的噪声优化框架,利用单人运动先验对所有参与者的全身运动进行精炼。在优化过程中,我们引入编码人-物交互与人-人交互信息的优化目标,将其融入单人先验中。实验结果表明,该流程对现有采集方法或生成模型获取的多样化MHOI数据均有效。我们进一步验证了系统在不同参与者数量和交互类型下的鲁棒性,并展示了关键帧MHOI创建、基于物体几何变化的数据增强等多种应用。 |
| EventDrive:面向视觉-语言驾驶智能的事件相机 |
Dongyue Lu |
2026-06-16 |
PDF |
事件相机通过异步亮度变化感知世界,具备微秒级延迟和高动态范围,其运动保真度远超基于帧的传感器,并能捕捉传统曝光方式常遗漏的时间结构。这些特性使事件信号成为自动驾驶中RGB相机的有力补充,尤其在帧基感知易失效的模糊、强光和快速运动场景下。然而,现有的事件感知视觉语言模型仍局限于通用感知任务,未能揭示事件传感如何驱动完整驾驶循环中的推理与决策。我们提出EventDrive——一个大规模基准测试与模型套件,统一了事件流、RGB帧和语言监督,覆盖感知、理解、预测与规划四大核心维度,包含描述生成、结构化问答、定位、运动状态识别、轨迹预测及规划任务。基于此框架,EventDrive-VLM引入多时域事件金字塔与时域混合专家模块,自适应编码融合异步与帧基信息以支持下游推理。跨多任务的综合评估表明,事件流在时间精度、运动感知和鲁棒性方面带来显著提升,将事件传感推向驾驶智能的核心。 |
| ReproRepo:利用GitHub仓库问题扩展可重复性审计规模 |
Shanda Li |
2026-06-16 |
PDF |
复现论文及已发布代码的研究成果是科学进步的核心。现有工作已引入基准测试来评估LLM智能体能否辅助复现,但这些基准测试因依赖大量人工进行数据整理和评估而难以规模化。我们提出ReproRepo——一个可扩展的复现性评估框架,该框架利用人类提出的GitHub问题作为真实复现障碍的自然监督信号。我们在来自顶级会议的1149篇近期机器学习论文上实例化ReproRepo,并评估了四种前沿模型-智能体配置。结果表明,即使不执行代码,LLM智能体也能从论文-仓库配对中识别出许多真实世界的复现问题:本研究中表现最佳的智能体(即搭载GPT-5.5的Codex)能针对约90%的研究论文,至少发现一个与人类报告问题语义相关的障碍。进一步分析表明,智能体在暴露显性故障和定位正确语义区域方面尤为有效,但在精确位置定位上仍存在不足。ReproRepo可作为未来评估LLM智能体在真实世界复现审计中表现的可复用、可扩展框架。我们的代码已发布于https://github.com/LithiumDA/ReproRepo。 |
| 符号秩、索引与列表可复制性:关联与分离 |
Ari Blondal |
2026-06-16 |
PDF |
在学习理论中,二元概念类的符号秩刻画了其能被点和半空间表示的最小维度。尽管备受关注,但符号秩的下界证明极为困难。近期两种方法通过更易分析的度量来建立符号秩下界:$\mathbb{Z}_2$-指数和列表可复制数。我们对这些度量进行排序,证明$\mathbb{Z}_2$-指数被列表可复制数的线性函数所上界。作为主要结论,我们得到了符号秩与$\mathbb{Z}_2$-指数之间的强分离,从而解决了Frick、Hosseini和Vasileuski提出的问题。这促使我们对更强的下界度量——列表可复制性进行深入研究。我们通过两种组合度量(高度和最小星数)建立了列表可复制数的上界,并证明了基本复合结果:两个概念类的乘积的列表可复制数受限于这两个类列表可复制数之和。 |
| EvolveNav:面向零样本物体目标导航的主动预反思与自进化记忆 |
Qi Chai |
2026-06-16 |
PDF |
零样本目标导航(ZS-OGN)要求具身智能体在无任何预先训练的情况下探索并定位目标物体。为此,近期方法采用基础模型,但通常依赖静态先验知识且缺乏自适应能力,导致重复性错误和高成本的试错过程。本文提出一种自演进零样本目标导航框架,实现测试阶段的持续性能提升。具体而言,我们通过从历史轨迹中提取可操作知识构建智能规则记忆库,进而提出基于置信度上界的检索策略,通过平衡语义相关性与历史成功率筛选有效规则。此外,我们引入记忆引导的预判模块,在行动前预测潜在结果以减少低效探索。大量实验表明,本方法在减少不必要步骤的同时,将成功率提升10.1%,全面超越现有零样本基线方法。 |
| 自适应体积力学属性场分辨率不变性 |
Rishit Dagli |
2026-06-16 |
PDF |
精确的力学性能(或材料参数)——杨氏模量($E$)、泊松比($ν$)和密度($ρ$)——对于数字世界的可靠物理仿真至关重要,但大多数3D资产缺乏此类信息。我们提出AdaVoMP方法,能够为跨表征的输入3D对象预测精确的密集空间变化参数($E$、$ν$、$ρ$),在分辨率、精度和内存效率上均超越现有最优技术。该方法的核心是一种稀疏自适应体素结构SAV,可高效表征输入3D形状与材料场输出。我们将现有最精确方法VoMP的固定体素模型替换为新型稀疏Transformer编码器-解码器模型,该模型通过自回归方式为每个输入形状生成独特的SAV以表征其材料,实现的分辨率较现有技术提升$16^3$倍。实验表明,即使测试阶段计算量少于所有现有方法,AdaVoMP仍能估计出更精确的体积属性。这使得我们能够将高分辨率复杂3D对象转化为可直接用于仿真的资产,从而实现逼真的可变形仿真。 |