跳转至

arXiv 2026-07-10

标题 作者 发布日期 PDF链接 摘要
Wat3R:无需标注的水下三维几何学习 Jiangwei Ren 2026-07-09 PDF 水下环境中的3D几何估计因光衰减、散射以及缺乏大规模高质量3D标注而面临独特挑战。现有开创性方法依赖大量密集标注,这在水下场景中难以实现。本文提出Wat3R——一种跨域半监督学习框架,旨在将前馈式3D重建模型从空气域适配至水下场景。该方法独特之处在于无需任何水下标注数据,通过教师-学生架构仅利用大量无标注真实水下视频素材即可学习鲁棒的几何表征。我们同时设计了跨视角一致性损失函数,利用其他视角的几何线索补偿当前视角因水体衰减和散射导致的信息退化。此外,针对缺乏综合评估基准的问题,我们构建了Water3D数据集——涵盖多种水体类型和水下场景的多样化数据集,专用于几何任务评估。实验结果表明,Wat3R在水下多视角深度估计和点云重建任务中均优于现有最优方法。数据集与代码已开源:https://github.com/LSXI7/Wat3R
ZipDepth:在任何设备上实现轻量级零样本单目深度估计 Fabio Tosi 2026-07-09 PDF 单目深度估计通过基础模型取得了显著进展,实现了鲁棒的零样本泛化能力,但其计算需求远超嵌入式及移动平台的承载能力。现有轻量级替代方案几乎完全局限于单域自监督范式,在域迁移时会出现静默失效。我们提出ZipDepth——一种紧凑型单目深度网络,通过将高效可重参数化编码器-解码器与基于大规模多域训练集的基础模型知识蒸馏相结合,弥合了这一鸿沟。该模型仅含610万参数,可在从服务器GPU到功耗受限设备上实现实时运行,在五个基准测试中实现了轻量级模型零样本精度与部署效率的最佳平衡,向参数规模大50倍的基础模型精度迈出了关键一步。
LongE2V:基于视频扩散模型的长时域事件驱动视频重建、预测与帧插值 Cheng-De Fan 2026-07-09 PDF 从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法常导致纹理模糊,而现有生成模型难以保持长期稳定性。我们提出LongE2V,一种利用预训练视频扩散先验联合处理事件驱动视频重建、预测和帧插值的新方法。通过微调基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入自回归展开与自适应上下文切换机制,以缓解超长序列中的时间漂移问题。同时提出基于交叉残差校正的重编码对齐方法,确保帧插值过程中的精确双向一致性。此外,事件体素密度增强技术保证了跨不同传感器分辨率的鲁棒性。在真实世界基准上的大量实验表明,LongE2V在三个任务上均优于现有最优方法,展现出卓越的时间连贯性和零样本泛化能力。项目页面:https://cdfan0627.github.io/LongE2V-page/
基于几何与梯度的全景室外重建分区方法 Weijian Chen 2026-07-09 PDF 将3D高斯泼溅(3DGS)扩展到大型户外场景在数据采集和计算方面成本高昂。采用等距柱状投影(ERP)的全景图像可通过其完整的360°视场减少采集工作量,但由此产生的全向可见性使得依赖局部相机视锥的现有分区策略失效,导致分块优化退化为全局训练。为此,我们提出PanoLOG——一种配备几何与梯度导向分区策略(G²PS)的两阶段由粗到精框架,专为大规模全景3DGS重建设计。在全局粗阶段,PanoLOG利用天空球建模和全景单目深度监督实现可靠几何结构;在精化阶段,G²PS通过视差驱动的不确定性构建自适应包围体,并基于梯度重要性评分分配相机。此外,我们构建了Pano360——首个面向户外场景重建的大规模全景数据集基准。大量实验表明,G²PS在保持可扩展分块并行训练的同时实现了最先进的渲染质量。我们的模型、训练代码和数据集均已公开。
UniClawBench:面向真实世界任务的主动型智能体通用基准测试 Zhekai Chen 2026-07-09 PDF 大型语言模型和多模态大型语言模型的快速发展加速了能够操作日常工具并在真实环境中协助用户的主动智能体的出现。然而,现有基准测试难以有效评估此类智能体,因为它们通常依赖沙盒环境和单轮评估范式。此外,其基于场景的任务分类法将多种模型能力混杂在同一任务类别中,导致难以定位智能体失败的根源。为解决这些局限,我们提出UniClawBench——首个面向动态真实环境、以能力驱动的主动智能体评估基准。UniClawBench围绕五项基础模型能力构建:技能使用、探索、长上下文推理、多模态理解与跨平台协调。基于这些能力,我们设计了400项双语真实世界任务。与依赖静态预录答案的现有基准不同,我们的基准在实时Docker容器中通过细粒度、逐步完成的检查点评估智能体。此外,我们设计了包含执行智能体、隐藏监督智能体和用户智能体的闭环评估策略,在不泄露评分标准的前提下模拟真实的多轮人类反馈。为解耦基础模型能力与框架级设计选择,我们在多种智能体框架下评估了最先进模型。通过模型与框架的全面对比,我们揭示了基础模型能力与智能体框架设计如何共同影响真实环境中的表现。为促进未来研究,我们在https://github.com/HKU-MMLab/UniClawBench公开了基准测试与代码。
OPSD-V:用于训练后少步自回归视频生成器的在策略自蒸馏方法 Hongyu Liu 2026-07-09 PDF 我们提出OPSD-V,一种用于后训练少步自回归视频扩散模型的同策略自蒸馏范式。现有少步自回归视频生成器能以低延迟生成长视频,但在长自回归展开过程中仍存在误差累积和运动动态减弱的问题。OPSD-V在保持原始少步推理路径的同时减少了长时程退化。其核心思想是在训练中引入真实长视频数据作为时序上下文,并提供密集的轨迹级监督。具体而言,学生模型遵循精确的推理时展开过程,基于自身先前生成的KV缓存生成每个片段。与此同时,教师模型在学生访问的相同去噪状态下进行评估,但使用更干净的自回归一致性时序缓存——其中较旧的历史记录可由真实视频上下文替换。这在不改变采样器、去噪步数或推理时缓存机制的情况下,提供了同策略自回归缓存动态下的密集去噪级校正目标。我们将OPSD-V应用于代表性少步自回归视频模型,包括Self-Forcing和LongLive。实验表明,在视觉质量、运动动态和VBenchLong评分上均有一致提升。一项包含10名参与者、比较20组视频对的用户研究显示,OPSD-V在66.0%的整体偏好判断中优于基础模型(排除平局时为82.5%)。
通过几何感知预训练增强上下文全景生成 Haoran Feng 2026-07-09 PDF 在本工作中,我们提出了Canvas360,一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与下游任务特定微调。为解决缺乏大规模高质量上下文全景任务训练数据的问题,我们构建了Canvas360Dataset,包含100万对高质量全景样本,覆盖风格迁移、图像修复、外扩和编辑任务,为多种上下文生成场景提供有效监督。在建模方面,Canvas360通过并行深度生成、速度循环填充和相似性损失正则化增强文本到全景生成能力,使模型学习几何感知表征、捕捉物体畸变细节,并提升几何一致性与全局连贯性。此外,借助强大的全景先验,Canvas360实现了统一的上下文全景生成框架,通过token级拼接支持多种下游任务,在任务覆盖范围和建模灵活性上超越先前方法。大量实验表明,Canvas360提升了全景图像保真度,在全景专用FAED指标上表现尤为突出,并在多项定量评估中取得领先或具有竞争力的结果。更多信息请访问项目页面:https://zry000.github.io/Canvas360/
OpenCoF:通过视频生成学习推理 Xinyan Chen 2026-07-09 PDF 推理已成为大模型的核心能力,尤其在需要理解逻辑后果才能做出可靠决策时。近期视频生成模型提供了一种不同于传统思维链(CoT)的推理路径:推理可以通过时间上连续的帧展开,即帧链(CoF)推理。然而,现有视频生成器主要基于通用视频语料库训练,仍缺乏针对CoF推理的多样化监督和专门设计。为解决这一差距,我们提出OpenCoF框架,包含覆盖11个任务族的推理视频数据集OpenCoF-17K,以及用于研究多样化时间监督是否改善CoF行为的微调视频模型Wan-CoF。在四个视频推理基准测试中,Wan-CoF相比Wan2.2-I2V-A14B基线取得了显著提升。在此基础上,我们通过实证探索了更先进的CoF能力设计,即为模型配备视觉和文本推理标记。该机制分别捕捉用于空间和时间推理的低层视觉线索与高层语义先验。通过性能对比和注意力分析,我们考察了这些标记在模型深度、去噪步骤、空间和时间维度上的贡献。实验结果表明,更强的视频推理既需要广泛的时间监督,也需要组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进面向推理的视频生成研究。
思想有基因组:科学谱系推理与谱系基础的思想生成的基准测试 Yifan Zhou 2026-07-09 PDF 科学思想很少从零开始。它们继承机制、修补已知局限、重组前人工作片段,这与生物基因组高度相似。现有基准测试仍难以评估AI系统能否遵循这种继承结构。我们提出IdeaGene-Bench(IG-Bench),一个面向科学谱系推理与谱系驱动思想生成的基准测试。IG-Bench围绕IdeaGene框架构建:每篇论文或提案被表示为最小化、带类型、有证据支撑的Idea Genome对象集合,通过GenomeDiff对齐这些对象,记录六种操作演化动力学下的继承、突变、丢失、外部引入和新插入。该基准包含1961条黄金谱系轨迹、1085个经人工整理的Idea Genome对象,以及920对跨10个科学领域的GenomeDiff记录。它支持两种评估:IG-Exam(42种任务类型,1029个实例)测试封闭式谱系推理,涵盖Idea Genome抽象、继承追踪、演化推理和谱系验证;IG-Arena通过谱系条件化的种群演化评分(PES)评估生成能力,判断提案能否作为给定谱系种群的一致后代插入——它应继承正确的Idea Genome对象,与邻近工作产生有意义的差异,并为未来研究提供选择价值。对14个基于LLM的科学家的实验揭示了组合瓶颈:最强系统在谱系推理上仅达到27.3%的精确准确率,且结构化谱系上下文会重新排序系统排名,而非均匀提升所有参与者。
沿前向扩散的分数准确性并不能保证扩散采样中的数值稳定性。 Yiwei Zhou 2026-07-09 PDF 得分匹配在前向边际分布下控制平均误差,但离散化的反向时间采样器会沿其自身轨迹评估学习到的得分。我们证明,较小的前向边际误差并不能保证数值稳定性。我们构造了一个光滑的得分场,其前向边际$L^2$误差可任意小。学习到的反向时间过程非爆炸性、具有各阶矩,且在路径空间全变差距离上可任意接近精确反向时间过程。然而,其Euler--Maruyama离散化在概率意义下收敛,但每个正阶矩均发散。因此,即使所有Wasserstein距离$W_p$($p\ge1$)发散,弱收敛仍可能成立。同一固定有限神经架构内也可能出现此类失效。我们构造了一族有界、全局Lipschitz的去噪器,其前向边际误差和路径空间全变差距离均趋于零,但Euler--Maruyama端点在每个$W_p$中发散。对于紧支撑数据,我们给出一个简单的正面结果:将学习到的去噪器投影到包含支撑的已知有界闭凸集上,可保持逐点精度、提供网格一致矩界,并在温和局部正则性下实现Wasserstein收敛。使用小型固定DiT风格网络的实验表明,罕见数值轨迹上会出现大幅增长,而去噪器投影可抑制该增长,同时整体轨迹误差保持较小。