| Wat3R:无需标注的水下三维几何学习 |
Jiangwei Ren |
2026-07-09 |
PDF |
水下环境中的3D几何估计因光衰减、散射以及缺乏大规模高质量3D标注而面临独特挑战。现有开创性方法依赖大量密集标注,这在水下场景中难以实现。本文提出Wat3R——一种跨域半监督学习框架,旨在将前馈式3D重建模型从空气域适配至水下场景。独特之处在于,该方法采用教师-学生架构,无需任何水下标注数据,仅通过大量无标注真实水下视频素材即可学习鲁棒的几何表征。我们同时设计了跨视角一致性损失函数,利用其他视角的几何线索补偿当前视角因水体衰减和散射导致的信息退化。此外,针对缺乏综合评估基准的问题,我们构建了Water3D数据集——涵盖多种水体类型和水下场景的多样化数据集,专用于几何任务评估。实验结果表明,Wat3R在水下多视角深度估计和点云重建任务中均优于现有最优方法。数据集与代码已开源:https://github.com/LSXI7/Wat3R |
| ZipDepth:在任何设备上实现轻量级零样本单目深度估计 |
Fabio Tosi |
2026-07-09 |
PDF |
单目深度估计通过基础模型取得了显著进展,实现了鲁棒的零样本泛化能力,但其计算需求远超嵌入式与移动平台的承载能力。现有轻量级替代方案几乎完全在单域自监督范式下开发,在域迁移时会出现静默失效。我们提出ZipDepth——一种紧凑型单目深度网络,通过将高效可重参数化编码器-解码器与基于大规模多域训练集的基础模型知识蒸馏相结合,弥合了这一差距。该模型仅含610万参数,可在从服务器GPU到功耗受限设备上实现实时运行,在五个基准测试中实现了轻量级模型零样本精度与部署效率的最佳平衡,向参数规模大50倍的基础模型精度迈出了关键一步。 |
| LongE2V:基于视频扩散模型的长时域事件驱动视频重建、预测与帧插值 |
Cheng-De Fan |
2026-07-09 |
PDF |
从稀疏事件流中恢复高质量视频是一项具有挑战性的任务。回归方法常导致纹理模糊,而现有生成模型难以保持长期稳定性。我们提出LongE2V,一种利用预训练视频扩散先验联合处理事件视频重建、预测和帧插值的新方法。通过微调基础视频模型,我们的方法实现了高数据效率和卓越的感知质量。我们引入自回归展开与自适应上下文切换机制,以缓解超长序列中的时间漂移问题。同时提出基于交叉残差校正的重编码对齐策略,确保帧插值过程中的精确双向一致性。此外,事件体素密度增强技术保证了跨不同传感器分辨率的鲁棒性。在真实世界基准上的大量实验表明,LongE2V在三个任务中均优于现有最优方法,展现出卓越的时间连贯性和零样本泛化能力。项目页面:https://cdfan0627.github.io/LongE2V-page/ |
| 基于几何与梯度的全景室外重建分区方法 |
Weijian Chen |
2026-07-09 |
PDF |
将3D高斯泼溅(3DGS)扩展到大型户外场景在数据采集和计算方面成本高昂。采用等距柱状投影(ERP)的全景图像可通过其360°全视场角减少采集工作量,但由此产生的全向可见性使依赖局部相机视锥的现有分区策略失效,导致分块优化退化为全局训练。为此,我们提出PanoLOG——一种配备几何与梯度导向分区策略的两阶段由粗到精框架,专为大规模全景3DGS重建设计。在全局粗阶段,PanoLOG利用天空球建模和全景单目深度监督实现可靠几何结构;在精化阶段,G²PS通过视差驱动的不确定性构建自适应包围体,并基于梯度重要性评分分配相机。此外,我们构建了Pano360——首个面向户外场景重建的大规模全景数据集基准。大量实验表明,G²PS在保持可扩展块并行训练的同时实现了最先进的渲染质量。我们的模型、训练代码和数据集均已公开。 |
| UniClawBench:面向真实世界任务的主动型智能体通用基准测试 |
Zhekai Chen |
2026-07-09 |
PDF |
大型语言模型和多模态大语言模型的快速发展加速了能够操作日常工具并在真实环境中协助用户的主动智能体的涌现。然而,现有基准测试难以有效评估此类智能体,因为它们通常依赖沙盒环境和单轮评估范式。此外,其基于场景的任务分类法将多种模型能力混杂在同一任务类别中,导致难以定位智能体失败的根源。为解决这些局限,我们提出UniClawBench——首个面向动态真实环境、以能力驱动的主动智能体评估基准。UniClawBench围绕五项基础模型能力构建:技能使用、探索、长上下文推理、多模态理解与跨平台协调。基于这些能力,我们设计了400项双语真实世界任务。与依赖静态预录答案的现有基准不同,我们的基准通过细粒度、逐步完成的检查点在实时Docker容器中评估智能体。此外,我们设计了包含执行智能体、隐藏监督智能体和用户智能体的闭环评估策略,在不泄露评分标准的前提下模拟真实多轮人类反馈。为分离基础模型能力与框架级设计选择,我们在多种智能体框架下评估了最先进模型。通过模型与框架的全面对比,我们揭示了基础模型能力与智能体框架设计如何共同塑造真实环境中的表现。为促进未来研究,我们在https://github.com/HKU-MMLab/UniClawBench 公开了基准测试与代码。 |
| OPSD-V:面向训练后少步自回归视频生成器的在策略自蒸馏方法 |
Hongyu Liu |
2026-07-09 |
PDF |
我们提出OPSD-V,一种用于后训练少步自回归视频扩散模型的同策略自蒸馏范式。现有少步自回归视频生成器能以低延迟生成长视频,但在长自回归展开过程中仍存在误差累积和运动动态减弱的问题。OPSD-V在保留原始少步推理路径的同时减少了长时程退化。其核心思想是在训练中引入真实长视频数据作为时序上下文,并提供密集的轨迹级监督。具体而言,学生模型遵循精确的推理时展开过程,基于自身先前生成的KV缓存生成每个片段。与此同时,教师模型在学生模型访问的相同去噪状态下进行评估,但使用更干净的自回归一致性时序缓存——其中较旧的历史信息可被真实视频上下文替换。这在不改变采样器、去噪步数或推理时缓存机制的情况下,提供了同策略自回归缓存动态下的密集去噪级校正目标。我们将OPSD-V应用于代表性少步自回归视频模型,包括Self-Forcing和LongLive。实验表明,在视觉质量、运动动态和VBenchLong评分上均有一致提升。一项包含10名参与者、比较20组视频对的用户研究显示,OPSD-V在总体偏好判断中以66.0%的比率优于基础模型(排除平局时为82.5%)。 |
| 通过几何感知预训练增强上下文全景生成 |
Haoran Feng |
2026-07-09 |
PDF |
在本工作中,我们提出Canvas360,一个用于上下文全景生成的两阶段框架,结合了几何感知预训练与下游任务特定微调。为解决缺乏大规模高质量上下文全景任务训练数据的问题,我们提出Canvas360Dataset,包含100万对高质量全景样本,涵盖风格迁移、图像修复、外推和编辑,为多种上下文生成场景提供有效监督。在建模方面,Canvas360通过并行深度生成、速度循环填充和相似性损失正则化增强文本到全景生成,使模型学习几何感知表示、捕捉物体畸变细节,并提升几何一致性与全局连贯性。此外,借助强大的全景先验,Canvas360实现统一的上下文全景生成框架,通过token级拼接支持多种下游任务,在任务覆盖和建模灵活性上超越先前方法。大量实验表明,Canvas360提升了全景图像保真度,在全景专用FAED指标上表现尤为突出,并在报告的各项定量评估中取得具有竞争力或领先的结果。更多信息请访问项目页面:https://zry000.github.io/Canvas360/ |
| OpenCoF:通过视频生成学习推理 |
Xinyan Chen |
2026-07-09 |
PDF |
推理已成为大模型的核心能力,尤其在需要理解逻辑后果才能做出可靠决策时。近期视频生成模型提供了一条不同于传统思维链(CoT)的推理路径:推理可通过时间上连续的帧展开,即帧链(CoF)推理。然而,现有视频生成器主要基于通用视频语料库训练,仍缺乏针对CoF推理的多样化监督和专门设计。为填补这一空白,我们提出OpenCoF框架,包含覆盖11个任务族的推理视频数据集OpenCoF-17K,以及用于研究多样化时间监督是否改善CoF行为的微调视频模型Wan-CoF。在四个视频推理基准测试中,Wan-CoF相比Wan2.2-I2V-A14B基线取得了显著提升。在此基础上,我们通过实验探索了更先进的CoF能力设计,即为模型配备视觉和文本推理标记。该机制分别捕获用于空间和时间推理的低级视觉线索与高级语义先验。通过性能对比和注意力分析,我们研究了这些标记在模型深度、去噪步骤、空间和时间维度上的贡献。实验结果表明,更强的视频推理既需要广泛的时间监督,也需要组织中间推理状态的显式机制。我们开源了数据集、模型和代码,以促进面向推理的视频生成研究。 |
| 思想具有基因组:科学谱系推理与基于谱系的思想生成的基准测试 |
Yifan Zhou |
2026-07-09 |
PDF |
科学思想很少从零开始。它们继承机制、修补已知局限、重组前人成果,这与生物基因组高度相似。现有基准测试仍难以评估AI系统能否遵循这种继承结构。我们提出IdeaGene-Bench(IG-Bench),一个面向科学谱系推理与谱系驱动创意生成的基准测试。IG-Bench基于IdeaGene框架构建:每篇论文或提案被表示为最小化、带类型、有证据支撑的Idea基因组对象集合,通过GenomeDiff对齐这些对象,在六种操作演化动力学下记录继承、突变、丢失、外部引入和新插入。该基准包含1961条黄金谱系轨迹、1085个精选Idea基因组对象,以及920对跨10个科学领域的GenomeDiff记录。它支持两种评估:IG-Exam(42种任务类型,1029个实例)测试Idea基因组抽象、继承追踪、演化推理和谱系验证等封闭式谱系推理能力;IG-Arena通过谱系条件化的种群演化评分(PES)评估生成能力,判断提案能否作为给定谱系种群的连贯后代插入——它应继承正确的Idea基因组对象,与邻近工作产生有意义的差异,并为未来研究提供选择价值。在14个基于LLM的科学家的实验中,我们发现了组合瓶颈。最强系统在谱系推理上的精确准确率仅为27.3%,而结构化谱系上下文会重新排序系统排名,而非均匀地帮助所有参与者。 |
| 沿前向扩散的分数准确性不能保证扩散采样中的数值稳定性 |
Yiwei Zhou |
2026-07-09 |
PDF |
得分匹配在前向边缘分布下控制平均误差,但离散化的反向时间采样器会沿其自身轨迹评估学习到的得分。我们证明,较小的前向边缘误差并不能保证数值稳定性。我们构造了一个单一光滑得分场,其前向边缘$L^2$误差可任意小。学习到的反向时间过程非爆炸性、具有各阶矩,且可在路径空间全变差距离上任意接近精确反向时间过程。然而,其Euler-Maruyama离散化在概率意义下收敛,但每个正阶矩均发散。因此,即使所有Wasserstein距离$W_p$($p\ge1$)发散,弱收敛仍可能成立。同一失效现象可在固定有限神经架构内发生。我们构造一族有界、全局Lipschitz的去噪器,其前向边缘误差和路径空间全变差距离均趋于零,但Euler-Maruyama终点在每个$W_p$中发散。对于紧支撑数据,我们给出一个简单的正向结果。将学习到的去噪器投影到包含支撑的已知有界闭凸集上,可保持逐点精度、提供网格一致矩界,并在温和局部正则性下实现Wasserstein收敛。使用小型固定DiT风格网络的实验表明,沿罕见数值轨迹会出现大幅增长,而通过去噪器投影可抑制该增长,同时整体轨迹误差保持较小。 |