| 具有隐式和显式几何结构的3D感知视觉语言模型 |
Wenhao Li |
2026-07-23 |
PDF |
尽管取得了快速进展,大多数基于2D视觉输入构建的现有视觉语言模型在处理需要细粒度空间理解与推理的各类3D任务时仍面临挑战。为弥合这一差距,我们提出VLM-IE3D——一个通过赋予模型从RGB视频中学习的隐式与显式3D几何结构来增强其3D空间感知能力的统一框架。我们的VLM-IE3D引入了隐式几何标记(IGTs)以捕获输入视频中的高层几何先验,同时引入互补的显式几何标记(EGTs)以编码从重建3D属性中提取的详细几何结构。在此基础上,VLM-IE3D配备了一个3D感知适配器,能有效融合这两类几何表征与2D视觉线索。这种仅基于RGB的设计为细粒度空间理解与推理注入了强大的3D归纳偏置,且无需任何额外3D输入。大量实验表明,VLM-IE3D在包括3D视频检测、3D视觉定位、3D密集描述和空间推理在内的多种3D任务上持续取得卓越性能。代码与模型已开源至https://github.com/Vegetebird/VLM-IE3D。 |
| 流式多智能体自回归扩散模型与世界状态寄存器 |
Sicheng Mo |
2026-07-23 |
PDF |
多智能体交互式世界模型不仅需要生成一致的观测结果,还需维护跨智能体持久存在且随视角演化的世界状态。现有自回归视频扩散管道将观测历史作为条件上下文传递,这使得在多智能体与多视角场景中难以维护共享状态。我们提出WorldWeaver (W^2),一种流式多智能体视频扩散模型,通过跨智能体世界状态寄存器增强生成过程:这些可学习令牌存储共享世界信息、追踪个体智能体状态,并在每个生成片段后动态更新。我们通过涵盖个体智能体状态、全局视角(包括鸟瞰图)及场景文本的监督信号来锚定这些寄存器。进一步采用混合Transformer架构改进模型,使用独立权重分别处理世界状态建模与视觉帧建模。在双智能体Minecraft视频生成的大量实验表明,显式世界状态建模提升了逻辑一致性与生成质量。 |
| 统一视频密集预测:基于非关联数据 |
Yihong Sun |
2026-07-23 |
PDF |
场景理解需要同时预测几何、外观和语义属性。然而,现有的任务特定标注分散于互不兼容的领域特定数据集中。当前统一系统通过限制训练仅使用完全共同标注的数据,或承担伪标签生成的高昂计算成本来规避这一问题。为此,我们提出UniD——一个统一视频模型,可联合预测八种密集场景属性(深度、表面法向量、语义分割、边界、人体部件、反照率、光照与材质),所有属性均从互不关联的领域特定数据集中学习。我们提出一种简洁高效的蒸馏策略:通过轻量级任务投影器,让各任务专家监督统一骨干网络,从而消除对标注重叠或伪标签的需求。核心洞察在于:预训练扩散模型强大的视觉先验足以弥合分散训练源带来的领域差异,使模型能够对训练中从未见过的场景-任务组合实现稳健泛化。UniD在单任务专家模型与多任务基线中均取得竞争性表现,对分布外场景具有强泛化能力,并展现出更优的时间一致性与跨任务一致性。代码与视频结果见https://unid-video.github.io/。 |
| 通过渐进式种子剪枝实现扩散模型的推理时缩放 |
Rogerio Guimaraes |
2026-07-23 |
PDF |
扩散模型与流匹配模型主导了条件图像生成领域,然而这些模型的推理时扩展技术远不如自回归语言模型成熟。由于最终质量对初始噪声种子高度敏感,许多方法将额外计算用于黑盒奖励下的种子搜索或重采样,但推理过程中通常保持恒定内存占用。我们证明放宽这一约束可开辟一个未被充分探索的推理时扩展维度:通过前置探索、早期评估大量种子并激进剪枝,我们能够更有效地利用固定计算预算。渐进式种子剪枝(PSP)对中间去噪估计进行评分,逐步缩小候选集,使得仅有前景轨迹被完整去噪,同时保持模型评估总数不变。在扩散与流匹配骨干网络上,PSP持续提升奖励引导选择效果,在匹配计算量的条件下,相比最佳N选、重要性采样和树搜索基线,在GenEval评分(自动化)和人工评估的提示对齐性上均取得更优表现。项目页面:https://www.vision.caltech.edu/psp。代码:https://github.com/rogerioagjr/psp。 |
| 扩展流图 |
Sophia Tang |
2026-07-23 |
PDF |
基于流的生成模型在连续和离散状态空间中的快速可控生成方面取得了显著进展,但现有参数化方法受限于固定维度或固定序列长度。本文提出扩展生成流(EFlows),通过沿扩展插值器定义维度递增分布间的流,该插值器通过添加条件噪声来扩展状态空间。基于此构建,我们提出扩展流映射(EFMs)——一类新型流映射,可将扩展插值器蒸馏为高效少步生成模型。每个EFM将任意两个时间步间的映射分解为两个可学习操作:扩展算子(基于当前状态用新坐标或标记扩充状态空间)与传输映射(沿插值器推动扩展状态前进)。组合这些算子可生成同时扩展和去噪状态的单一映射,当扩展算子为单位映射时,可还原现有固定画布流与流映射。我们进一步将该框架扩展至离散单纯形,实现可变规模图生成与可变长度序列生成。在连续与离散模态中,我们确立EFlows与EFMs作为输出规模本身成为可学习可控自由度场景下的基础框架。 |
| 战略性扩展规模:通过偏差感知评估与数据收集实现机器人操作的组合泛化 |
Yu Qi |
2026-07-23 |
PDF |
组合泛化能力对于机器人遵循多样化指令至关重要。然而,预训练策略存在走捷径的倾向,即依赖显著线索而非语言理解。我们提出了一种诊断框架,将这种失败归因于单个指令因子(例如颜色、动词、物体、尺寸和空间属性等可复用语义组件)。该框架形式化了指令因子偏差——微调策略过度依赖主导因子作为捷径的倾向,并通过两个指标量化:因子主导率(FDR)捕捉因子间的成对偏差,因子主导层级(FDH)将其聚合为全局排序。对六种基础策略的评估揭示了广泛一致的排序,即颜色 ≥ 物体 ≥ 空间 ≥ 动词 ≥ 尺寸,其中颜色占主导地位,而动词和尺寸最缺乏语言基础。我们进一步证明该诊断具有可操作性:一种偏差感知数据收集策略,将固定预算重新分配给语言基础薄弱的因子,在仿真和真实机器人实验中仅需一半演示数据即可超越基线方法,从而实现更高效且更具泛化能力的策略学习。 |
| GraphVid:交互式图可控视频生成 |
Vedant Shah |
2026-07-23 |
PDF |
可控视频生成仍具挑战,主要难点在于:文本提示或运动控制输入主要约束像素移动,难以精确指定多物体交互。实际应用中,基于轨迹的控制常要求用户为多个物体绘制精确路径,这随场景复杂度增加而扩展性变差,且在遮挡或重叠情况下变得模糊。为实现灵活且精确的多主体控制,我们提出GraphVid——一种基于图条件的图像到视频生成模型,通过结构化交互图实现交互式控制。我们还构建了GraphVid-Bench,这是一个大规模以交互为中心的视频数据集,包含结构化关系标注,用于训练具备交互感知能力的视频生成模型。尽管使用的训练数据和可训练参数远少于先前的运动控制方法,GraphVid仍展现出强大的可控性和视频质量。与Motion-I2V相比,GraphVid将FID降低最多39.9%,FVD降低37.6%,同时提升PSNR(9.87→15.98)和SSIM(0.38→0.61)。我们的结果凸显了结构化语义接口作为可控视频生成强大范式的潜力。 |
| Barzilai-Borwein方法在每一个维度$n\geq 4$的二次型开集上无法实现超线性收敛。 |
Dawei Li |
2026-07-23 |
PDF |
Barzilai-Borwein (BB)方法在连续优化中展现出强大的实际性能,但其收敛动力学机制仍未被充分理解。特别地,一个核心未解问题是:对于几乎所有的严格凸二次问题及初始点,BB方法是否都能实现超线性收敛?我们对此问题给出了否定答案。具体而言,对于任意有限维度$n\geq4$,我们构造了一个非空开集(因此具有正勒贝格测度)的严格凸二次问题族及初始点,使得长Barzilai-Borwein方法(BB1)虽收敛,但无法达到根超线性收敛。更精确地,在显式常数$\rho_{\min}=10^{-6},\rho_{\max}=0.61$下,梯度的每个谱分量均被对应的几何序列上下界约束。因此,梯度范数和误差的能量范数满足相同速率的双边几何估计,而目标间隙满足平方速率的对应估计。特别地,这三个量均被几何序列下界约束,从而排除了超线性收敛的可能性。该构造高度非平凡,基于对四维投影化BB动力学中非共振吸引七周期轨道的计算机辅助证明。 |
| 用于凹版印刷质量控制自动化的合成数据生成框架 |
Korota Arsène Coulibaly |
2026-07-23 |
PDF |
印刷质量控制,尤其是凹版印刷,仍依赖缓慢、昂贵且主观的人工检测。自动表面缺陷检测对于维持凹版印刷的高质量标准至关重要。深度学习模型为自动化提供了前景。然而,训练YOLO或Vision Transformers等稳健的深度学习模型,严重受限于真实工业缺陷图像的极度匮乏。为克服这一局限,本文提出了一种专为凹版印刷质量控制设计的新型合成数据生成框架。该流程可自动生成特定印刷缺陷(折痕、条纹、套印不准等)的高保真图像,并输出对应的边界框和标注。为验证该框架,生成了包含7533张图像的合成数据集,并用于训练最先进的目标检测模型RFDETR。实验结果表明,基于合成数据训练的模型在真实工业测试样本上达到了80.9%的平均精度均值(mAP)。该框架为印刷生产线缺陷检测自动化提供了零成本、快速部署的解决方案,无需大量人工数据采集。 |
| 从视频中自监督学习结构化动力学 |
Lukas Knobel |
2026-07-23 |
PDF |
理解视频中的运动是视觉学习的一项基本挑战,因为帧间变化交织着两种动态来源:相机运动与物体运动。这种分解在表征学习中尚未得到充分探索,部分原因在于自然视频中这些因素紧密耦合且难以单独监督。然而,恢复这种分解对于学习能够区分有意义物体动态与相机诱导变化的鲁棒运动表征至关重要。我们研究能否从预训练图像视觉Transformer的冻结特征中恢复此类结构化运动表征。为此提出结构化动态模型(SDM),通过未来特征预测显式分离时间变化的主导来源与残余动态,而非使用单一纠缠潜变量或无结构、空间密集的过渡令牌来表示视频变化。训练结合了真实视频的自监督学习与合成Kubric数据中场景动态的弱监督。我们在ProbeMotion(一个涵盖合成与真实视频中相机运动、物体运动及组合动态的新评估套件)上评估SDM。SDM在使用全局CLS或平均池化特征时优于骨干基线,并在多个探针任务中与VGGT等强监督表征相比表现更优,尽管其监督信号显著更弱。这些结果表明,预训练图像模型可被便捷地重新用于结构化视频动态表征,为学习与分析潜在视频动态提供有用的归纳偏置。 |