跳转至

arXiv 2026-06-19

标题 作者 发布日期 PDF链接 摘要
JanusMesh:通过跨空间去噪实现快速零样本3D视错觉生成 Siang-Ling Zhang 2026-06-18 PDF 创建3D视觉错觉——一个从不同视角呈现完全不同语义的单一3D网格——是一个迷人但极具挑战性的难题。现有基于优化的方法速度缓慢且易产生过饱和色彩,而简单的拼接方法则无法生成几何一致的物体,导致出现明显的非自然接缝和语义泄露。本文提出了一种快速且无需训练的文本驱动3D视觉错觉生成框架。我们的方法将生成过程解耦为两个阶段:首先,提出跨空间双分支去噪流程,该流程动态地将3D潜在编码解码到体素空间,用于CLIP引导的方向对齐和符号距离场混合,确保无缝几何融合;其次,引入视角条件纹理合成模块,将特定视角的2D扩散先验投影并聚合到融合后的几何体上。大量实验表明,我们的方法仅需3-5分钟即可生成高度逼真的双语义3D错觉,在几何完整性、语义可识别性和效率方面显著优于现有方法。项目页面:https://siang1105.github.io/JanusMesh.github.io/
TimeProVe:先提出,再验证,以实现日常活动长视频的高效时间推理 Arkaprava Sinha 2026-06-18 PDF 长视频问答(LVQA)需要在数小时未剪辑的视频中定位稀疏且与查询相关的证据。现有方法要么使用大型视觉语言模型(VLM)密集处理视频,导致计算成本过高,要么依赖基于稀疏字幕的推理,但常遗漏时间定位和运动中心的证据。我们提出TimeProVe,一种面向长视频时间定位推理的高效混合框架。TimeProVe首先使用轻量模块生成基于动作的答案-证据假设,随后仅在目标验证阶段调用昂贵的VLM。框架核心在于基于动作的候选证据(ACE)模块,该模块通过轻量级LLM推理,将时间定位的动作转化为查询条件化的候选答案及支撑证据窗口。我们进一步提出OpenTSUBench(OTB),一个用于评估真实日常生活活动(ADL)场景中时间定位推理能力的开放基准。实验表明,TimeProVe在OTB上比最强基线提升7.3%,同时减少75%的VLM调用和93%的推理成本。此外,无需显式时间定位训练,TimeProVe在Charades-STA上即达到竞争性表现,结合定位VLM增强后更取得当前最优结果。
扩散模型Gemma的透明度如何? Joshua Engels 2026-06-18 PDF LLM推理透明度对于理解模型决策、减少误用和错位、以及调试异常模型行为至关重要。然而,DiffusionGemma在连续潜在空间中执行了更大比例的计算——这是否降低了其推理透明度?我们通过将透明度分解为两个组成部分来研究这一问题:变量透明度(即我们能否理解模型计算状态的中间快照)和算法透明度(即我们能否利用这些快照重构模型得出输出的过程)。直观来看,DiffusionGemma的变量透明度较差:其不透明的序列深度(即可解释模型状态之间发生的串行计算量)最初看似比对应的自回归Gemma 4模型高出28.6倍。但我们证明,通过可解释的令牌瓶颈映射去噪步骤间的信息流动,可在不降低下游性能的前提下,将不透明序列深度降至仅为Gemma 4的1.1倍。扩散模型的算法透明度比自回归模型更难实现,因为画布中所有令牌预测在每个去噪步骤中都可能发生变化,使模型能够在去噪过程中实现复杂的分布式算法。为弥合这一差距,我们开展了一系列可解释性案例研究,发现了非时序推理、令牌与序列模糊化、中间上下文推理等新型扩散模型特有现象的初步证据。最后,我们测试了可监控性——这是透明度的关键应用,用于衡量模型输出对下游任务的有用性。我们发现DiffusionGemma与Gemma 4具有相似的可监控性。
UNIEGO:代理作为中介的统一自我中心视频表示学习 Wenhao Chi 2026-06-18 PDF 自我中心视频理解本质上受限于可穿戴摄像头的狭窄视角:单一视角、单一模态、单一模型无法捕捉人类动作的完整丰富性。我们认为,真正富有表现力的自我中心表征必须整合跨视角、跨模态和基础模型表征的互补知识,同时仍需仅从自我中心视频中即可部署。为此,我们引入了一个分层多教师蒸馏框架,生成UNIEGO——一个统一的自我中心编码器,由九位教师(涵盖自我-外部视角、RGB、深度和骨架模态)以及四个基础模型共同训练。我们的框架并非直接从异构教师处进行蒸馏(这些教师的不兼容架构和特征几何会导致梯度冲突),而是在中间插入一层表征特定的代理模型,将多样化的教师知识转化为同质的自我中心空间。第二阶段蒸馏——选择性代理蒸馏(SPD)——随后针对每个训练样本自适应地选择既正确又自信的代理子集,仅从可靠监督中蒸馏并抑制错误信号。SPD通过将UNIEGO初始化为代理参数的凸组合进一步稳定,使统一模型在蒸馏开始前处于损失景观的良好条件区域。UNIEGO在三个自我中心视频理解任务(动作识别、视频检索和动作分割)中,在三个具有挑战性的自我-外部基准上实现了最先进性能,优于朴素的多教师蒸馏基线,并证明了结构化、代理介导的知识迁移能够产生更丰富且更具判别力的自我中心表征。
最优确定性多校准与全知预测 Georgy Noarov 2026-06-18 PDF 如果一个模型在群体权重集合 $G$ 上实现了多校准,那么它不仅是整体上校准的(即预测条件无偏),而且在根据每个 $g \in G$ 对上下文进行重新加权后也是校准的。这一性质对许多下游应用非常有用,也是可信机器学习的基本要求。在此工作之前,所有已知能够达到 $\varepsilon$-多校准的极小极大最优样本复杂度 $\widetilde O(\varepsilon^{-3})$ 的预测器都是随机化的,而确定性预测器仅能以显著更差的样本复杂度实现。随机化是否对多校准的最优样本复杂度必要的问题,曾被 [CLNR26] 明确提出,并在多项先前工作中隐含提及。我们通过给出一个输出确定性预测器的极小极大最优多校准算法,解决了这一开放问题。随后,我们将该算法推广,以生成满足关于有限或有限覆盖测试集合的结果不可区分性(OI)的最优确定性预测器。作为应用,这还给出了具有最优样本复杂度的确定性全能预测器和泛预测器,解决了 [OKK25] 和 [BHHLZ25] 提出的开放问题。
《框内思考:让真实图像中的3D编辑变得简单》 Pradhaan S Bhat 2026-06-18 PDF 文本和2D条件化界面在图像编辑中对空间变换的控制较弱且模糊,尤其在处理大范围物体运动和相机视角变化时。先前研究使用三维基元(如立方体)作为条件信号,但仅能指示物体的大致位置,无法明确指定变换。我们则采用三维立方体作为结构化规范:用户提供编辑前后的输入与输出立方体,将编辑任务转化为一个适定的几何问题。这种"用立方体思考"的界面通过为每个立方体面赋予颜色编码以传达三维朝向,能够精确控制真实图像中的平移、旋转、缩放和视角变化,同时保留场景与物体身份,并恢复先前不可见的物体区域。为将变换锚定于场景外观,我们引入一个深度对齐的平面地板作为全局参考框架,并辅以深度感知的阴影线索。基于此结构,图像生成器能在大幅变换下产生一致的结果。通过两阶段训练(合成多物体场景与Objectron中少量真实世界视频),该方法可泛化至复杂的真实场景图像。我们的方法直接作用于真实照片,在大幅三维编辑任务中显著优于近期最先进方法。
为生成式推荐系统构建和标记化分布式用户兴趣上下文 Ruizhong Qiu 2026-06-18 PDF 生成式推荐是一种新兴范式,已在工业推荐系统中展现出潜力,旨在从用户历史行为中预测其下一次交互。生成式推荐的核心在于物品标记化,它连接了物品语义与推荐模型。然而,现有方法往往难以同时有效地组织并将复杂的用户行为与物品语义上下文注入推荐模型。一方面,现有的基于图的集成方法(如图序列化和图神经网络)要么存在可扩展性问题,要么仅能利用局部图信息。另一方面,现有的语义标记化方法通常依赖启发式规则,缺乏明确的监督信号,可能导致不准确或次优的语义表示。为解决用户兴趣上下文建模中的这些局限,我们提出G2Rec,这是一个可扩展的框架,将基于图的整体用户协同参与建模与语义标记化统一起来,适用于工业级生成式推荐。总体而言,G2Rec使推荐模型能够捕捉整体且语义基础扎实的用户兴趣原型,无需依赖真实用户兴趣,从而在工业序列推荐中提供更全面、更准确的用户行为上下文建模。跨产品表面的在线部署及在公开数据集上的大量实验表明,G2Rec优于现有方法。
令牌是群元素:论矩阵李群上的李代数注意力机制 Przemyslaw Musialski 2026-06-18 PDF 我们将注意力令牌置于群上:令牌是矩阵李群$G$中的元素$g_i$——一种纯粹的变换,没有特征载荷,也没有外部作用$\rho(g)$承载它。据我们所知,这是首个以纯矩阵李群元素为令牌的注意力结构:其分数是相对位姿的闭式代数范数,而非学习核函数,并且它能覆盖仿射全帧群——所有基于不可约表示或满射指数方法都必须排除的群。我们称之为李代数注意力。一旦令牌成为群元素,后续过程便无需任何常规表示论工具。一对元素的相对几何是规范化的,即$g_i^{-1} g_j$,因此成对不变量$w_{ij} = \log(g_i^{-1} g_j)$是内在的而非人为设计的;对角$G$作用下的等变性是自明的,且上循环条件自动满足。注意力分数为负的平方代数范数$s_{ij} = -\
可预测性作为隐私的细粒度度量 Linda Lu 2026-06-18 PDF 差分隐私(DP)即便面对最强大的攻击者也能提供严格的个体级隐私保障,但其最坏情况特性可能导致高昂的隐私-准确性权衡。我们提出"基于可预测性的隐私"这一细粒度框架,该框架明确纳入攻击者的核心知识(由随机过程生成的数据集中已泄露部分)及特定查询族。可预测性将隐私泄露量化为攻击者在观察算法输出后,对未知个体敏感信息预测能力的增量提升(相较于仅凭已泄露数据所能推断的信息)。研究表明,可预测性与差分隐私通常不可比较:二者可分别呈现小值而对方为大值。但在仅剩一个体未泄露的最坏场景下,且所有二元查询均被视为敏感时,可预测性可推导出互信息差分隐私。更广泛而言,可预测性为特定敏感信息与特定攻击者模型提供了更细粒度的隐私度量。我们提出基于广义矩估计(GMM)的通用框架,用于分析当已泄露数据由平稳遍历混合过程生成时的渐近可预测性。基于该分析,我们为经验风险最小化(ERM)推导出可预测性校准的输出扰动方案。本方法与差分隐私互补,可与其协同实现细粒度隐私控制。
当前世界模型缺乏持久状态核心 Jinpeng Lu 2026-06-18 PDF 世界模型正被越来越多地视为迈向通用人工智能的关键一步,然而对物理世界的建模远不止按需生成令人信服的帧画面:它需要一个独立于观测、随时间持续演化的内部世界状态,使得物体能够持久存在、事件能够自然推进至终结——无论是否有摄像头在记录,正如月亮在无人注视时仍会沿轨道运行。这一要求是现有基准测试的盲区,它们奖励保真度、运动轨迹和相机可控性等表面特性,却从未追问:当世界不再被观测时,它是否仍在持续演化。我们提出\textbf{WRBench},首个将相机运动视为观测干预手段的系统性诊断基准,通过人类校准的评估链来检验:相机是否执行了要求的交互操作、场景在视野内是否保持连续可辨识、以及返回的目标是否与已启动的事件状态保持一致。在涵盖四种控制范式的23个模型生成的9600个视频中,一个发现始终顽固存在:当前系统仅将观测到的世界维持为跟踪镜头,当返回目标时,它恢复的是被遗弃时的状态,而非在未被观测期间持续推进事件。由于这一失败跨越控制范式、模型家族和规模增量,更清晰的图像、更精准的控制、更丰富的几何先验或单纯的参数数量增长都无法带来稳健的世界状态演化。因此我们认为,物理状态核的稳定性与视角干预下世界线的一致性应成为世界模型设计的首要目标——让世界模型捕捉世界将如何展开,而非下一帧画面如何呈现。