跳转至

arXiv 2026-06-22

标题 作者 发布日期 PDF链接 摘要
JanusMesh:通过跨空间去噪实现快速零样本3D视觉错觉生成 Siang-Ling Zhang 2026-06-18 PDF 创建3D视觉错觉——即单个3D网格从不同视角呈现截然不同的语义——是一项迷人但极具挑战的任务。现有基于优化的方法速度缓慢且易产生过饱和色彩,而简单的拼接方法则无法生成几何连贯的物体,导致出现明显的非自然接缝和语义泄露。本文提出了一种快速且无需训练的框架,用于生成文本驱动的3D视觉错觉。我们的方法将生成过程解耦为两个阶段:首先,提出跨空间双分支去噪流程,该流程动态地将3D潜在特征解码至体素空间,实现CLIP引导的方向对齐与符号距离场融合,确保无缝几何整合;其次,引入视角条件纹理合成模块,将特定视角的2D扩散先验投影并聚合至融合后的几何体上。大量实验表明,本方法仅需3-5分钟即可生成高度逼真的双语义3D错觉,在几何完整性、语义可识别性和效率上显著超越现有方法。项目页面:https://siang1105.github.io/JanusMesh.github.io/
TimeProVe:先提出,再验证,实现日常活动长视频的高效时间推理 Arkaprava Sinha 2026-06-18 PDF 长视频问答(LVQA)需要从长达数小时的未剪辑视频中识别稀疏的、与查询相关的证据。现有方法要么使用大型视觉语言模型(VLM)密集处理视频,导致计算成本过高,要么依赖基于稀疏字幕的推理,但常遗漏时间定位和运动中心的证据。我们提出TimeProVe,一种用于长视频时间定位推理的高性价比混合框架。TimeProVe首先使用轻量模块生成基于动作的答案-证据假设,随后仅针对目标验证调用昂贵的VLM。框架核心在于基于动作的候选证据(ACE)模块,该模块通过轻量LLM推理将时间定位的动作转化为查询条件化的候选答案及支撑证据窗口。我们进一步提出OpenTSUBench(OTB),一个用于评估真实日常生活活动(ADL)场景中时间定位推理能力的开放式基准。实验表明,TimeProVe在OTB上比最强基线提升7.3%,同时减少75%的VLM调用和93%的推理成本。此外,无需显式时间定位训练,TimeProVe在Charades-STA上即达到竞争性表现,结合定位VLM增强后更取得最优结果。
扩散Gemma的透明度如何? Joshua Engels 2026-06-18 PDF LLM推理透明度对于理解模型决策、减少误用和错位、调试异常模型行为至关重要。然而,DiffusionGemma在连续潜在空间中进行更大比例的计算,这是否会降低其推理透明度?我们通过将透明度分解为两个组成部分来研究这一问题:变量透明度,即我们是否理解模型计算状态的中间快照;以及算法透明度,即我们能否利用这些快照重建模型得出输出结果的过程。直观来看,DiffusionGemma的变量透明度较差:其不透明的序列深度(即可解释模型状态之间发生的序列计算量)最初比对应的自回归Gemma 4模型高出28.6倍。但我们证明,通过可解释的令牌瓶颈映射去噪步骤之间的信息流,可以在不降低下游性能的情况下实现。将这些中间状态视为可解释状态后,不透明序列深度降至仅为Gemma 4的1.1倍。对于扩散模型而言,算法透明度比自回归模型更难实现,因为画布中的所有令牌预测在每个去噪步骤中都可能发生变化,这使得模型能够在去噪过程中实现复杂的分布式算法。为弥合这一差距,我们开展了一系列可解释性案例研究,发现了非时序推理、令牌与序列模糊化、中间上下文推理等新型扩散特异性现象的初步证据。最后,我们测试了可监控性——这是透明度的一个关键应用,用于衡量模型输出对下游任务的有用性。我们发现DiffusionGemma与Gemma 4具有相似的可监控性。
UNIEGO:代理作为中介的统一自我中心视频表示学习 Wenhao Chi 2026-06-18 PDF 自我中心视频理解本质上受限于可穿戴摄像头的狭窄视角:单一视角、单一模态、单一模型无法捕捉人类动作的完整丰富性。我们认为,真正富有表现力的自我中心表征必须整合跨视角、跨模态和基础模型表征的互补知识,同时仍需仅从自我中心视频中即可部署。为此,我们引入了一种分层多教师蒸馏框架,该框架生成了UNIEGO——一个统一的自我中心编码器,其训练使用了涵盖自我-外部视角、RGB、深度和骨架模态的九位教师,以及四个基础模型。我们的框架并非直接从异构教师那里进行蒸馏(这些教师的不兼容架构和特征几何会导致梯度冲突),而是插入了一层特定于表征的代理模型,将多样化的教师知识转化为同质的自我中心空间。第二个蒸馏阶段——选择性代理蒸馏(SPD),则针对每个训练样本自适应地选择既正确又自信的代理子集,仅从可靠的监督信号中进行蒸馏,并抑制错误信号。SPD通过将UNIEGO初始化为代理参数的凸组合来进一步稳定,从而在蒸馏开始前将统一模型置于损失景观中条件良好的区域。UNIEGO在三个自我中心视频理解任务——动作识别、视频检索和动作分割上,在三个具有挑战性的自我-外部基准测试中均达到了最先进的性能,超越了朴素的多教师蒸馏基线,并证明了结构化、代理介导的知识迁移能够产生更丰富、更具判别力的自我中心表征。
最优确定性多校准与全知预测 Georgy Noarov 2026-06-18 PDF 一个模型在群组权重集合 $G$ 上满足多校准,当且仅当该模型是校准的——即在其预测条件下无偏——不仅整体上成立,而且在通过每个 $g \in G$ 对上下文重新加权后也成立。这一性质对许多下游应用非常有用,也是可信机器学习的基本要求。在此工作之前,所有已知能达到 $\varepsilon$-多校准的极小极大最优 $\widetilde O(\varepsilon^{-3})$ 样本复杂度率的预测器都是随机化的,而确定性预测器仅以显著更差的样本复杂度已知。随机化是否对多校准中的最优样本复杂度必要,这一问题由 [CLNR26] 明确提出,并在多项先前工作中隐含提及。我们通过给出一个输出确定性预测器的极小极大最优多校准算法,解决了这一开放问题。随后,我们将该算法推广,以生成满足关于有限或有限覆盖测试集合的结果不可区分性(OI)的最优确定性预测器。作为应用,这还给出了具有最优样本复杂度的确定性全能预测器和泛预测器,解决了 [OKK25] 和 [BHHLZ25] 提出的开放问题。
《方框思维:让真实图像中的3D编辑变得简单》 Pradhaan S Bhat 2026-06-18 PDF 文本和2D条件化接口在图像编辑中对空间变换的控制较弱且模糊,尤其在处理大范围物体运动和相机视角变化时。先前工作使用3D基元(如立方体)作为条件信号,但仅能指示物体大致位置而非具体变换。我们则采用3D立方体作为结构化规范:用户提供编辑前后的立方体参数,将编辑转化为一个适定的几何问题。这种"用立方体思考"的界面通过为每个立方体面赋予颜色编码以传达3D朝向,在保留场景与物体身份的同时,实现对真实图像中平移、旋转、缩放及视角变化的精确控制,并能恢复先前不可见的物体区域。为将变换锚定于场景外观,我们引入深度对齐的平面地板作为全局参考框架,并辅以深度感知的阴影渲染。基于此结构,图像生成器能在大幅变换下生成一致结果。通过两阶段训练(合成多物体场景与Objectron小规模真实视频),该方法可泛化至复杂野外真实图像。我们的方法直接作用于真实照片,在大幅3D编辑任务上显著超越近期最优方法。
为生成式推荐构建并标记化分布式用户兴趣上下文 Ruizhong Qiu 2026-06-18 PDF 生成式推荐是一种新兴范式,已在工业推荐系统中展现出潜力,旨在从用户历史行为中预测其下一次交互。该范式的核心是物品标记化,它连接了物品语义与推荐模型。然而,现有方法往往难以同时有效地组织并将复杂的用户行为与物品语义上下文注入推荐模型。一方面,现有的基于图的集成方法(如图序列化和图神经网络)要么存在可扩展性问题,要么仅利用局部图信息。另一方面,现有的语义标记化方法通常依赖启发式规则且缺乏显式监督信号,可能导致不准确或次优的语义表示。为解决用户兴趣上下文建模中的这些局限,我们提出G2Rec——一个可扩展的框架,将基于图的整体用户协同参与建模与语义标记化统一起来,适用于工业级生成式推荐。总体而言,G2Rec使推荐模型能够捕捉整体且具有语义基础的用户兴趣原型,无需真实用户兴趣标签,从而在工业序列推荐中提供更全面、更准确的用户行为上下文建模。跨产品表面的在线部署及在公开数据集上的大量实验表明,G2Rec优于现有方法。
令牌是群元素:论矩阵李群上的李代数注意力机制 Przemyslaw Musialski 2026-06-18 PDF 我们将注意力标记置于群上:一个标记是矩阵李群 $G$ 中的元素 $g_i$——这是一种纯粹的变换,没有特征载荷,也没有外部作用 $\rho(g)$ 来承载它。据我们所知,这是首个以纯矩阵李群元素作为标记的注意力构造:其分数是相对位姿的闭式代数范数,而非学习得到的核函数,并且它能够覆盖仿射全帧群,而所有基于不可约表示或满射指数的方法都必须排除这些群。我们将其称为李代数注意力。一旦标记成为群元素,后续过程便无需任何常规表示论机制。一对元素的相对几何是规范化的,即 $g_i^{-1} g_j$,因此成对不变量 $w_{ij} = \log(g_i^{-1} g_j)$ 是内在的而非人为设计的;在 $G$ 的对角作用下的等变性是显而易见的,且余循环条件自动成立。注意力分数为负的平方代数范数,即 $s_{ij} = -\
可预测性作为隐私的细粒度度量 Linda Lu 2026-06-18 PDF 差分隐私(DP)即便面对最强大的攻击者也能提供严格的个体级隐私保障,但其最坏情况特性可能导致高昂的隐私-准确性权衡。我们提出"基于可预测性的隐私"这一细粒度框架,该框架明确整合了攻击者的核心知识(由随机过程生成的已泄露数据集部分)以及指定的查询族。可预测性将隐私泄露量化为攻击者在观察算法输出后,对未知个体敏感信息预测能力的增量提升(相较于仅从已泄露数据中推断的信息)。研究表明,可预测性与差分隐私通常不可比较:两者可能分别呈现小值而对方为大值。但在仅剩一个个体未被泄露的最坏情况下,且所有二元查询均被视为敏感时,可预测性可推导出互信息差分隐私。更一般地,可预测性提供了针对特定敏感信息和特定攻击者模型的细粒度隐私度量。我们提出基于广义矩估计(GMM)的通用框架,用于分析当已泄露数据由平稳遍历混合过程生成时的渐近可预测性。基于该分析,我们为经验风险最小化(ERM)推导出可预测性校准的输出扰动方案。该方法与差分隐私互补,可与其协同使用以实现细粒度隐私控制。
当前世界模型缺乏持久状态核心 Jinpeng Lu 2026-06-18 PDF 世界模型正被日益视为通向通用人工智能的关键一步,但物理世界的建模远不止按需生成令人信服的帧画面:它需要一个随时间持续演化的内部世界状态,该状态与观测解耦,使得物体得以持续存在、事件得以自然完结——无论是否有摄像机在观测,正如月亮在无人注视时依然遵循轨道运行。这一要求是现有基准测试的盲区,它们奖励保真度、运动性和摄像机可控性等表面特性,却从不追问:当生成的世界不再被观测时,它是否仍在持续演化。我们提出\textbf{WRBench},这是首个将摄像机运动视为观测干预手段的系统性诊断基准,通过人类校准的评估链来判定:摄像机是否执行了要求的交互操作、场景在视野内是否保持连续可识别、以及返回的目标是否与已启动的事件保持一致性。在涵盖四种控制范式的23个模型生成的9,600个视频中,一个发现始终成立:当前系统将观测到的世界维持为跟踪镜头,返回的目标会停留在被遗弃时的状态,而非在未被观测期间推进事件演化。由于这一失败跨越控制范式、模型家族和规模增量,稳健的世界状态演化并非来自更清晰的图像、更精确的控制、更丰富的几何先验或单纯的参数规模。因此我们认为,物理状态内核的稳定性与视角干预下世界线的一致性应成为世界模型设计的首要目标,使世界模型真正捕捉世界将如何展开,而非下一帧画面如何呈现。