跳转至

arXiv 2026-06-21

标题 作者 发布日期 PDF链接 摘要
JanusMesh:通过跨空间去噪实现快速零样本3D视错觉生成 Siang-Ling Zhang 2026-06-18 PDF 创建3D视觉错觉——一个从不同视角呈现完全不同语义的单一3D网格——是一项迷人但极具挑战的任务。现有基于优化的方法速度缓慢且易产生过饱和色彩。相比之下,简单的拼接方法无法生成几何一致的物体,导致出现明显的非自然接缝和语义泄露。本文提出一种快速且无需训练的框架,用于生成文本驱动的3D视觉错觉。我们的方法将生成过程解耦为两个阶段。首先,我们提出跨空间双分支去噪流程,该流程动态地将3D潜在特征解码到体素空间,用于CLIP引导的方向对齐和符号距离场融合,确保无缝几何融合。其次,我们引入视图条件纹理合成模块,将特定视角的2D扩散先验投影并聚合到融合后的几何体上。大量实验表明,我们的方法仅需3-5分钟即可生成高度逼真的双语义3D错觉,在几何完整性、语义可识别性和效率方面显著优于现有方法。项目页面:https://siang1105.github.io/JanusMesh.github.io/
TimeProVe:先提出,再验证,实现日常活动长视频时间推理的高效处理 Arkaprava Sinha 2026-06-18 PDF 长视频问答(LVQA)需要从长达数小时的未剪辑视频中识别稀疏且与查询相关的证据。现有方法要么使用大型视觉语言模型(VLM)对视频进行密集处理,导致计算成本过高,要么依赖基于稀疏字幕的推理,这往往会遗漏时间定位和运动中心的证据。我们提出TimeProVe,一种用于长视频时间定位推理的成本高效混合框架。TimeProVe首先使用轻量级模块生成基于动作的答案-证据假设,随后仅调用昂贵的VLM进行针对性验证。该框架的核心在于基于动作的候选证据(ACE)模块,该模块通过轻量级LLM推理将时间定位的动作转化为查询条件化的候选答案和支持证据窗口。我们进一步提出OpenTSUBench(OTB),一个用于评估真实世界日常生活活动(ADL)场景中时间定位推理的开放式基准。实验表明,TimeProVe在OTB上比最强基线高出7.3%,同时将VLM调用减少75%,推理成本降低93%。此外,在没有显式时间定位训练的情况下,TimeProVe在Charades-STA上取得了具有竞争力的性能,并在结合定位VLM增强后达到最先进水平。
扩散Gemma的透明度如何? Joshua Engels 2026-06-18 PDF LLM推理透明度对于理解模型决策、减少误用与对齐问题、以及调试异常模型行为至关重要。然而,DiffusionGemma在连续潜在空间中完成了更大比例的计算——这是否会降低其推理透明度?我们通过将透明度分解为两个维度来研究这一问题:变量透明度(即能否理解模型计算状态的中间快照)和算法透明度(即能否利用这些快照重构模型输出结果的生成过程)。直观来看,DiffusionGemma的变量透明度较差:其不透明序列深度(即可解释模型状态之间发生的串行计算量)最初看似比对应的自回归Gemma 4模型高出28.6倍。但我们证明,通过可解释的token瓶颈映射去噪步骤间的信息流,可在不降低下游性能的前提下,将不透明序列深度降至仅为Gemma 4的1.1倍。对扩散模型而言,算法透明度比自回归模型更具挑战性,因为画布中所有token预测在每个去噪步骤中都可能发生变化,这使得模型能够在去噪过程中实现复杂的分布式算法。为弥合这一差距,我们开展了一系列可解释性案例研究,发现了非时序推理、token与序列模糊化、中间上下文推理等新型扩散模型特有现象的初步证据。最后,我们测试了可监控性——这是透明度的重要应用,用于衡量模型输出对下游任务的有效性。结果表明DiffusionGemma与Gemma 4具有相似的可监控性。
UNIEGO:代理作为中介的统一自我中心视频表示学习 Wenhao Chi 2026-06-18 PDF 自我中心视频理解本质上受限于可穿戴摄像头的狭窄视角:单一视角、单一模态、单一模型无法捕捉人类行为的全部丰富性。我们认为,真正富有表现力的自我中心表征必须整合跨视角、跨模态和基础模型表征的互补知识,同时仍需仅从自我中心视频中即可部署。为此,我们引入了一种分层多教师蒸馏框架,生成了UNIEGO——一个统一的自我中心编码器,该编码器通过九位教师(涵盖自我-外部视角、RGB、深度和骨架模态)以及四个基础模型进行训练。我们的框架并非直接从不兼容架构和特征几何结构导致梯度冲突的异构教师中进行蒸馏,而是插入一层特定表征的代理模型,将多样化的教师知识转化为同质的自我中心空间。第二蒸馏阶段——选择性代理蒸馏(SPD)——随后针对每个训练样本自适应地选择既正确又自信的代理子集,仅从可靠监督中进行蒸馏,并抑制错误信号。SPD通过将UNIEGO初始化为代理参数的凸组合进一步稳定,使统一模型在蒸馏开始前处于损失景观的良好条件区域。UNIEGO在三个自我中心视频理解任务——动作识别、视频检索和动作分割——中,在三个具有挑战性的自我-外部基准上实现了最先进的性能,优于朴素的多教师蒸馏基线,并证明了结构化、代理中介的知识转移能够产生更丰富、更具判别力的自我中心表征。
最优确定性多校准与全知预测 Georgy Noarov 2026-06-18 PDF 如果一个模型在群体权重集合 $G$ 上是多校准的,那么它不仅是整体上校准的(即预测无偏),而且在根据每个 $g \in G$ 对上下文重新加权后也是校准的。这一性质对许多下游应用非常有用,也是可信机器学习的基本要求。在此工作之前,所有已知能达到 $\varepsilon$-多校准的极小极大最优 $\widetilde O(\varepsilon^{-3})$ 样本复杂度率的预测器都是随机化的,而确定性预测器仅以显著更差的样本复杂度实现。随机化是否对多校准中的最优样本复杂度必要,这一问题由 [CLNR26] 明确提出,并在之前的几项工作中隐含提及。我们通过给出一个输出确定性预测器的极小极大最优多校准算法解决了这一开放问题。随后,我们将该算法推广,以生成满足关于有限或有限覆盖测试集合的结果不可区分性(OI)的最优确定性预测器。作为应用,这还给出了具有最优样本复杂度的确定性全能预测器和泛预测器,解决了 [OKK25] 和 [BHHLZ25] 提出的开放问题。
《方框思维:轻松实现真实图像的3D编辑》 Pradhaan S Bhat 2026-06-18 PDF 文本和2D条件化界面在图像编辑中只能提供对空间变换的弱控制与模糊引导,尤其在处理大范围物体运动和相机视角变化时表现不佳。先前研究虽采用三维基元(如立方体),但仅将其作为指示物体大致位置的松散条件信号,而非明确指定变换参数。我们创新性地将三维立方体作为结构化规范:用户提供编辑前后的立方体参数,将编辑任务转化为良态几何问题。这种"以立方体思考"的交互界面中,每个立方体面通过颜色编码传达三维朝向,从而实现对真实图像中平移、旋转、缩放和视角变化的精确控制,同时保持场景与物体身份不变,并恢复先前不可见的物体区域。为将变换锚定于场景外观,我们引入深度对齐的平面地板作为全局参考坐标系,并辅以深度感知阴影渲染。基于该结构化条件,图像生成器能在大幅变换下保持结果一致性。通过两阶段训练(合成多物体场景与Objectron小规模真实视频),该系统可泛化至复杂野外真实图像。本方法直接作用于真实照片,在大幅三维编辑任务中显著超越近期最优方法。
为生成式推荐构建并标记化分布式用户兴趣上下文 Ruizhong Qiu 2026-06-18 PDF 生成式推荐是一种新兴范式,在工业推荐系统中展现出潜力,旨在从用户历史行为中预测其下一次交互。该范式的核心在于物品分词化,它连接了物品语义与推荐模型。然而,现有方法往往难以同时有效地组织并将复杂的用户行为与物品语义上下文注入推荐模型。一方面,现有的基于图的集成方法(如图序列化和图神经网络)要么存在可扩展性问题,要么仅利用局部图信息。另一方面,现有的语义分词化方法通常依赖启发式规则,缺乏明确的监督信号,可能导致语义表示不准确或次优。为解决用户兴趣上下文建模中的这些局限,我们提出G2Rec,一个可扩展的框架,将基于图的整体用户协同参与建模与语义分词化统一起来,用于工业级生成式推荐。总体而言,G2Rec使推荐模型能够捕捉整体且基于语义的用户兴趣原型,无需真实用户兴趣标签,从而在工业序列推荐中提供更全面、更准确的用户行为上下文建模。跨产品表面的在线部署及在公开数据集上的大量实验表明,G2Rec优于现有方法。
令牌是群元素:论矩阵李群上的李代数注意力机制 Przemyslaw Musialski 2026-06-18 PDF 我们将注意力令牌置于群上:令牌是矩阵李群$G$中的元素$g_i$——一种纯粹的变换,没有特征负载,也没有外部作用$\rho(g)$来承载它。据我们所知,这是首个以纯矩阵李群元素作为令牌的注意力结构:其分数是相对位姿的闭式代数范数,而非学习得到的核函数,并且它能够覆盖仿射全帧群,而所有基于不可约表示或满射指数的方法都必须排除这些群。我们称之为李代数注意力。一旦令牌成为群元素,后续过程便无需任何常规表示论机制。一对元素的相对几何是规范化的,即$g_i^{-1} g_j$,因此成对不变量$w_{ij} = \log(g_i^{-1} g_j)$是内在的而非人为设计的;对角$G$作用下的等变性是自明的,且余循环条件自动成立。注意力分数为负的代数范数平方,即$s_{ij} = -\
可预测性作为隐私的细粒度度量 Linda Lu 2026-06-18 PDF 差分隐私(DP)即便面对最强大的攻击者也能提供严格的个体级隐私保障,但其最坏情况特性可能导致隐私与准确性之间代价高昂的权衡。我们提出"基于可预测性的隐私"这一细粒度框架,该框架明确整合了攻击者的核心知识(由随机过程生成的数据集中被攻破的部分)以及指定的查询族。可预测性将隐私泄露量化为攻击者在观察算法输出后,对未知个体敏感信息的预测能力相较于仅从已泄露数据中推断的增量提升。研究表明,可预测性与DP通常不可比较:两者可能一方极小而另一方极大。但在仅剩一个个体未被攻破且所有二元查询均被视为敏感的最坏情况下,可预测性可推导出互信息DP。更广泛而言,可预测性为特定敏感信息和特定攻击者模型提供了更细粒度的隐私度量。我们引入基于广义矩估计(GMM)的通用框架,分析当已泄露数据由平稳遍历混合过程生成时的渐近可预测性。基于此分析,我们为经验风险最小化(ERM)推导出可预测性校准的输出扰动方案。该方法与DP互补,可配合DP实现细粒度隐私控制。
当前的世界模型缺乏持久的状态核心。 Jinpeng Lu 2026-06-18 PDF 世界模型正日益被视为迈向通用人工智能的关键一步,但物理世界的建模远不止于按需生成令人信服的画面:它需要一种随时间持续演化的内部世界状态,这种状态与观测解耦,使得物体能够持久存在、事件能够自然推进至终结——无论是否有摄像头在注视,就像月亮在无人仰望时依然遵循轨道运行。这一要求是现有基准测试的盲区,它们奖励保真度、运动、相机可控性等表面特性,却从不追问:当世界未被观测时,它是否仍在持续演化。我们提出\textbf{WRBench},首个将相机运动视为观测干预的系统性诊断基准,通过人类校准的评估链来检验:相机是否执行了要求的交互、场景在视野内是否保持连续可识别、以及返回的目标是否与已启动的事件保持一致。在涵盖四种控制范式的23个模型生成的9600个视频中,一个发现始终成立:当前系统将观测到的世界维持为跟踪镜头,返回的目标停留在被遗弃时的状态,而非在未被观测期间推进事件。由于这一失败跨越控制范式、模型家族和规模增量,稳健的世界状态演化并非来自更清晰的图像、更精确的控制、更丰富的几何先验或单纯的参数数量。因此我们认为,物理状态核的稳定性与视角干预下世界线的一致性应成为世界模型设计的首要目标,使世界模型捕捉世界将如何展开,而非下一帧如何呈现。