跳转至

arXiv 2026-06-20

标题 作者 发布日期 PDF链接 摘要
JanusMesh: 通过跨空间去噪实现快速零样本3D视错觉生成 Siang-Ling Zhang 2026-06-18 PDF 创建3D视觉错觉——一个从不同视角呈现完全不同语义的单一3D网格——是一个迷人但极具挑战性的难题。现有基于优化的方法速度缓慢且易产生过饱和色彩,而简单的拼接方法则无法生成几何一致的物体,导致出现明显的不自然接缝和语义泄露。本文提出了一种快速且无需训练的文本驱动3D视觉错觉生成框架。我们的方法将生成过程解耦为两个阶段:首先提出跨空间双分支去噪流程,该流程动态地将3D潜在编码解码至体素空间,用于CLIP引导的方向对齐和符号距离场融合,确保无缝几何整合;其次引入视角条件纹理合成模块,将特定视角的2D扩散先验投影并聚合到融合后的几何体上。大量实验表明,我们的方法仅需3-5分钟即可生成高度逼真的双语义3D错觉,在几何完整性、语义可识别性和效率上显著超越现有方法。项目页面:https://siang1105.github.io/JanusMesh.github.io/
TimeProVe:先提出,再验证,以实现日常活动长视频的高效时间推理 Arkaprava Sinha 2026-06-18 PDF 长视频问答(LVQA)需要在长达数小时的未剪辑视频中定位稀疏且与查询相关的证据。现有方法要么使用大型视觉语言模型(VLM)密集处理视频,导致计算成本过高,要么依赖基于稀疏字幕的推理,但常遗漏时间定位和运动中心证据。我们提出TimeProVe,一种面向长视频时间定位推理的高效混合框架。TimeProVe首先使用轻量模块生成基于动作的答案-证据假设,随后仅针对目标验证调用昂贵的VLM。框架核心在于基于动作的候选证据(ACE)模块,该模块通过轻量级LLM推理将时间定位的动作转化为查询条件化的候选答案及支撑证据窗口。我们进一步提出OpenTSUBench(OTB)基准,用于评估真实日常生活活动(ADL)场景中的时间定位推理能力。实验表明,TimeProVe在OTB上比最强基线提升7.3%,同时减少75%的VLM调用和93%的推理成本。此外,无需显式时间定位训练,TimeProVe在Charades-STA上即达到竞争性表现,结合定位VLM增强后更取得最优结果。
扩散Gemma的透明度如何? Joshua Engels 2026-06-18 PDF LLM推理透明度对于理解模型决策、减少误用与对齐偏差、以及调试异常模型行为至关重要。然而,DiffusionGemma在连续潜在空间中完成大部分计算——这是否会降低其推理透明度?我们将透明度分解为两个维度展开研究:变量透明度(能否理解模型计算状态的中间快照)与算法透明度(能否通过这些快照重构模型输出结果的生成过程)。直观来看,DiffusionGemma的变量透明度较差:其不透明序列深度(可解释模型状态之间发生的序列计算量)最初似乎是相应自回归Gemma 4模型的28.6倍。但我们证明,通过可解释的token瓶颈映射去噪步骤间的信息流动,可在不降低下游性能的前提下,将不透明序列深度降至仅为Gemma 4的1.1倍。扩散模型的算法透明度比自回归模型更难实现,因为画布中所有token预测在每个去噪步骤都可能改变,这使模型具备在去噪过程中实施复杂分布式算法的能力。为弥合这一差距,我们开展了一系列可解释性案例研究,初步发现了非时序推理、token与序列模糊化、中间上下文推理等新型扩散模型特有现象。最后,我们测试了可监控性(透明度的重要应用场景,衡量模型输出对下游任务的效用),发现DiffusionGemma与Gemma 4具有相似的可监控性。
UNIEGO:代理作为中介的统一自我中心视频表示学习 Wenhao Chi 2026-06-18 PDF 自我中心视频理解本质上受限于可穿戴摄像头的狭窄视角:单一视角、单一模态、单一模型无法捕捉人类行为的全部丰富性。我们认为,真正富有表现力的自我中心表征必须整合跨视角、跨模态和基础模型表征的互补知识,同时仍需仅从自我中心视频中即可部署。为此,我们引入了一个层次化多教师蒸馏框架,生成了UNIEGO——一个统一的自我中心编码器,该编码器使用九位教师(涵盖自我-外部视角、RGB、深度和骨架模态)以及四个基础模型进行训练。我们的框架并非直接从异构教师处进行蒸馏(这些教师的不兼容架构和特征几何会导致梯度冲突),而是在其中插入一层特定表征的代理模型,将多样的教师知识转化为同质的自我中心空间。第二阶段蒸馏——选择性代理蒸馏(SPD)——随后针对每个训练样本自适应地选择既正确又自信的代理子集,仅从可靠监督中进行蒸馏,并抑制错误信号。SPD通过将UNIEGO初始化为代理参数的凸组合进一步稳定,使统一模型在蒸馏开始前处于损失景观的良好条件区域。UNIEGO在三个自我中心视频理解任务(动作识别、视频检索和动作分割)上达到了最先进性能,在三个具有挑战性的自我-外部基准测试中优于朴素的多教师蒸馏基线,并证明了结构化、代理介导的知识迁移能够产生更丰富、更具判别力的自我中心表征。
最优确定性多校准与全知预测 Georgy Noarov 2026-06-18 PDF 如果一个模型在群体权重集合 $G$ 上是多校准的,那么它不仅是整体上校准的(即预测条件无偏),而且在按每个 $g \in G$ 重新加权上下文后也是校准的。这一性质对许多下游应用非常有用,也是可信机器学习的基本要求。在此工作之前,所有已知能达到 $\varepsilon$-多校准的极小极大最优 $\widetilde O(\varepsilon^{-3})$ 样本复杂度率的预测器都是随机化的,而确定性预测器仅以显著更差的样本复杂度已知。随机化是否对多校准的最优样本复杂度必要,这一问题由 [CLNR26] 明确提出,并在多项先前工作中隐含提及。我们通过给出一个输出确定性预测器的极小极大最优多校准算法解决了这一开放问题。随后,我们将该算法推广,以生成满足关于有限或有限覆盖测试集合的结果不可区分性(OI)的最优确定性预测器。作为应用,这还给出了具有最优样本复杂度的确定性全能预测器和泛预测器,解决了 [OKK25] 和 [BHHLZ25] 提出的开放问题。
框内思考:真实图像中的3D编辑变得简单 Pradhaan S Bhat 2026-06-18 PDF 文本和2D条件化界面在图像编辑中只能提供对空间变换的弱控制与模糊引导,尤其在处理大范围物体运动及视角变化时表现不足。现有研究虽采用三维基元(如立方体)作为条件信号,但仅能指示物体大致位置而无法明确指定变换参数。我们创新性地将三维立方体作为结构化规范:用户提供编辑前后的立方体边界框,将图像编辑转化为具有明确几何约束的问题。这种"方框思维"界面通过为每个立方体面赋予颜色编码以传达三维朝向,能够精确控制真实图像中的平移、旋转、缩放及视角变化,同时保持场景与物体身份特征,并恢复先前不可见的物体区域。为将变换与场景外观建立关联,我们引入深度对齐的平面地板作为全局参考坐标系,并辅以深度感知的阴影渲染。基于该结构化条件,图像生成器可在大幅变换下保持输出一致性。通过两阶段训练(合成多物体场景与Objectron小规模真实视频数据集),该方法可泛化至复杂野外的真实图像。本方法直接作用于真实照片,在大幅三维编辑任务中显著超越当前最优方法。
为生成式推荐构建并标记化分布式用户兴趣上下文 Ruizhong Qiu 2026-06-18 PDF 生成式推荐是一种新兴范式,在工业推荐系统中展现出潜力,旨在从用户历史行为中预测其下一次交互。其核心在于物品标记化,该技术连接了物品语义与推荐模型。然而现有方法难以同时有效组织并注入复杂的用户行为与物品语义上下文。一方面,现有基于图的集成方法(如图序列化与图神经网络)存在可扩展性问题,或仅能利用局部图信息。另一方面,现有语义标记化方法通常依赖启发式规则且缺乏显式监督信号,可能导致不准确或次优的语义表征。为解决用户兴趣上下文建模中的这些局限,我们提出G2Rec——一个可扩展框架,将基于图的全局用户协同参与建模与语义标记化统一应用于工业级生成式推荐。总体而言,G2Rec使推荐模型无需真实用户兴趣标签即可捕获全局且语义化的用户兴趣原型,从而在工业序列推荐中实现更全面精准的用户行为上下文建模。跨产品表面的在线部署及公开数据集上的大量实验证明了G2Rec相较于现有方法的优越性。
令牌是群元素:论矩阵李群上的李代数注意力机制 Przemyslaw Musialski 2026-06-18 PDF 我们将注意力令牌置于群上:令牌是矩阵李群$G$中的元素$g_i$——一种纯粹的变换,没有特征载荷,也没有外部作用$\rho(g)$来承载它。据我们所知,这是首个以纯矩阵李群元素作为令牌的注意力结构:其分数是相对位姿的闭式代数范数,而非学习核函数,并且它能够覆盖仿射全帧群——这是所有基于不可约表示或满射指数方法必须排除的。我们称之为李代数注意力。一旦令牌成为群元素,后续过程便无需任何常规表示论工具。一对元素的相对几何是规范化的,即$g_i^{-1} g_j$,因此成对不变量$w_{ij} = \log(g_i^{-1} g_j)$是内在的而非人为设计的;对角$G$作用下的等变性是自明的,且余循环条件自动成立。注意力分数为负的平方代数范数,即$s_{ij} = -\
可预测性作为隐私的细粒度度量 Linda Lu 2026-06-18 PDF 差分隐私(DP)即便面对最强大的攻击者也能提供严格的个体级隐私保障,但其最坏情况特性可能导致隐私与准确性之间代价高昂的权衡。我们提出"基于可预测性的隐私"这一细粒度框架,该框架明确纳入攻击者的核心知识(由随机过程生成的数据集中被攻破的部分)以及指定的查询族。可预测性将隐私泄露量化为:攻击者在观察算法输出后,对未知个体敏感信息的预测能力相较于仅凭已泄露数据所能推断的信息所获得的增量增益。研究表明,可预测性与差分隐私通常不可比较:两者可能一方极小而另一方极大。但在仅剩一个个体未被攻破且所有二元查询均被视为敏感的最坏情况下,可预测性可推导出互信息差分隐私。更一般地,可预测性提供了针对特定敏感信息和特定攻击者模型的细粒度隐私度量。我们提出基于广义矩估计(GMM)的通用框架,用于分析当被攻破数据由平稳遍历混合过程生成时的渐近可预测性。基于该分析,我们为经验风险最小化(ERM)推导出可预测性校准的输出扰动方案。该方法与差分隐私互补,可与之协同实现细粒度隐私控制。
当前世界模型缺乏持久状态核心 Jinpeng Lu 2026-06-18 PDF 世界模型正被越来越多地视为通向通用人工智能的关键一步,但物理世界的建模远不止于按需生成令人信服的画面:它需要一个随时间持续演化的内部世界状态,该状态独立于观测而存在,使得物体能够持久存在、事件能够自然完成——无论是否有摄像头在记录,就像月亮在无人注视时依然遵循轨道运行一样。这一要求是现有基准测试的盲区,它们只奖励保真度、运动效果和相机可控性等表面特性,却从不追问一个生成的世界在未被观测时是否仍在持续演化。我们提出\textbf{WRBench},这是首个将相机运动视为对可观测性干预的系统性诊断基准,它将评估分解为一条经人类校准的链条:相机是否执行了要求的交互操作、场景在视野内是否保持连续可辨识、以及返回的目标是否与已启动的事件保持一致。在涵盖四种控制范式的23个模型生成的9600个视频中,一个发现始终成立:当前系统将观测到的世界维持为跟踪镜头,返回的目标停留在被遗弃时的状态,而非在未被观测期间推进事件。由于这一失败跨越控制范式、模型家族和规模增量,稳健的世界状态演化并不来自更清晰的图像、更精确的控制、更丰富的几何先验或单纯的参数数量。因此我们认为,物理状态核的稳定性以及视角干预下世界线的一致性应成为世界模型设计的首要目标,使世界模型捕捉世界将如何展开,而非下一帧画面如何呈现。