跳转至

arXiv 2026-08-12

标题 作者 发布日期 PDF链接 摘要
AdvFD:通过对抗性弗雷歇距离损失提升视觉生成 Mingju Gao 2026-08-11 PDF Fréchet距离近来作为一种有效的分布级目标函数,用于生成器后训练,补充了传统的样本级扩散和流匹配损失。然而,直接优化Fréchet目标可能导致Fréchet黑客现象。目标指标持续改善,但视觉质量和其他特征空间中的Fréchet对齐可能停滞或恶化。我们将此失败归因于现有Fréchet损失所使用的静态预训练特征空间。这些特征空间提供了不完整且固定的视角,用于观察真实分布与生成分布之间的差异。为解决此限制,我们提出对抗性Fréchet距离(AdvFD),它通过校准的对抗学习表示来补充FD-Loss中的静态表示目标。AdvFD在原始静态Fréchet目标基础上,增加了一个可学习表示,该表示对抗性地最大化真实样本与生成样本之间的Fréchet差异,而生成器则在由此产生的自适应特征空间中最小化相同差异。为防止对抗性表示通过特征放大而平凡地增加目标,我们进一步引入真实特征白化,它规范化其尺度和协方差几何,并稳定最小-最大优化。大量实验表明,AdvFD在JiT和pMF骨干网络以及不同模型规模上,一致地改善了一步生成器后训练。
手术WAM:面向数据高效手术机器人学习的世界-动作模型 Wenrui Bao 2026-08-11 PDF 学习可靠的手术操作策略受到动作标注演示稀缺的瓶颈制约:遥操作手术机器人(如dVRK)的同步运动轨迹采集成本高昂,而手术任务要求精确的接触处理、长时程推理和双臂协调。内窥镜视频相对于同步的视频-运动学轨迹而言成本较低且数据丰富,利用它的自然方式是学习手术场景的世界模型。然而,现有手术世界模型主要将视频用于模拟或策略评估,很少将学到的动力学转化为闭环控制。这一差距引出了我们的核心问题:在固定预算的动作标注演示下,无动作视频预训练能否提升闭环手术操作?为回答此问题,我们引入了手术世界-动作模型(Surgical WAM),一种基于Cosmos Policy构建的统一生成模型,可联合预测未来内窥镜观察和可执行的手术机器人动作块。Surgical WAM首先从无动作视频中学习手术视觉动力学,然后在固定的动作标注预算上进行微调;部署时,它作为闭环、滚动时域控制器,执行每个预测动作块的短前缀,并根据结果观察重新规划。在四个模拟手术操作任务套件上,视频预训练将平均成功率从63.5%提升至77.8%,其中PegTransfer任务绝对提升20个百分点,最大改进出现在接触密集和双臂协调任务上。这些结果表明,无动作视频为在有限动作监督下学习手术机器人控制提供了可迁移的视觉动力学先验,将数据高效的视频预训练定位为扩展手术机器人学习的实用路径。
为了在足球表征学习中捕捉人体运动的不确定性 Yizhou Xu 2026-08-11 PDF 本文提出了一种自监督表示学习框架,用于理解足球中基于3D骨架的人体运动,以未来运动预测作为学习目标。由于人体运动本质上具有不确定性,考虑多种可能的未来对于捕捉潜在的运动动态和学习有效的表示至关重要。为此,我们引入了一个运动预测的条件模块,该模块在3D欧几里得空间中对离散化未来运动的概率分布进行建模,通过未来轨迹的显式监督学习多模态性。在大规模足球运动员跟踪数据上的实验表明,我们的方法显著提高了运动预测的准确性。此外,学习到的表示有效迁移到多个足球下游应用中,展示了强大的跨任务泛化能力。
VidForensics-M1:基于可验证时间 grounding 的元检测强化学习用于AI生成视频取证 Bowei Liu 2026-08-11 PDF 视频生成模型的最新进展显著提升了合成视频的真实感,模糊了生成内容与真实内容之间的界限,并引发了对虚假信息的担忧。现有的基于MLLM的检测器主要依赖监督微调或标签级强化学习,其中粗粒度的监督限制了其对未见场景和新兴视频生成器的泛化能力。为克服这些限制,我们首次将元检测引入AI生成视频检测,通过在强化学习中联合优化预测标签和支持证据,实现可靠的伪造检测。这一范式需要可靠的证据信号及有效机制将其整合进标签级优化。文本理由提供了伪造伪影的语义描述,但其生成和验证依赖外部模型,使监督易受幻觉和语义偏差影响。相比之下,时间定位提供了更客观且可验证的证据,因为操纵区间可在伪造构建过程中精确控制。基于此洞察,我们提出一种自动化数据构建流水线,通过用边界帧条件视频生成模型替换时间片段,生成配对的真实-伪造视频。此外,我们引入证据引导的奖励再分配,根据证据质量在标签正确的响应间重新分配奖励,实现证据感知的信用分配。这保留了可靠的标签监督,同时鼓励检测器获取细粒度且可验证的伪造定位能力。大量实验表明,VidForensics-M1有效利用可验证的时间证据,实现了稳健且可泛化的AI生成视频检测。
ConVAWG:面向针对妇女和女童暴力行为的受控合成对话生成的检索接地框架 Chen Lyu 2026-08-11 PDF 合成对话生成为在难以获取、发布或标注真实数据的敏感领域中研究对话动态提供了一种途径。潜在的虐待可能发生在线上或线下:威胁和胁迫可以直接出现在消息中,而监视、隔离、跟踪和身体暴力等行为可能在对话中被计划、披露或提及。隐私和法律限制使得发布大规模真实对话数据集变得困难;现有工作主要集中在线上滥用的句子级毒性上,留下了将滥用建模为关系性和时间展开现象的空白。在本研究中,我们专注于将针对女性及女孩的暴力(VAWG)场景建模为多轮对话。我们引入了ConVAWG,一个基于检索的框架,用于生成符合CPS对齐的合成VAWG聊天对话。ConVAWG从人物种子、英国国家统计局报告的 demographic 模式、官方犯罪定义和检索到的家庭凶杀案审查案例中构建场景;将其转换为分层事件时间线;生成多场景角色扮演对话;并对适当的语句应用目标导向的激活控制毒性控制。我们发布了超过6,000个多轮对话事件,涵盖200个场景,并带有丰富的场景、事件和轮次级元数据。广泛的人工评估、LLM作为评审的评估、消融研究和下游任务显示了强大的对话质量和领域保真度。
超越特征袋:稀疏自编码器中的集合级不稳定性 Nikolai Bolik 2026-08-11 PDF Shani等人(2026)表明,大语言模型表示大致恢复了人类类别边界,但未能反映细粒度的典型性结构。他们的分析使用稠密模型表示上的余弦相似度。我们重新审视其方法,采用重叠稀疏自编码器(SAE)潜在集上的重叠作为更具可解释性的相似度度量。我们首先验证这种集合级度量是有意义的:SAE潜在集能在受控玩具模型中恢复类似并集的组合结构,并在自然文本中诱导语义上连贯的邻域。将人类概念分析扩展到SAE集合相似度,我们发现SAE激活集在恢复人类类别边界或类别内典型性方面,并不比稠密嵌入或残差流状态更忠实,而是追踪模型内部的相似性结构。为进一步探究这一差距,我们在良好控制的语义修改下研究活跃潜在集,揭示出人类对概念变化的判断与SAE活跃集变化之间存在显著不匹配。我们将此解释为证据,表明在理想化设置之外,SAE特征并不通过简单的词袋式语义进行组合。
格罗滕迪克常数的长视野AI研究:人机数学协作案例研究 Alan Li 2026-08-11 PDF AI智能体在数学研究中应用日益广泛,但如何有效使用它们往往并不明确。为此,我们提供了一个关于如何使用AI改进格罗滕迪克常数$K_G$界限的广泛案例研究,该常数捕捉了组合问题与其连续松弛之间的难度差异。具体而言,尽管$K_G$的精确值尚不明确,我们最近将已知的最佳界限收紧为 [ \frac{6\pi}{11} \;\le\; K_G \;\le\; \frac{\pi}{2\log(1+\sqrt2)} - 10^{-4}. ] 关键的是,这些改进是通过一个AI研究系统实现的,该系统能够得出领域专家认为新颖的见解。我们详细讨论了使用AI进行数学研究的经验,特别涉及其优势与不足,以及我们为AI创造理想条件以实现突破性见解的经验。
测试时自演化GUI视觉定位:基于反思引导的在线策略自蒸馏 Shiyu Xuan 2026-08-11 PDF GUI视觉定位是GUI智能体的基础能力。现有模型通常在部署后冻结参数,限制了其适应未见界面的能力。尽管近期方法尝试通过测试时强化学习来适应模型,但它们无法对失败的探索进行反思。为克服此问题,我们提出了一种测试时自进化框架,使模型在部署后无需人工标注的真实值即可改进。该框架构建了探索、评估、反思和内化的闭环。具体而言,智能体首先通过预测给定指令的定位坐标来探索未见界面。为评估这些探索,我们引入了一个基于MLLM的反射器来评估生成结果并提供相应的推理反思。为将反思知识内化到模型权重中,我们提出了反思引导的在线策略自蒸馏方法,通过条件自教师将高层推理转化为密集的令牌级监督。此外,我们设计了一种对比校准方法,以防止错误的自回归前缀在失败探索期间破坏监督信号。跨六个基准的广泛实验证明了我们框架的有效性,平均准确率比基础模型提高了7.4%。据我们所知,这是首个成功利用在线策略自蒸馏进行GUI视觉定位测试时适应的研究。通过填补部署后适应的空白,我们的框架完善了GUI智能体的自进化能力。代码将发布。
如何验证概率性声明的一致性 Orr Paradise 2026-08-11 PDF 当一个概率预测器回答许多条件概率查询时,其答案是否自洽,并且能否在多项式时间内验证?这个问题对AI安全具有重要意义,其中安全性源于对AI行动可能导致的非预期结果的概率预测的诚实性。我们构建了一个交互式PCP如下。设预测模型由概率电路P和输出预测置信度的电路Q指定。P和Q共同隐式指定了指数多的概率声明。我们展示了一个协议,其中多项式时间验证者可以验证(P,Q)的近似一致性。验证者获得电路对(P,Q),并在少数点上评估它们;同时,它获得一个证明预言机,即一个据称与(P,Q)预测一致的见证概率分布的编码,在与单个不可信证明者交互时,它在少数位置读取该编码。在此过程中,我们必须确保存在一个与模型预测一致的稀疏见证分布。为此,我们首先考虑显式概率声明一致性的见证分布,而不是由预测器指定的声明:假设有m个声明,每个形式为Pr[Y = 1 | X = x] = p,涉及n个布尔变量。基于Nilsson(Artif. Intell., 1986)发起的工作,我们将显式声明的l_2-近似概率一致性置于NP中,证书长度为O(mn + log B),其中B为输入位精度;我们进一步展示了小的加性完备性-可靠性差距如何消除对B的依赖。这些结果共同为认证概率预测器的自洽性提供了复杂性理论基础。我们将我们的交互式PCP视为训练预测模型证明自身一致性的第一步。
软性注意力机制的量子路线图:概率单纯形上软性注意力的精确玻恩规则类比 Eric A. F. Reinhardt 2026-08-11 PDF 注意力机制构成了许多现代AI模型(如Transformer)的基础。在注意力被应用的一类子问题中,输入和输出被约束在概率单纯形上,使得所有输出之和为一。在此设定下,softmax注意力允许一种精确的、逐分量的量子实现。注意力分数是幅度编码输入的块编码投影上的Hadamard测试统计量。指数softmax是由Born规则测量在精确双射下生成的余弦平方族的内点,其边界在有限参数值处表达具有精确零点的稀疏注意力。softmax温度是重复计数,其中后选择测量轮次精确实现离散化的逆温度。值聚合是确定性列加载通道,它扩张了列随机的值矩阵。门控残差是单个辅助比特的制备角度,加法恒等式在混合角π/2处。每个可学习参数都是旋转门角度。组合层在无限次测量极限下是精确的,每个注意力分数对应一步测量并重新加载;完全相干变体通过量子奇异值变换在无限深度极限下是ε近似的。代数核心在Lean 4中进行了机器验证。