跳转至

arXiv 2026-10-01

标题 作者 发布日期 PDF链接 摘要
摩尔、埃舍尔、彭罗斯:共形黄金辫 Sophia Feldman 2026-10-01 PDF 我想我一生中从未做过如此奇特的事情。除此之外,它还展示了一个年轻人饶有兴致地注视着展览墙上的一幅版画,而画中人物正是他自己。这怎么可能呢?也许我与爱因斯坦的弯曲宇宙相距并不遥远。'' M.C. 埃舍尔曾这样描述他1956年的石版画《版画画廊》。近半个世纪后,一项数学分析通过共形幂映射 $z \mapsto z^α$,$α\in \mathbb{C}$,将其几何结构与一幅未扭曲的源图像联系起来。在此构造的基础上,我们使用一个冻结的文本到图像扩散模型来生成新的自指涉场景。仅靠提示词并不能强制实现递归,而事后变换则会使结构之间的连接变得很差。在采样过程中施加变换同样不够:去噪器可能会“修复”预期的扭曲,或者偏离规定的几何结构。我们构造了不可逆图像变换 $T$ 的广义逆 $T^\dagger$,并使其适应其递归约束。在理想化的表述中,彭罗斯恒等式 $TT^\dagger T = T$ 使 $TT^\dagger$ 成为到几何上可容许图像上的幂等投影。然而,即使有投影,仅对变换后的图像去噪仍然是一项分布外任务。因此,我们将去噪步骤与 $T$ 和 $T^\dagger$ 交织在一起:源空间步骤发展未扭曲的场景,而变换空间步骤则在最终几何结构中细化其外观和连接。我们生成类似《版画画廊》的构图,并探索进一步的变换。我们不是扭曲一幅已完成的图像,而是让场景及其扭曲共同发展。
球体编码器2 Kaiyu Yue 2026-10-01 PDF 球体编码器是一种自编码器,通过从高维潜在球面上解码随机点来生成图像。我们识别出原始公式中的两个限制,这些限制降低了其生成质量。首先,相对于编码潜在空间中的极点,随机点集中在其赤道附近,但训练旋转从未到达这一区域,留下了一个限制单步生成的空白。其次,使用像素级重建损失进行生成训练鼓励解码器对可能的图像进行平均,产生缺乏高频细节的模糊图像。我们提出了球体编码器2来解决这两个限制,在保持自编码器速度和简单性的同时,大幅提高了图像生成质量。模型发布在\href{https://github.com/kaiyuyue/sphere2}{github.com/kaiyuyue/sphere2}。
一个基础驱动所有:用于实时虚拟形象的高斯混合形状蒸馏 Ramazan Fazylov 2026-10-01 PDF 3D高斯化身支持快速渲染,然而其实时动画常受限于高昂的神经推理成本。我们针对这一瓶颈展开研究,并表明预训练化身模型的动画可以通过身份无关的blendshapes的线性组合来紧密近似。基于这一发现,我们提出了GALA(Gaussian Animation via Linear Approximation),一种蒸馏方法,用浅层系数预测器和线性混合替代逐帧的繁重神经解码。为提高保真度并降低内存需求,我们提出在渲染感知度量和内存预算下使用块局部PCA构建基。我们的方法学习一个浅层MLP网络来预测blendshape系数,并可应用于多种动画架构而无需重新训练原始模型。我们通过加速三种不同的化身模型(用于面部表情的3D动画以及带衣物动态的全身动画)的推理来验证GALA。在这些模型中,我们的蒸馏方法能够泛化到未见过的身份,并将CPU动画成本降低最多三个数量级,同时保留大部分渲染质量。我们方法的优异结果证实了所学化身表示的共享线性结构,并实现了在移动设备上高达60fps帧率的高效且准确的动画。项目页面:https://ramazan793.github.io/gala/
KaliBench:一个面向Kali Linux网络安全工具使用的细粒度基准,具有无需运行时即可验证的奖励 Pengfei Li 2026-10-01 PDF 大型语言模型越来越多地应用于网络安全工作流,人们期望其将分析人员的意图转化为工具调用。然而,现有评估主要集中于基于知识的测评或端到端智能体任务,并未直接衡量大型语言模型为真实网络安全工具生成可执行命令的能力。这一空白至关重要,因为网络安全操作依赖严格的命令行界面,其中细微的语法错误、错误的标志—值绑定或参数顺序错误都可能导致执行失效。我们提出KaliBench,一个用于Kali Linux上自然语言到命令行界面翻译的细粒度基准与数据集,包含8,504个查询—命令对,覆盖23个能力维度和5个安全阶段中的1,642个工具。KaliBench通过基于文稿的流水线构建,采用确定性规范化与别名感知评估,从而能够对工具选择和参数构造进行精确且可复现的评估。为确保语义正确性与实际可执行性,我们开发了一个多阶段验证流水线,结合基于大型语言模型的验证、沙箱终端执行和人在回路中的精炼。基于这些细粒度、确定性的信号,KaliBench进一步支持训练时的无运行时可验证奖励。在三种评估模式和24种通用及面向安全的开放权重模型配置下,没有任何开放权重模型在无限制设置中超过42%的精确命令准确率,凸显了在没有明确工具提示的情况下准确使用基于命令行界面的网络安全工具的难度。我们进一步表明,使用源自KaliBench的可验证奖励进行监督微调和强化学习,可显著提升一个8B模型,并达到与一个685B MoE模型相当的性能。
ROWBench:视频模型是否渲染出程序所指定的内容? Zheng-Hui Huang 2026-10-01 PDF 可编程世界模型将可执行动力学与视觉生成分离,为下一代游戏引擎提供了有前景的基础。然而,其对显式规则和交互的视觉遵循程度仍未得到充分评估。现有基准评估视觉质量、可控性以及指令或物理遵循性,但很少测试对细粒度、程序指定的世界事件的忠实度。我们提出了PROWBench,包含170个程序化构建的情节和600个代理视频,涵盖多样场景和交互。PROWBench记录实体状态和时间戳事件,包括相机视野之外的事件,作为可重放的世界记录,并据此渲染同步视图和代理表示。这使得生成视频能够对照程序执行的可观察后果进行检查。一个可扩展框架构建场景、控制行为,并能以不同表示渲染每个相机视图,例如粗3D和边界框。该基准涵盖第一人称和第三人称视角,并为部分情节提供同步多视图观测。基于这些记录,PROWBench评估实体控制、长时程记忆,并通过两个基于VLM的指标——逻辑-渲染对齐和交互成功率——评估对规定时间线的遵循以及时间戳引擎记录事件的视觉实现。
重构、实践、走向真实:具身智能体的引导式自我改进 Yen-Jen Wang 2026-10-01 PDF 构建跨多样任务的可靠机器人能力需要大量人力来开发与维护技能、设计奖励,并将感知与控制集成。我们提出 Reconstruct, Practice, Go Real(RPG),一种无需更新模型权重即可自主改进机器人执行系统的框架。RPG 在离线数据集中识别操作能力,并在仿真中构建相关练习任务。在练习过程中,RPG 利用执行反馈、特权模拟器状态和可用数据集视频来诊断失败。它基于这些诊断开发新的可复用符号技能、改进现有技能并修订系统提示。跨任务评估测试各个候选更改和合并修订,然后再将其保留以供复用。在测试时,多模态 LLM 使用所得的系统提示和技能库来协调感知与机器人控制。在 22 个操作任务的留出初始化上,RPG 将任务成功率从第一轮练习后的 28.6% 提高到 15 轮后的 95.0%,优于所有评估基线,包括 ASPIRE(75.5%)和由 GPT-6 Astra Pro 驱动的 CaP-Agent0(60.0%)。经过通用的校准和硬件适配流程后,冻结系统在所有 30 次物理试验中均成功,其中三个任务各进行十次试验。项目网站:https://rpg-robot.github.io/
嵌入预测有助于图像生成 Sihan Xu 2026-10-01 PDF 在扩散Transformer中,类别标签或文本提示被嵌入一次,并在每个去噪步骤中重复使用相同的条件。我们探究预测嵌入能否替代其作为条件。下一嵌入预测自回归(NEPA)训练一个Transformer来预测序列中的下一个连续嵌入。在生成过程中,干净图像紧随噪声图像之后,因此其嵌入是条件和噪声图像之后的下一个嵌入。我们训练一个NEPA模型,通过多嵌入预测一次性预测所有这些嵌入,并在嵌入条件生成中,让一个DiT生成器以这些预测为条件,在每个去噪步骤重新计算,从而使条件信号适应当前的噪声状态。在类别条件ImageNet $256\times256$上的实验研究了生成器的条件、多嵌入预测的设计以及两个模型的扩展性。NEPA模型为每个采样步骤增加了一个第二网络;借助它,并结合REPA,我们的最终模型NEPA-DiT-XL在约使用REPA三分之一训练计算量的情况下达到了1.32的FID。
ScholarCatalyst:一个用于检索激发新研究的论文的基准 Sohyeon Kim 2026-10-01 PDF 是什么让伟大的科学家伟大?即便AI系统开始在开放问题上取得进展,科学家在感知一个新问题需要哪些埋藏在不断增长的研究档案中的先前想法方面,仍远远领先于它们。为了研究这一技能,我们借助那些 firsthand 知道哪些早期工作推进了其已完成项目的研究人员,论文则充当指向其中想法的指针。利用我们使作者标注可扩展的自动化流程,我们通过让207篇近期计算机科学论文的184位主要作者标注哪些候选工作已经或本可以推进其项目,并附上详细理由,构建了ScholarCatalyst。我们引入了一项带有作者提供判断的检索任务:给定一个初始研究问题,仅从项目开始时已有的文献中检索这些论文。Agentic搜索并不比嵌入检索表现更好(0.42 vs. 0.48 Recall@20),尽管它调用了同一个检索器作为工具。即便是一个基于Claude Fable 5.1构建的智能体,可能在训练中见过这些已完成的论文,也只达到0.51 R@20。这些结果凸显了需要新的训练方案,使模型具备在广泛语料中搜索的专家直觉。我们将ScholarCatalyst设想为迈向能够接受一个半成形想法并指出其所需要先前研究的科学智能体的一步。
SILSA:用于拓扑保持高分辨率三维生成的滑动窗口切片潜在表示 Tianjiao Yu 2026-10-01 PDF 高分辨率三维生成日益依赖体素潜变量与多阶段流程,即先预测活跃结构,再合成局部几何。尽管有效,这种设计将连续表面碎片化为大量局部 token,推高了生成成本,并且常常削弱薄型或高度连通形状的拓扑一致性。我们提出 SILSA,一种拓扑感知的三维生成框架,用紧凑的滑动窗口切片潜变量表示形状。SILSA 不生成昂贵的体素 token,而是沿三个规范轴使用一组固定的重叠切片,其中每个 token 概括一个局部深度窗口,以保持横截面连续性并支持单阶段整流流生成。Slice VAE 将有向表面样本编码为多轴切片潜变量,并用稀疏体积解码器重建,而 Volumetric Anchor Lattice 通过共享三维工作空间协调各方向切片流。为保持结构正确性,我们引入切片级拓扑监督,匹配持久性图并对齐相邻切片间的 Betti 转变。实验表明,SILSA 在提升结构保真度的同时大幅降低生成成本。相比最强基线,SILSA 将 PSNR 提升 $8.7\%$,覆盖率提升 $5.96$ 个绝对点,Betti 误差降低 $9.2\%$,同时相比次紧凑基线少用 $70.0\%$ 的 token,相比稀疏或分层 tokenizer 少用超过 $98\%$ 的 token,有效减少训练内存 $40.4\%$、推理时间 $58.5\%$。定性结果进一步显示,薄结构、重复组件和长程连通性得到更好保留。
VISTA:交互世界中推理的视觉驾驭工具 Qiushi Han 2026-10-01 PDF 我们表明,多模态模型具备强大的推理能力,而一个合适的框架能够释放其在多样化交互环境中解决任务的潜力。我们提出VISTA,一种视觉框架,赋予通用多模态模型长时程视觉能力。VISTA允许模型通过视觉观察直接感知环境,并维护无损视觉记忆,以原始形式保存过去的观察。模型可以在推理时主动检索这些观察并重新组织其视觉输入。在ARC-AGI-3上,VISTA将Claude Opus 5.0的相对人类行动效率得分从40.68提升至完美的100.00,模型完成全部25个公开游戏所用的行动次数比首次参与的人类玩家少57.4%。VISTA的简洁设计还使其能够以极少的适配自然扩展到多样化的视觉环境。在涵盖多种视觉游戏和谜题的另外三个基准测试中,它大幅优于使用相同底层模型并仅配备最小框架的基线方法。我们的结果凸显了VISTA作为通用视觉框架的潜力,可推动多模态智能体在复杂视觉环境中的发展。