跳转至

arXiv 2026-10-02

标题 作者 发布日期 PDF链接 摘要
摩尔、埃舍尔、彭罗斯:共形黄金辫 Sophia Feldman 2026-10-01 PDF 我想我一生中从未做过如此奇特的事情。除此之外,它展现了一个年轻人饶有兴致地注视着一幅展览墙上的版画,而画中正是他自己。这怎么可能呢?也许我离爱因斯坦的弯曲宇宙并不遥远。'' M.C. 埃舍尔如此描述他1956年的石版画《版画画廊》。近半个世纪后,一项数学分析通过共形幂映射 $z \mapsto z^α$,$α\in \mathbb{C}$,将其几何结构与一个未扭曲的源图像联系起来。在此构造的基础上,我们使用一个冻结的文本到图像扩散模型来生成新的自指场景。仅靠提示词并不能强制实现递归,而事后变换则可能使结构连接不良。在采样过程中应用变换同样不够:去噪器可能会“修复”预期的扭曲,或偏离规定的几何结构。我们构造了不可逆图像变换 $T$ 的广义逆 $T^\dagger$,并使其适应其递归约束。在理想化的表述中,彭罗斯恒等式 $TT^\dagger T = T$ 使 $TT^\dagger$ 成为到几何容许图像上的幂等投影。然而,即使有投影,仅对变换后的图像去噪仍然是一个分布外任务。因此,我们将去噪步骤与 $T$ 和 $T^\dagger$ 交织在一起:源空间步骤发展未扭曲的场景,而变换空间步骤则精炼其在最终几何结构中的外观和连接。我们生成类似《版画画廊》的构图,并探索进一步的变换。我们不是扭曲一幅已完成的图像,而是让场景及其扭曲共同发展。
球体编码器2 Kaiyu Yue 2026-10-01 PDF 球体编码器是一种自编码器,通过从高维潜在球面上解码随机点来生成图像。我们识别出原始公式中的两个限制,这些限制降低了其生成质量。首先,相对于编码潜在空间中的极点,随机点集中在其赤道附近,但训练旋转从未到达这一区域,留下了一个限制单步生成的空白。其次,使用像素级重建损失进行生成训练促使解码器对可能的图像进行平均,产生缺乏高频细节的模糊图像。我们提出了球体编码器2来解决这两个限制,在保持自编码器速度和简单性的同时,大幅提高了图像生成质量。模型发布在\href{https://github.com/kaiyuyue/sphere2}{github.com/kaiyuyue/sphere2}。
一个基础驱动所有:用于实时虚拟化身的高斯混合形状蒸馏 Ramazan Fazylov 2026-10-01 PDF 3D高斯化身支持快速渲染,然而其实时动画常受限于高昂的神经推理成本。我们针对这一瓶颈展开研究,并表明预训练化身模型的动画可以通过与身份无关的blendshapes的线性组合来紧密近似。基于这一发现,我们提出了GALA(Gaussian Animation via Linear Approximation),一种蒸馏方法,用浅层系数预测器和线性混合替代逐帧的繁重神经解码。为提高保真度并降低内存需求,我们提出在渲染感知度量和内存预算下使用块局部PCA构建基。我们的方法学习一个浅层MLP网络来预测blendshape系数,并可应用于多种动画架构而无需重新训练原始模型。我们通过加速三种不同的化身模型来验证GALA,涵盖面部表情的3D动画以及带衣物动态的全身动画。在这些模型中,我们的蒸馏方法能够泛化到未见过的身份,并将CPU动画成本降低最多三个数量级,同时保留大部分渲染质量。我们方法的优异结果证实了所学化身表示的共享线性结构,并实现了在移动设备上高达60fps帧率的高效且准确的动画。项目页面:https://ramazan793.github.io/gala/
KaliBench:一个面向Kali Linux网络安全工具使用的细粒度基准,具有无需运行时即可验证的奖励 Pengfei Li 2026-10-01 PDF 大型语言模型正越来越多地应用于网络安全工作流,被期望将分析人员的意图转化为工具调用。然而,现有评估主要集中于基于知识的测评或端到端智能体任务,并未直接衡量大型语言模型为真实网络安全工具生成可执行命令的能力。这一空白至关重要,因为网络安全操作依赖严格的命令行界面,其中微小的语法错误、错误的标志—值绑定或参数顺序错误都可能导致执行失败。我们提出KaliBench,一个用于Kali Linux上自然语言到命令行界面翻译的细粒度基准和数据集,包含8,504个查询—命令对,覆盖23个能力维度和5个安全阶段中的1,642个工具。KaliBench通过基于手册的流水线构建,采用确定性规范化和别名感知评估,能够对工具选择和参数构造进行精确且可复现的评估。为确保语义正确性和实际可执行性,我们开发了一个多阶段验证流水线,结合基于大型语言模型的验证、沙箱终端执行和人在回路中的改进。基于这些细粒度、确定性的信号,KaliBench进一步支持用于训练的免运行时可验证奖励。在三种评估模式和24种通用及面向安全的开放权重模型配置中,没有任何开放权重模型在无限制设置下超过42%的精确命令准确率,凸显了在没有明确工具提示的情况下准确使用基于命令行界面的网络安全工具的难度。我们进一步表明,使用源自KaliBench的可验证奖励进行监督微调和强化学习,可显著提升一个8B模型,并达到与一个685B MoE模型相当的性能。
ROWBench:视频模型是否渲染出程序所指定的内容? Zheng-Hui Huang 2026-10-01 PDF 可编程世界模型将可执行动力学与视觉生成分离,为下一代游戏引擎提供了有前景的基础。然而,其对显式规则和交互的视觉遵循程度仍缺乏充分评估。现有基准评估视觉质量、可控性以及指令或物理遵循性,但很少测试对细粒度、程序指定的世界事件的忠实度。我们提出PROWBench,包含170个程序化构建的片段和600个代理视频,覆盖多样场景与交互。PROWBench记录实体状态和时间戳事件,包括相机视野之外的事件,作为可重放的世界记录,并据此渲染同步视图和代理表示。这使得生成视频能够对照程序执行的可观察后果进行检查。一个可扩展框架构建场景、控制行为,并能以不同表示渲染每个相机视图,例如粗粒度3D和边界框。该基准覆盖第一人称和第三人称视角,并为部分片段提供同步多视图观测。基于这些记录,PROWBench评估实体控制、长时程记忆,并通过两个基于VLM的指标——逻辑-渲染对齐和交互成功率——评估对规定时间线的遵循以及时间戳引擎记录事件的视觉实现。
重建、实践、走向真实:具身智能体的引导式自我改进 Yen-Jen Wang 2026-10-01 PDF 构建跨多种任务的可靠机器人能力需要大量人力来开发与维护技能、设计奖励,并将感知与控制集成。我们提出Reconstruct, Practice, Go Real(RPG),一个在不更新模型权重的情况下自主改进机器人执行系统的框架。RPG在离线数据集中识别操作能力,并在仿真中构建相关练习任务。在练习过程中,RPG利用执行反馈、特权模拟器状态和可用数据集视频来诊断失败。它基于这些诊断开发新的可复用符号技能、改进现有技能并修订系统提示。跨任务评估测试各个候选更改和合并修订,之后才将其保留以供复用。在测试时,一个多模态LLM使用所得的系统提示和技能库来协调感知与机器人控制。在22个操作任务的留出初始化上,RPG将任务成功率从第一轮练习后的28.6%提升到15轮后的95.0%,优于所有评估的基线,包括ASPIRE(75.5%)和由GPT-6 Astra Pro驱动的CaP-Agent0(60.0%)。经过通用的校准和硬件适配流程后,冻结系统在所有30次物理试验中均成功,其中三个任务各进行十次试验。项目网站:https://rpg-robot.github.io/
嵌入预测有助于图像生成 Sihan Xu 2026-10-01 PDF 在扩散Transformer中,类别标签或文本提示被嵌入一次,并在每个去噪步骤中重复使用相同的条件。我们探究预测嵌入能否替代其作为该条件。下一嵌入预测自回归(NEPA)训练一个Transformer来预测序列中的下一个连续嵌入。在生成过程中,干净图像紧随噪声图像之后,因此其嵌入是条件和噪声图像之后的下一个嵌入。我们训练一个NEPA模型,通过多嵌入预测一次性预测所有这些嵌入,并在嵌入条件生成中,让DiT生成器以这些预测为条件,在每个去噪步骤重新计算,从而使条件信号适应当前的噪声状态。在类别条件ImageNet $256\times256$上的实验研究了生成器的条件、多嵌入预测的设计以及两个模型的扩展性。NEPA模型为每个采样步骤增加了一个第二网络;借助它,并结合REPA,我们的最终模型NEPA-DiT-XL在约三分之一的REPA训练计算量下达到了1.32的FID。
ScholarCatalyst:一个用于检索激发新研究论文的基准 Sohyeon Kim 2026-10-01 PDF 是什么让伟大的科学家伟大?即便人工智能系统开始在开放问题上取得进展,科学家在感知一个新问题需要哪些埋藏在不断增长的研究档案中的先前想法方面,仍远远领先于它们。为了研究这一技能,我们借助那些 firsthand 知道哪些早期工作推进了其已完成项目的研究人员,论文则作为指向其中想法的指针。利用我们使作者标注可扩展的自动化流程,我们通过让 207 篇近期计算机科学论文的 184 位主要作者标注哪些候选工作确实或本可以推进其项目,并附上详细理由,构建了 ScholarCatalyst。我们引入了一项带有作者提供判断的检索任务:给定一个初始研究问题,仅从项目开始时已有的文献中检索这些论文。Agentic search 并不比嵌入检索表现更好(0.42 对 0.48 Recall@20),尽管它把同一个检索器作为工具调用。即便是一个基于 Claude Fable 5.1 构建的智能体,可能在训练期间见过这些已完成的论文,也只达到 0.51 R@20。这些结果凸显了需要新的训练方法,使模型具备在广泛语料中搜索的专家直觉。我们将 ScholarCatalyst 设想为迈向科学智能体的一步,这些智能体能够接受一个半成形的想法,并指出它所需的先前研究。
SILSA:用于拓扑保持高分辨率3D生成的滑动窗口切片潜在表示 Tianjiao Yu 2026-10-01 PDF 高分辨率三维生成日益依赖体素隐变量和多阶段流程,即先预测活跃结构,再合成局部几何。尽管这种方法有效,但这种设计会将连续表面碎片化为大量局部 token,增加生成成本,并且常常削弱薄结构或高度连通形状的拓扑一致性。我们提出 SILSA,一种拓扑感知的三维生成框架,用紧凑的滑动窗口切片隐变量表示形状。SILSA 不生成昂贵的体素 token,而是沿三个规范轴使用一组固定的重叠切片,其中每个 token 概括一个局部深度窗口,以保持横截面连续性并支持单阶段整流流生成。Slice VAE 将有向表面样本编码为多轴切片隐变量,并用稀疏体积解码器重建它们,而 Volumetric Anchor Lattice 通过共享三维工作空间协调各方向切片流。为保持结构正确性,我们引入切片级拓扑监督,匹配持久性图并对齐相邻切片间的 Betti 转变。实验表明,SILSA 在提高结构保真度的同时大幅降低生成成本。与最强基线相比,SILSA 将 PSNR 提高 $8.7\%$,覆盖率提高 $5.96$ 个绝对点,Betti 误差降低 $9.2\%$,同时使用的 token 比次紧凑基线少 $70.0\%$,比稀疏或分层 tokenizer 少超过 $98\%$,有效减少训练内存 $40.4\%$,减少推理时间 $58.5\%$。定性结果进一步表明,薄结构、重复组件和长程连通性得到了更好的保持。
VISTA:交互世界中推理的视觉驾驭工具 Qiushi Han 2026-10-01 PDF 我们表明,多模态模型具备强大的推理能力,而一个合适的框架能够释放其在多样化交互环境中解决任务的潜力。我们提出 VISTA,一种视觉框架,为通用多模态模型赋予长时程视觉能力。VISTA 使模型能够通过视觉观察直接感知环境,并维护一种无损视觉记忆,以原始形式保存过去的观察。模型可以在推理时主动检索这些观察并重新组织其视觉输入。在 ARC-AGI-3 上,VISTA 将 Claude Opus 5.0 的相对人类行动效率得分从 40.68 提升至完美的 100.00,模型完成了全部 25 个公开游戏,所用行动次数比首次参与的人类玩家少 57.4%。VISTA 的简洁设计还使其能够以极少的适配自然扩展到多样化的视觉环境。在涵盖多种视觉游戏和谜题的另外三个基准测试中,它大幅优于使用相同底层模型并配备极简框架的基线方法。我们的结果凸显了 VISTA 作为通用视觉框架的潜力,可推动多模态智能体在复杂视觉环境中的发展。