跳转至

arXiv 2026-09-10

标题 作者 发布日期 PDF链接 摘要
可编程世界模型 Zheng-Hui Huang 2026-09-09 PDF 近期的视频世界模型能够生成日益逼真且可交互的视觉体验,但缺乏在长时间交互中维持持久世界状态并强制执行可编程规则的可靠机制。我们提出可编程世界模型,一个将世界状态演化与视觉观测生成解耦的框架。智能体将自然语言指令转化为可执行程序,这些程序指定实体状态和状态转移规则,从而能够直接控制单个实体及其交互。一个轻量级引擎执行这些程序,以更新和维护显式的、持久的全局世界状态,包括屏幕外实体和非视觉属性。为将世界状态与视觉生成相连接,我们引入状态增强的3D有向包围盒作为中间表示。该表示与目标相机轨迹一起,被确定性地编译为像素对齐的时空条件信号,用于作为生成渲染器的预训练视频模型。这一设计允许用户创建具有预定义机制的可玩游戏、直接控制单个实体,并在整个游戏过程中保持持久的世界状态。我们进一步引入CombatStateBench,一个用于评估可编程世界模型的基准。在CombatStateBench上,我们的方法实现了94%的计数准确率和98%的状态准确率,大幅优于现有的交互式视频世界模型,同时支持连贯的长时程生成。这些结果证明了将显式状态演化与生成渲染分离对于构建持久、可编程世界的有效性。
IdeaAMBIG:基准测试研究想法规范中实现关键差距 Yiling Ma 2026-09-09 PDF 一个研究想法可能新颖、连贯且在科学上合理,但其提出的方法可能仍然不够明确,无法忠实实现。我们研究面向实现的研究方法规范的编码就绪性,其定义为:这些规范是否提供了足够的方法论信息,使有能力的实现者或编码代理能够在无需无依据假设的情况下构建预期方法。我们从论文、代码库、问题讨论串和复现工件中构建有证据支撑的规范及其有依据的解决方案。我们提出 IdeaAMBIG,一个包含 660 个有证据支撑实例的基准:163 个来自可复现性报告和 GitHub 问题的真实世界缺口,以及 497 个注入到编码就绪参考中的受控合成缺口。IdeaAMBIG 评估三种能力:编码就绪性评估、缺陷定位和澄清动作生成。缺陷定位仅接收规范,而澄清还额外接收标注缺陷。在 13 个 LLM 中,最佳模型在真实世界实例上达到 9.6% 的宏缺陷恢复率,但在给定缺陷时达到 80.6% 的宏澄清动作成功率。在一项 oracle 研究中,提供金标准解决方案将下游编码就绪率从 14% 提高到 98%。在所有被评估模型中,缺陷定位是主要瓶颈,而在给定缺陷时澄清表现更强。
面向通过自主形式逻辑建模与自动推理解决应用逻辑缺陷 Yiwei Fang 2026-09-09 PDF 逻辑缺陷对现代语义丰富系统和应用的设计与实现构成重大挑战,影响安全性、隐私和信任。这些缺陷本质上与业务特定语义和威胁模型紧密相关,使其发现和推理变得困难且难以扩展。现实世界系统通常呈现多样化的应用特征、复杂的协议逻辑和领域特定的威胁模型,需要大量人力和领域专业知识才能进行有效的安全分析。本文中,我们介绍LL-Verifier,一种新颖的自动化框架,用于识别逻辑漏洞,它建立在(1)用于自主建模的大语言模型和(2)用于严格推理的逻辑模型检查器之上。LL-Verifier处理自然语言输入,特别是协议描述和安全目标,以自动生成形式化逻辑模型和属性,这些模型和属性用一种新的逻辑语言表达,该语言建立在通用逻辑语言Maude之上,并针对建模任意应用级语义进行了优化。这些形式化模型随后被转换为逻辑状态机,从而通过逻辑级模型检查实现穷尽式、严格的验证。该方法简化了对现实场景中部署的多样化应用级协议的分析,在其逻辑约束内提供自动化、穷尽且精确的推理。我们通过将LL-Verifier应用于27个广泛使用的物联网设备的访问控制协议,评估了其高效性、效率和实用性,这些协议具有供应商特定的逻辑流程和语义。尽管LL-Verifier解决了应用安全中的一个难题,即自动逻辑缺陷发现,但我们的分析揭示了物联网协议和设备中一系列复杂的逻辑漏洞,具有严重的安全和隐私影响。
通过归一化流进行含冗余参数的无似然推断 Phil Assheton 2026-09-09 PDF 我们提出了一种基于神经网络的归一化流的简单分解,它在存在冗余参数的情况下自然地揭示了一个关键统计量(或接近关键统计量),仅基于感兴趣分布的样本生成器。我们证明该统计量在最小平均KL散度意义下接近关键统计量,即其p值与均匀分布之间的最小平均KL散度,并且我们论证当统计量的维数等于参数的维数时,它可以预期具有良好的功效。它能够纳入关于群不变性(如平移和尺度)的先验知识。它几乎能够精确地发现单样本t检验,在受限方差比范围内以最坏情况大小优于Welch检验,并在部分双序列相关上实现良好的校准,同时在中小样本上显示出比轮廓似然比技术更高的功效(且速度快得多)。
利用测试时部分观测引导图像到3D生成 Jerred Chen 2026-09-09 PDF 图像到3D模型能够从单张RGB图像生成视觉上引人注目的3D资产,但其几何结构往往仅受到可用观测的松散约束,限制了其在需要几何保真度的应用中的使用。然而,在许多现实场景中,测试时可能可以获得物体的部分几何观测。我们提出了一种无需训练的框架,将此类证据融入预训练的图像到3D生成模型中,而无需重新训练或微调。为此,我们使用定义在模型占据表示上的射线一致观测似然来引导生成,结合了表面占据和自由空间证据。将该方法应用于SAM 3D及其多视图扩展,我们的方法在不同可观测性水平下显著提升了几何保真度以及视觉质量。我们的结果表明,预训练的图像到3D模型可以通过显式的测试时引导有效整合部分几何观测,在不修改底层模型的情况下补充其学习到的生成先验。
间隙熵猜想的肯定性解决 P. M. Aronow 2026-09-09 PDF 我们证明了在固定置信度最佳臂识别问题中的间隙-熵猜想,该问题针对独立的单位方差高斯臂,均值位于$[0,1]$,且存在唯一最优臂。对每个次优臂$i$,令$Δ_i=μ_-μ_i$为其与最优均值的间隙,并记$H=\sum_{i\ne }Δ_i^{-2}$。令$p_r$为满足$2^{-(r+1)}<Δ_i\le2^{-r}$的臂对$H$所贡献的比例,并令$\mathrm{Ent}(I)=\sum_{r:p_r>0} p_r\log(1/p_r)$。在所有对每个高斯实例都以至少$1-δ$的概率识别出最优臂的算法中,在给定实例上、对所有臂标签排列取平均的最优期望样本数,与$H(\log(1/δ)+\mathrm{Ent}(I))$相差绝对常数因子。此外,存在一种不依赖于实例的算法,其期望样本数被该量的某个常数倍加上$g^{-2}\log\log(e^e/g)$所界定,其中$g=\min_{i\ne *}Δ_i$为到最接近竞争者的间隙。
刻画极限中的语言生成:有限见证与分离宽度层级 Xiaoyu Li 2026-09-09 PDF 极限语言生成要求从任意未知无限语言的穷尽正呈现中生成有效的未见元素。我们刻画了可数全集上任意语言族的这一任务。生成可行当且仅当每个目标可被赋予一个有限正见证,使得任何有限样本所激活的目标具有无限共同交集。必要性方向来自一个通用归一化:通过未确认历史的搜索,将任何成功的生成器转换为仅依赖于已观测集合的生成器。随后我们追问相容见证必须有多大。正分离宽度记录了最小的均匀大小界,并进一步分为两个层级:无界有限见证以及不存在任何相容有限见证分配。每一层级都会出现。可数族允许单元素见证,显式族可实现每个有限宽度,而两个具有无限共同核的族之并则需要无界有限见证。最后,可数支撑与有限剖面障碍解释了为何局部组合数据无法判定极限生成。该刻画与完整宽度层级已在 Lean 中检验,包括简化归一化和一个直接对角捕获引理。随附的 Lean 开发维护于 https://github.com/xiaoyulics/language-generation-characterization
基于堆叠集成学习的水稻品种分类精度研究 Md. Masudul Islam 2026-09-09 PDF 水稻是全球相当一部分人口的主食,其品种呈现出显著的多样性,这给消费者、贸易商和农民准确识别带来了巨大挑战。这种复杂性往往助长欺诈行为,例如未经授权混合不同种类的大米,从而损害供应链中的质量和信任。尽管这一问题至关重要,但现有研究仍未能提供稳健且高效的方法,以基于颜色、大小和质地等外部特征对水稻品种进行精确分类。为弥补这一空白,本研究提出了一套综合性的水稻品种识别框架,旨在提升透明度和质量保障。我们开发了一种适用于水稻品种分类的堆叠集成模型,并构建了一个包含20个水稻品种的综合数据集,每个品种都具有独特的视觉特征。所提出的方法实现了前所未有的100%分类准确率。此外,我们将该模型集成到一款移动应用中,使即便是新手用户也能借助智能手机摄像头拍摄的籽粒图像轻松识别水稻品种。这些发现凸显了先进机器学习技术在减少欺诈行为和确保严格水稻质量控制方面的变革潜力。我们的工作对农业利益相关者具有重要意义,为自动化作物识别系统铺平了道路,并推动了精准农业实践的发展。
展示框架:仅凭一个视觉语言模型智能体就能操控机器人 Yanzhe Chen 2026-09-09 PDF 基础视觉语言模型(VLMs)展现出关于世界的广泛智能,但将这种智能转化为机器人控制仍然具有挑战性。我们提出 Show-Harness,一种具身 Harness,使 VLMs 能够通过一个连接意图与动作的紧凑语义接口来“玩”机器人。Show-Harness 暴露离散的语义动作单元,VLMs 可以自然地对其进行推理,而具身特定的解释器确定性地将其落地为本地机器人动作,使 VLM 直接负责细粒度的物理决策。通过同一接口,Show-Harness 展示了以下可行性:(1)直接解锁闭源前沿 VLMs 以实现零样本机器人控制;(2)仅用几个 GPU 小时的微调即可适配小规模开源 VLMs 以实现低成本部署。我们进一步开发了 GUMI(GUI Manipulation Interface),它将相同的语义动作空间扩展到基于 GUI 的演示收集,使人类和智能体能够跨具身“玩”机器人,而无需专门的遥操作硬件。大量实验表明,配备 Show-Harness 的 VLM 智能体在任务、具身和环境之间稳健泛化,优于代表性的智能体范式和 VLA 范式。这些结果表明,正确的接口可以从基础 VLMs 中解锁可观的具身能力,而无需额外的模型容量或昂贵的具身特定预训练。
通过零私有容量量子信道的私密通信 Chengkai Zhu 2026-09-09 PDF 在含噪量子信道上的私密通信要求向接收方可靠传输并对环境保密。两个私密容量为零的信道能否联合实现私密通信,是量子信息论中一个长期未决的问题。本文通过构造一个四能级信道和一个擦除概率为二分之一的量子比特擦除信道解决了这一问题,二者各自的私密容量均为零,但联合使用可实现每乘积次使用超过0.0001903个私密比特。该编码使接收方获得线性信息增益,同时环境泄漏至多为二次型,从而通过固定的联合测量和经典编码实现私密性。这种超激活现象对于独立的经典无记忆窃听信道是不可能的,它表明信道的私密容量本身并不能决定其在安全通信中的价值。最初的激活实例是通过与大语言模型交互而发现的,该结果已在Lean 4中形式化。