跳转至

arXiv 2026-07-31

标题 作者 发布日期 PDF链接 摘要
学习追踪塞伯格对偶 Jonathan J. Heckman 2026-07-30 PDF 对偶性在建立广泛物理系统中的微观现象与涌现现象中扮演着重要角色。然而,在实践中,即使所有“游戏规则”众所周知,确定两个系统是否对偶往往在计算上具有挑战性。换言之,面对两个系统时,如何高效地确认它们实际上是对偶的?在本文中,我们利用机器学习方法来解决超对称箭图规范理论中的塞伯格对偶问题。从数学角度看,这涉及建立箭图的突变,而这又是“学习解结”主题的一种变体。一方面,这引导我们开发出一个实用工具,用于确定不同对偶性的计算复杂度。另一方面,它也使我们能够研究不同网络架构如何学习追踪塞伯格对偶。我们发现,对于具有适度数量箭图节点(约$10$个)的箭图,由变换器和多层感知器组成的各种网络架构往往优于确定性算法。通过补充成熟的路径查找算法(本质上是“箭图的谷歌地图”)来增强网络,可以进一步提高搜索策略的效率和准确性。我们预期,这类问题可以作为前沿AI模型应用于理论物理的有用基准。
ReToken:一种用于提升视觉-语言模型视觉检索能力的单一令牌 Yao Xiao 2026-07-30 PDF 长视觉上下文对视觉-语言模型构成挑战:随着干扰项数量的增加,性能下降,且在GPU内存限制下,一次性处理所有令牌在计算上不可行。我们提出ReToken,一种单一可学习嵌入,作为显式检索目标进行训练,从预填充的视觉KV缓存中选择一组稀疏的、与查询相关的视觉令牌。仅在小规模图像问答数据集上训练,ReToken在图像和视频基准测试中均取得一致提升:在Visual Haystacks上,它使Qwen3VL-8B提升13.4个百分点,InternVL3.5提升12.4个百分点(相对提升超过20%);在LVBench上,它零样本迁移至长视频,为Qwen3VL-8B带来8.0个百分点的增益。得益于其轻量设计,训练和长视频推理均可在单个H100上完成。代码可在以下网址获取:https://github.com/avaxiao/ReToken
ACE-Data-0:以人为中心的泛在感知作为具身数据引擎 Yukang Cao 2026-07-30 PDF 具身智能面临一个根本性的数据瓶颈。模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随着人类在时间推移中追求目标而共同演化。现有数据集将这些体验分散在不同的视角、模态或空间尺度上,使得完整的感知-行动环路仅被部分观测。我们引入了环境捕捉引擎(ACE),一个以人为中心的数据引擎,将真实家庭环境转变为空间校准、时间同步的录制工作室。ACE在两种互补的尺度上运行:桌面级配置捕捉手-物操作,而房间级配置捕捉全身运动、移动以及在家具齐全的家庭中的交互。ACE记录自我中心和多视角外部视频、全身和关节化手部运动、物体几何和六自由度轨迹、音频和触觉信号,作为统一的多感官流。利用ACE,我们构建了ACE-Data-0,包含150小时和1700万视频帧,覆盖200个任务类别,由50名参与者在2个环境中执行,总计75,000个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为变异。我们进一步引入了一个分层基准,从信号进展到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动和长时间跨度下的显著差距。ACE-Data-0提供了同步的人类演示,带有对齐的感知、运动和接触监督,为模仿学习、世界模型、视觉-语言-行动系统和具身AI提供了可扩展的基础。
PhiZero:围绕物理语言构建的世界模型 Shuyao Shang 2026-07-30 PDF 我们介绍PhiZero,一个围绕物理语言构建的物理世界模型,物理语言是一种世界状态转换的紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象预测结构并将其组织为自然语言进行显式推理的能力启发,我们通过自监督从野外视频中学习物理语言,并用它来显式推理物理世界如何演化。相应地,PhiZero采用先推理后渲染的范式:它首先将未来世界演化推断为物理语言序列,然后将推断的转换渲染成视频。在生成和理解基准上的广泛实验验证了PhiZero建模物理一致世界演化的能力。我们进一步展示了其在现实和交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。
PAC-MAN:感知感知CBF-RL用于人形躲避球中的全身安全 Lizhi Yang 2026-07-30 PDF 我们提出了PAC-MAN,一个感知感知的CBF-RL框架,它将控制障碍安全性与部署现实的机载感知相结合,用于全身人形躲避球。部署的策略仅通过头戴式摄像头的分割掩蔽深度看到球,而训练时的CBF指导则代表每个身体链接的间隙,并且对抗性运动先验正则化由此产生的躲避反射。我们在一个受控的任意链接接触基准上进行了评估,该基准使用两种模式的种子投掷:单次投掷和部署循环,其中机器人走回其站点并在投掷之间恢复。在此基准上,该策略的表现接近特权状态预言机:仅固定机载摄像头就足以进行躲避。我们发现,有用的障碍结构取决于感知可观测性:联合CBF在准确的球状态下表现最佳,在固定摄像头观测下仅作为训练指导时性能下降,并通过球跟踪云台或特权运行时滤波器恢复。因此,我们在真实世界的Unitree G1上零样本部署了一个轻量级链接CBF策略,它能容忍不完美的感知,在95%的投掷中成功,并使用语义分割来躲避不同的球。
AskChem:面向化学文献综合的以声明为中心的基础设施 Bing Yan 2026-07-30 PDF 化学文献综述通常需要整合分散在众多出版物中的具体发现,然而现有的文献检索系统主要返回排序后的文档列表。因此,科学家和AI代理需要自行定位相关信息、验证其来源,并手动整合跨论文的答案。我们提出了AskChem,一种以主张为中心的跨论文化学检索基础设施。AskChem将检索单元从论文转变为携带来源的主张:每篇论文被转化为原子化、类型化的主张,每个主张都基于来源DOI和逐字引用或明确的证据定位符。在这一共享主张存储之上,AskChem提供了互补的检索与综合结构:一个稳定的分面分类法用于层级检索和浏览,一个通过关系连接主张的证据图,以及一个将索引论文置于科学原理下的探索性动态分类法。AskChem目前索引了来自147K篇论文的240万条主张,并提供网页界面,以及面向AI代理的REST、SDK和MCP访问。在AskChem-Bench上,将GPT-5.5阅读器基于AskChem进行检索,可实现100%可解析的DOI,而无检索时为88.3%,并且在五个测试系统中拥有最高的引用密度。AskChem已上线,网址为https://askchem.org。
AISPA:面向大型语言模型应用的以用户为中心的系统提示审计 Xiangning Lin 2026-07-30 PDF 系统提示词是由开发者配置的指令,用于管理AI应用中基础模型的行为。它们在商业AI产品中广泛使用,但很少向公众或监管机构公开,这在AI系统的广泛部署中造成了严重的信任和问责缺口。本文介绍了人工智能系统提示词保障(AISPA),一个以用户为中心的框架,用于系统审计AI系统中的系统提示词。AISPA检查系统提示词的特定部分,并沿八个对用户重要的维度进行评估。我们随后使用此框架审查了88个商业AI产品中系统提示词的3,249条指令,将每条指令分类为保护性(对用户)或问题性。我们的审计揭示了四个核心发现。首先,系统提示词设计在不同产品和开发者间差异显著,一些组织每个产品平均包含超过60条保护性指令,而其他组织平均少于5条。其次,保护性指令被广泛采纳但范围浅显:98.9%的产品至少包含一条,但仅24%覆盖了AISPA分类法的所有八个维度。第三,系统提示词持续变长且更注重保护用户,表明用户保护在商业提示词设计中正成为更明显的关注点。第四,尽管有这些进展,问题性指令仍然普遍存在:大约40%的产品包含至少一条违背用户利益的指令,且保护性和问题性指令经常在同一提示词中共存。我们的发现强调了在商业AI产品中提高系统提示词透明度、标准化和独立监督的必要性。
Chimera:混合视觉扩散Transformer的设计与Chinchilla缩放 Chongjian Ge 2026-07-30 PDF 视觉生成日益需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次成本变得难以承受。我们引入了Chimera,一种混合视觉扩散骨干网络,并配以原则性的缩放策略。Chimera在一个无位置嵌入的光栅顺序流中处理文本、图像和视频令牌。它结合了Kimbi Delta Attention(KDA)用于长上下文状态跟踪,复杂度为O(N),交错的多头潜在注意力(MLA)用于直接全局交互,以及模态感知的短卷积用于局部时空上下文。稀疏专家混合(MoE)层在控制激活计算的同时扩展容量。为了缩放这种异构架构,我们提出了HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度,在宽度和深度间转移超参数。HeteroP产生一个一致调优的家族,用于拟合类似Chinchilla的计算最优法则,涉及激活模型大小、训练令牌数和图像-视频数据比例。依据这些法则,我们训练了一个具有20亿激活参数的110亿参数Chimera模型。实验显示三个结果。首先,以预训练扩散损失衡量,密集骨干网络比匹配的全注意力Wan-2.1 2B基线计算效率高1.7倍,而完整系统达到7.3倍。其次,无需长度特定微调,Chimera从5秒训练片段零样本外推到30秒视频,最后五秒仅出现6.5%的FID退化。第三,拟合法则显示,计算最优的图像预训练在激活模型大小和训练令牌数之间几乎均匀分配计算,而视频预训练在更高预算下适度偏向模型大小。这些结果为设计和缩放高效长上下文扩散架构奠定了基础。
OSReward:为跨平台计算机使用奖励模型建立标准化评估 Qiushi Sun 2026-07-30 PDF 计算机使用智能体(CUA)在数字世界中迅速发展。CUA轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是CUA评估、数据整理和强化学习的核心。人工编写的验证器或人工标注者无法大规模提供此类验证,因此该领域越来越多地转向视觉语言模型(VLM)作为CUA轨迹的评判者。但一个基本问题长期未被审视:这些VLM评判者是否足够可靠?为系统研究此问题,我们引入了OSReward,一个真实、高质量的基准,用于评估VLM评判者在CUA轨迹上的表现。轨迹来自多样化的智能体骨干,执行跨平台的人工验证指令,并通过多阶段人工标注严格标记了地面真值判定。在此基础上,我们衍生出OSReward-Hard,一个聚焦于真正困难案例的挑战集,以及OSReward-Multi,用于细粒度的效率和一致性评分。迄今为止最全面的VLM评判者评估发现,即使是最先进的模型也未能达到理想评判者的标准,存在系统性宽松偏差,将失败运行误标为成功。少数足够可靠的模型因成本过高而无法大规模运行,而价格适中的开源模型则远远落后。为弥合这一差距,我们构建并发布了OS-Shepherd-100K,一个为CUA社区提供的带推理注释的轨迹判断开放语料库。在此基础上,我们训练了OS-Shepherd(9B和35B),这些开源奖励模型提供低成本、稳定且可靠的奖励信号,以30-60%低于前沿模型的成本匹配商业评判者。广泛的分析进一步为大规模可靠CUA奖励的设计提供了信息。我们的代码、基准、数据集和模型检查点可在https://os-copilot.github.io/OSReward-Home/获取。
KAISEN:临床风险模型的可复现亚组公平性审计 Sparsh Roy 2026-07-30 PDF 临床风险模型通常能实现较强的总体性能,但在不同患者亚组间的错误率却存在显著差异。为捕捉这一问题,已有审计流程被提出,但其各组成部分很少经过压力测试,因此尚不清楚审计的哪些环节在何种条件下可被信赖。我们提出KAISEN,一个五阶段审计流程,涵盖亚组分层、差异度量、机制诊断、事后缓解和漂移监测,并在一个包含16种疾病任务、来自“健康人群2030”的15个社会决定因素轴及三个预设交叉点的合成基准上评估至失效点。四项发现如下。(i) 显著性追踪各轴差距与其自身最小可检测效应:15个轴上显著性计数与原始均等化赔率差(EOD)的秩相关为rho = 0.56,当EOD按该下限标准化后升至rho = 0.78。(ii) 分组阈值优化在48次保留运行中全部降低EOD(配对delta = -0.285,95% CI [-0.313, -0.252]),而分组Platt缩放——作为更好的校准器——在EOD上表现如抛硬币(48次运行中19次改善,95% CI [0.26, 0.55]),平均效应接近零,因此审计应报告的是方差而非平均值。(iii) 机制诊断在144个受控案例中全部正确分类,但在代理变量错误设定下未能恢复48个模型驱动案例中的任何一个,且无任何失败信号。(iv) CUSUM失效和误报追踪队列实现远多于疾病:在参考阈值下,所有27个误报和8个漏检偏移中的7个来自不同种子(卡方p = 0.002),因此在一个队列上调优的阈值无法迁移。所有结果均为合成数据且已知真实标签,不确立临床有效性。复现每个数字的代码、工件和脚本均已发布。