| 学习追踪塞伯格对偶 |
Jonathan J. Heckman |
2026-07-30 |
PDF |
对偶性在建立广泛物理系统中的微观现象与涌现现象方面扮演着重要角色。然而,在实践中,即使所有“游戏规则”众所周知,确定两个系统是否对偶也常常在计算上具有挑战性。换句话说,面对两个系统时,如何高效地确认它们实际上是对偶的?在本文中,我们利用机器学习方法来解决超对称箭图规范理论中的塞伯格对偶问题。从数学角度看,这涉及建立箭图的突变,而这又是“学习解纽结”主题的一个变体。一方面,这引导我们开发出一个实用工具,用于确定不同对偶性的计算复杂度。另一方面,它也使我们能够研究不同网络架构如何学习追踪塞伯格对偶。我们发现,对于具有适度数量箭图节点(约10个)的箭图,由变换器和多层感知器组成的各种网络架构往往优于确定性算法。通过将网络与成熟的路径查找算法(本质上是“箭图的谷歌地图”)相结合,搜索策略的效率和准确性得到了进一步提升。我们预期,这类问题可以作为前沿AI模型应用于理论物理的有用基准。 |
| ReToken:一种用于提升视觉-语言模型在视觉检索任务中性能的单一令牌方法 |
Yao Xiao |
2026-07-30 |
PDF |
长视觉上下文对视觉-语言模型构成挑战:随着干扰物数量增加,性能下降,且在GPU内存限制下,一次性处理所有token在计算上不可行。我们提出ReToken,一种单一可学习嵌入,作为显式检索目标进行训练,从预填充的视觉KV缓存中选择一组稀疏的查询相关视觉token。仅在小规模图像问答数据集上训练,ReToken在图像和视频基准测试中均取得一致提升:在Visual Haystacks上,它使Qwen3VL-8B提升13.4个百分点,InternVL3.5提升12.4个百分点(相对提升超过20%),在LVBench上,它零样本迁移至长视频,为Qwen3VL-8B带来8.0个百分点的增益。得益于其轻量设计,训练和长视频推理均可在单个H100上完成。代码可在 https://github.com/avaxiao/ReToken 获取。 |
| ACE-Data-0:以人为中心的具身数据引擎的环境捕捉 |
Yukang Cao |
2026-07-30 |
PDF |
具身智能面临一个根本性的数据瓶颈。模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随着人类在时间中追求目标而共同演化。现有数据集将这些经验分散在不同的视角、模态或空间尺度上,使得完整的感知-行动循环仅被部分观测。我们引入了环境捕捉引擎(ACE),一个以人为中心的数据引擎,将真实家庭环境转变为空间校准、时间同步的录制工作室。ACE在两种互补尺度上运行:桌面尺度配置解析手-物操作,而房间尺度配置捕捉全身运动、移动以及在家具环境中的交互。ACE将自我中心和多视角外部视频、全身和关节手部运动、物体几何与六自由度轨迹、音频和触觉信号统一记录为多感官流。利用ACE,我们构建了ACE-Data-0,包含150小时和1700万视频帧,覆盖200个任务类别,由50名参与者在2个环境中执行,总计75,000个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为变异。我们进一步引入了一个分层基准,从信号进展到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动和长时间跨度下的显著差距。ACE-Data-0提供了同步的人类演示,带有对齐的感知、运动和接触监督,为模仿学习、世界模型、视觉-语言-行动系统和具身AI提供了可扩展的基础。 |
| PhiZero:围绕物理语言构建的世界模型 |
Shuyao Shang |
2026-07-30 |
PDF |
我们介绍PhiZero,一个围绕物理语言构建的物理世界模型,物理语言是状态转换的一种紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象预测结构并将其组织为自然语言以进行显式推理的能力启发,我们通过自监督从野外视频中学习物理语言,并利用它显式推理物理世界如何演变。因此,PhiZero采用先推理后渲染的范式:它首先将未来世界演变推断为物理语言序列,然后将推断的转换渲染成视频。在生成和理解基准上的广泛实验验证了PhiZero建模物理一致世界演变的能力。我们进一步展示了其在现实和交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。 |
| PAC-MAN:感知感知的CBF-RL用于人形躲避球中的全身安全 |
Lizhi Yang |
2026-07-30 |
PDF |
我们提出了PAC-MAN,一个感知感知的CBF-RL框架,它将控制障碍安全性与部署现实的机载感知相结合,用于全身人形躲避球。部署的策略仅通过头戴式摄像头的分割掩膜深度看到球,而训练时的CBF引导则代表每个身体链接的间隙,并且对抗性运动先验正则化了由此产生的闪避反射。我们在一个受控的任意链接接触基准上进行了评估,该基准包含两种模式的种子投掷:单次投掷和部署循环,其中机器人在投掷之间走回其站点并恢复。在此基准上,该策略的表现接近特权状态预言机:仅固定机载摄像头就足以进行闪避。我们发现,有用的障碍结构依赖于感知可观测性:联合CBF在准确的球状态下表现最佳,在固定摄像头观测下仅作为训练引导时性能下降,并通过球跟踪云台或特权运行时滤波器恢复。因此,我们在真实世界中零样本部署了一个轻量级链接CBF策略在Unitree G1上,它能容忍不完美的感知,在95%的投掷中成功,并使用语义分割来躲避不同的球。 |
| AskChem:面向化学文献综合的以声明为中心的基础设施 |
Bing Yan |
2026-07-30 |
PDF |
化学文献综述通常需要整合分散在众多出版物中的具体发现,然而现有的文献检索系统主要返回排序后的文档列表。因此,科学家和AI代理需要自行定位相关信息、验证其来源,并手动整合跨论文的答案。我们提出了AskChem,一种以声明为中心的跨论文化学检索基础设施。AskChem将检索单元从论文转变为携带来源的声明:每篇论文被转换为原子化、类型化的声明,每条声明均以源DOI和逐字引用或明确的证据定位符为依据。在此共享声明存储之上,AskChem提供了互补的检索与综合结构:一个稳定的分面分类法用于层级检索和浏览,一个通过关系连接声明的证据图,以及一个将索引论文置于科学原理之下的探索性动态分类法。AskChem目前索引了来自147K篇论文的240万条声明,并提供网页界面,以及面向AI代理的REST、SDK和MCP访问。在AskChem-Bench上,将GPT-5.5阅读器基于AskChem进行检索,可实现100%可解析的DOI,而未检索时为88.3%,并且在五个测试系统中拥有最高的引用密度。AskChem已上线,网址为https://askchem.org。 |
| AISPA:面向大型语言模型应用的以用户为中心的系统提示审计 |
Xiangning Lin |
2026-07-30 |
PDF |
系统提示词是由开发者配置的指令,用于管理AI应用中基础模型的行为。它们在商业AI产品中广泛使用,但很少向公众或监管机构披露,这在AI系统的广泛部署中造成了严重的信任和问责缺口。本文介绍了人工智能系统提示词保障(AISPA),这是一个以用户为中心的框架,用于系统审计AI系统中的系统提示词。AISPA检查系统提示词的特定部分,并沿八个对用户重要的维度进行评估。我们随后使用此框架审查了88个商业AI产品中系统提示词的3,249条指令,将每条指令分类为保护性(对用户)或问题性。我们的审计揭示了四个核心发现。首先,系统提示词的设计在不同产品和开发者之间存在显著差异,一些组织每个产品平均包含超过60条保护性指令,而其他组织平均少于5条。其次,保护性指令被广泛采用但范围浅显:98.9%的产品至少包含一条,但只有24%覆盖了AISPA分类法的所有八个维度。第三,系统提示词持续变得更长且更保护用户,表明用户保护在商业提示词设计中正成为更明显的关注点。第四,尽管有这些进展,问题性指令仍然普遍存在:大约40%的产品包含至少一条违背用户利益的指令,且保护性和问题性指令经常在同一提示词中共存。我们的发现强调了在商业AI产品的系统提示词中需要更大的透明度、标准化和独立监督。 |
| Chimera:混合视觉扩散Transformer的设计与Chinchilla缩放 |
Chongjian Ge |
2026-07-30 |
PDF |
视觉生成日益需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次成本变得难以承受。我们引入了Chimera,一种混合视觉扩散骨干网络,配有理性的缩放策略。Chimera将文本、图像和视频令牌按光栅顺序处理为单一流,无需位置嵌入。它结合了Kimbi Delta Attention(KDA)用于长上下文状态跟踪,复杂度为O(N),交错的多头潜在注意力(MLA)用于直接全局交互,以及模态感知的短卷积用于局部时空上下文。稀疏专家混合(MoE)层扩展容量,同时控制激活计算量。为扩展这种异构架构,我们提出了HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度,在宽度和深度间转移超参数。HeteroP产生一个一致调优的家族,用于拟合类似Chinchilla的计算最优法则,涉及激活模型大小、训练令牌数和图像-视频数据比例。依据这些法则,我们训练了一个拥有110亿参数、20亿激活参数的Chimera模型。实验显示三个结果。首先,以预训练扩散损失衡量,密集骨干网络比匹配的全注意力Wan-2.1 2B基线计算效率高1.7倍,而完整系统达到7.3倍。其次,无需长度特定微调,Chimera从5秒训练片段零样本外推至30秒视频,最后五秒仅6.5%的FID退化。第三,拟合法则显示,计算最优的图像预训练在激活模型大小和训练令牌数间几乎均分计算,而视频预训练在更高预算下适度偏向模型大小。这些结果为设计和扩展高效长上下文扩散架构奠定了基础。 |
| OSReward:为跨平台计算机使用奖励模型建立标准化评估体系 |
Qiushi Sun |
2026-07-30 |
PDF |
计算机使用智能体(CUA)在数字世界中迅速发展。CUA轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是CUA评估、数据整理和强化学习的核心。人工编写的验证器或人工标注员都无法大规模提供此类验证,因此该领域日益转向使用视觉语言模型(VLM)作为CUA轨迹的评判者。但一个根本性问题长期未被审视:这些VLM评判者是否足够可靠?为系统研究此问题,我们引入了OSReward,一个真实、高质量的基准,用于评估VLM评判者在CUA轨迹上的表现。这些轨迹来自多样化的智能体骨干,执行跨平台的人工验证指令,并通过多阶段人工标注严格标记了地面真值判定。在此基础上,我们衍生出OSReward-Hard,一个专注于真正困难案例的挑战集,以及OSReward-Multi,用于细粒度的效率和一致性评分。迄今为止最全面的VLM评判者评估发现,即使是最先进的模型也未能达到理想评判者的标准,存在系统性宽松偏差,将失败运行误标为成功。少数足够可靠可信任的模型,其运行成本过高,难以大规模应用,而价格实惠的开放模型则远远落后。为弥合这一差距,我们构建并发布了OS-Shepherd-100K,一个面向CUA社区的、带有推理注释的轨迹判定开放语料库。在此基础上,我们训练了OS-Shepherd(9B和35B),这些开放奖励模型提供低成本、稳定且可靠的奖励信号,以比前沿模型低30-60%的成本匹配商业评判者。广泛的分析进一步为大规模可靠CUA奖励的设计提供了信息。我们的代码、基准、数据集和模型检查点可在https://os-copilot.github.io/OSReward-Home/获取。 |
| KAISEN:临床风险模型的可复现亚组公平性审计 |
Sparsh Roy |
2026-07-30 |
PDF |
临床风险模型通常在整体表现上表现优异,但在不同患者亚组间的错误率却存在显著差异。为此,已有审计流程被提出以捕捉这一问题,但其组成部分很少经过压力测试,因此尚不清楚审计的哪些部分在何种条件下可被信赖。我们提出KAISEN,一个五阶段审计流程,涵盖亚组分层、差异测量、机制诊断、事后缓解和漂移监测,并在一个包含16种疾病任务、来自健康人群2030的15个社会决定因素轴及三个预设交叉点的合成基准上评估至失效点。四项发现如下。(i)显著性追踪每个轴相对于其自身最小可检测效应的差距:在15个轴上,显著性计数与原始均等几率差(EOD)之间的秩相关系数为rho = 0.56,当EOD按该下限标准化后升至rho = 0.78。(ii)分组阈值优化在48次保留运行中全部降低了EOD(配对delta = -0.285,95% CI [-0.313, -0.252]),而分组Platt缩放——作为更好的校准器——在EOD上表现如抛硬币(48次运行中19次改善,95% CI [0.26, 0.55]),平均效应接近零,因此审计应报告的是方差而非平均值。(iii)机制诊断在144个受控案例中全部正确分类,但在代理误设下未能恢复48个模型驱动案例中的任何一个,且无任何失败信号。(iv)CUSUM失效和误报追踪队列实现远多于疾病:在参考阈值下,所有27个误报和8个漏检移位中的7个来自不同种子(卡方p = 0.002),因此在一个队列上调优的阈值无法迁移。所有结果均为合成数据,具有已知真实值,不确立临床有效性。重现每个数字的代码、工件和脚本均已发布。 |