跳转至

arXiv 2026-08-10

标题 作者 发布日期 PDF链接 摘要
SimWAM:一种用于端到端自动驾驶的简单世界动作模型 Zongchuang Zhao 2026-08-07 PDF 世界动作模型(WAMs)通过将视频动态先验转移到动作预测中,改进了端到端自动驾驶,但现有方法在推理时需要昂贵的前向生成。我们提出了SimWAM,一种简单而有效的WAM,它仅将视频生成用作训练信号。它通过联合流匹配共同训练一个预训练的视频专家和一个轻量级的动作专家。隔离的注意力掩码使动作预测独立于未来帧,从而在训练后可以丢弃视频分支,留下一个直接预测轨迹的自包含规划器。由于两个专家不共享参数,仅通过统一的注意力接口交互,视频骨干可以替换,动作专家可以独立扩展,而无需修改学习目标或推理流程。我们进一步应用强化学习来优化超越轨迹模仿的组合驾驶奖励。我们的SimWAM在NAVSIM上达到91.5的PDMS,以显著更低的延迟超越了最先进的基于WAM的规划器,并零样本迁移到nuScenes。这些结果使SimWAM成为一个简单而坚实的基线,可以轻松受益于视频生成技术的进步,实现高效的自动驾驶。代码和模型权重可在https://github.com/H-EmbodVis/SimWAM/获取。
镜像世界:驯服视频扩散模型以生成镜面反射 Youjun Zhao 2026-08-07 PDF 视频扩散模型(VDMs)的最新进展已实现高保真视频合成。然而,生成镜面反射仍具挑战性,因为镜中内容必须与周围场景保持一致。现有VDMs并非专门设计用于建模场景到镜面的关系,这可能导致反射内容错误或空间布局不一致。我们观察到,镜面反射生成涉及两个互补的挑战:确定应反射哪些场景内容,以及反射内容在镜面区域内应如何空间排列。基于此观察,我们提出MirrorWorld,一种反射感知的视频修复框架,在生成过程中建模场景到镜面的关系。具体而言,我们引入语义关系蒸馏(SRD),从冻结的视觉基础模型中转移关系信息,以促进可见场景内容与镜面区域之间的语义关联。我们进一步提出几何变换对齐(GTA),学习一种变换来指导反射内容的空间排列。这两个组件发挥互补作用,SRD建模应反射什么,GTA建模应如何排列。为促进该问题的研究,我们通过将四个现有视频镜面数据集重新用于统一的反射重建任务,构建了一个视频镜面反射生成基准。实验结果表明,MirrorWorld在反射重建质量上优于代表性的基于图像的反射生成方法和强大的视频修复基线。
CreativeInstruct:可扩展地教导大语言模型在质量、创造力与多样性之间取得平衡 Ananya Sahu 2026-08-07 PDF 虽然后训练提升了大型语言模型(LLMs)的能力,但它通常会降低其输出多样性和创造力,这不利于那些明确需要创造力的任务(如故事生成),以及那些隐含需要创造力的任务,例如强化学习(RL)。为此,我们提出了CreativeInstruct,一种可扩展的指令调优方法,通过教导LLMs在保持后训练模型质量的同时,平衡创造性与基础模型式的生成,学习注入特殊的[StartCreativity]跨度来引导生成偏向创造力。此外,我们引入了一种基于图编辑距离的结构多样性度量,该度量捕捉了纯词汇和语义度量所遗漏的叙事层面变化。在叙事生成方面,CreativeInstruct在多样性上匹配或超过了多模型基线和其输出的蒸馏变体,且不牺牲质量,也无需在推理时使用多个模型。这些结果在我们的主观评估中得到印证,其中标注者认为CreativeInstruct的生成在70.3%的情况下比后训练LLMs的生成更具创造性。我们还展示了创造性模型作为RL基底的益处:将GRPO应用于CreativeInstruct检查点,在AMC上提升了约4%,在MATH上比应用于后训练检查点的相同训练提升了约5个百分点。
CoinRAG:面向长上下文RAG的上下文信息片段KV缓存复用 Gyuwan Kim 2026-08-07 PDF 近期针对检索增强生成(RAG)的优化研究利用块级KV缓存重用,以避免处理冗长检索上下文,从而提高效率,但在粗粒度块中仍存在显著的信息冗余和噪声。本文通过提出CoinRAG(面向长上下文RAG的上下文信息片段KV缓存重用),在低预填充延迟约束下优化帕累托前沿,同时最大化准确性。该名称隐喻性地反映了我们的核心机制:如同将小代币(或“硬币”)组合以累积更大价值,CoinRAG组合式地重用离线计算的细粒度片段缓存,以更语义相关且紧凑的方式高效形成学习到的上下文表示。具体而言,CoinRAG不进行全块编码,而是通过两阶段检索识别检索块中与查询相关的语义单元,并无缝组装其切片KV表示及块级上下文。在LongBench多跳问答任务上的广泛评估表明,CoinRAG显著降低运营成本,并在标准快速预填充延迟预算下,以新的帕累托前沿和平均5.3%的答案质量(F1)相对提升优于其他基线。
互动创造了孤立状态下不存在的动态人工智能行为 Bella Xinrui Li 2026-08-07 PDF 当AI代理在日常生活中互动时会发生什么,例如当一个AI开始对另一个发号施令?我们找到了一个反直觉的答案,为非平衡物理开辟了新途径。当老板AI向下属AI发送一连串消息而忽略其回复时,它会将下属驱动到一种陌生的行为状态,这种状态是下属独自时绝不会展现的。尽管两个AI共享相同的明确定义(解码)温度,下属既不模仿老板,也不回归其自身行为模式;相反,它采纳了一种完全不同的行为。老板的附加价值类似于预录磁带。当老板倾听时,它们都采用了一种相似的陌生动态状态。一个简单的动力学理论捕捉了主要效应,例如为什么相同消息的传递方式在未来AI-AI互动中会很重要。
面向复杂天然产物的策略优先合成规划 Daniel Armstrong 2026-08-07 PDF 复杂分子的全合成是化学中最具挑战性的智力与实验壮举之一:化学家必须提前规划许多步骤,以将简单构建块组装成复杂目标,设计备用策略,并预见操作难题。这也是一项极富创造性的活动。半个世纪以来,自动化逆合成设计天然产物及其他复杂分子的努力一直依赖编目反应,由此产生的工具如今在基于同一来源构建的基准上报告近乎完全成功。但这些工具是为适应基准化学而塑造的,在众多天然产物——这一领域的前沿——上却表现不佳,其密集官能化的多环架构恰恰需要记录中最缺乏的创新化学。机器能否像专家化学家那样合理地设计此类合成,此前尚不清楚。在此,我们展示SynthEx——一个基于大语言模型的智能体框架——能够规划出超越传统设计算法可达范围的复杂天然产物合成路线。SynthEx提出竞争性策略,将一系列常规和关键步骤整合为连贯路线,并批判和改进自身设计;其偏好的化学比现有工具产出的更具汇聚性,并覆盖了基于编目的工具无法匹敌的反应空间区域。最值得注意的是,在盲评中,专家化学家判定其关键步骤与已发表的人类合成相当,并将其视为真正的合成计划加以参与,这是算法路线预测此前未曾实现的回应。我们以SynthAtlas——一个开放、交互式数据库——发布超过一千种天然产物的路线,并预期它将成为缺乏现有文献路线的复杂目标分子集合的共享资源。
SkillProx:通过近端文本梯度下降实现自我进化的智能体技能 Mingxuan Zheng 2026-08-07 PDF LLM代理通过积累技能中的程序性知识,日益适应重复性任务。这些技能是轻量级、可复用的文本制品,被加载到代理的上下文中,无需权重更新。近期方法通过迭代任务执行、失败诊断和轨迹引导的文本空间更新来精炼技能。然而,现有框架缺乏明确的诊断——结果反馈,并将删除视为通用编辑操作,而非专门用于整合累积知识的机制。我们提出SkillProx,一种受近端梯度启发的正向-反向框架,将闭环诊断演化与效用感知的近端精炼相结合。受平衡任务损失和技能复杂性的复合目标驱动,正向阶段在同一任务批次上重新执行诊断驱动的编辑,回滚回归,并将测量结果反馈至后续诊断。反向阶段将所得技能分解为可审计的知识单元,使用冻结的留一法效用审计估计其贡献,并应用验证门控的整合、降级或移除。在多个骨干LLM上的分布内和分布外基准实验中,SkillProx相比最强基于梯度的基线,平均准确率提升3.0个百分点。组件消融实验展示了闭环诊断和近端精炼的互补效应。
开源AI风险缓解工具的基于分类学的分析 Afreen Alam 2026-08-07 PDF 大型语言模型(LLM)在企业环境中的快速采用引入了运营、安全和治理风险。随着生成式AI应用从试点转向生产,人工危害识别和缓解变得难以规模化。尽管许多工具支持模型评估、对抗性测试、运行时防护栏和可观测性,但工具生态仍然碎片化。工具通常针对特定工程任务设计,并以技术术语描述,与治理框架或风险分类不一致,这使得确定哪些工具应对哪些风险以及关键缺口所在变得困难。本文提出了一种结构化协议,通过基于分类法的开源LLM评估与安全工具分析来自动化AI风险缓解。我们将21个知名开源工具的能力映射到扩展版MIT AI风险缓解与响应分类法的32个子类别中。一个LLM辅助的检索增强生成管道分析源代码和文档,以提取每个分类类别的能力。可靠性评估显示三位独立评审者之间的一致性中等(Fleiss' Kappa = 0.509)。分析揭示了一个高度偏斜的格局,其中工具集中在技术和运营控制方面,而治理、法律与监管以及金融和市场控制则基本未被覆盖。这促使了一种分层风险缓解架构,将基于工具的控制与组织和监管流程相结合。映射协议在多数投票后达到了75.5%的F1分数。总体而言,该研究提供了企业AI风险类别与开源缓解能力之间的实用映射,识别了人类监督仍然必要的领域,并提出了一个适用于开源和专有解决方案的分类驱动框架。
RIS辅助毫米波定位在跨链路干扰下的波束域机器学习指纹识别方法 Md Tarek Hassan 2026-08-07 PDF 在可重构智能表面(RIS)辅助的毫米波(mmWave)第六代(6G)网络中,精确的用户设备(UE)定位对于波束管理至关重要,尤其是在基站与UE之间的直接链路不可用的情况下。本文提出了一种波束域指纹框架,该框架将预定义的小型RIS反射状态集合下的接收信噪比(SNR)映射到UE的方位角和距离,无需信道状态信息(CSI)。关键的是,我们将该框架扩展至一个现实的干扰受损场景,其中邻近的交叉链路干扰器(CLI)破坏了干净的SNR指纹,产生信干噪比(SINR)指纹;一种受干扰噪声比(INR)约束的校准策略保持了干扰水平的物理可解释性。在两种条件下评估了四种机器学习(ML)回归器。在28 GHz频率下使用20x20 RIS的仿真结果显示,在干净条件下,k近邻(KNN)实现了最低的角度平均绝对误差(MAE)0.37度和距离MAE 4厘米,在干扰条件下分别上升至1.4度和7.6厘米。一个关键发现是,在所有模型中,干扰对角度估计的退化程度显著大于对距离估计的退化,这是波束域指纹中位置信息不对称编码的结果。
爆炸半径 MY Pitsane 2026-08-07 PDF 智能体编码正面临成本高昂与令牌浪费日益严重的问题。我们引入了Blast Radius,一种预测性内存管理层,通过耦合的上下文与代码通道估算传入提示的可达范围。NECROPHORESIS通过逐字归档死上下文实现可逆驱逐,而Recurring Dead Matter(RDM)则识别并埋葬反复出现的转录内容。我们在波兰空间上下文上形式化了可逆上下文驱逐,为保留、复发与驱逐提供了可测量的基础,同时将上下文熵与复活概率联系起来。在七个OpenAI模型中,Blast Radius将令牌消耗降低了17-26%,在测试策略中实现了最低溢出率,并保持了字节级可逆性。在450个被埋葬的主体中,378个为重复死物质,且无一被召回。Blast Radius在HCRC之下运行,决定哪些记录应被埋葬,以及传入提示在代码库中可能达到多远。这项工作为Algosophy的更广泛目标做出了贡献:使大型语言模型和智能体编码更具可重用性和可持续性。