跳转至

arXiv 2026-07-29

标题 作者 发布日期 PDF链接 摘要
传递接力棒:轨迹中继的在策略蒸馏 Haolei Xu 2026-07-28 PDF 在策略蒸馏(OPD)将学生自身轨迹中的token级监督作为基础,但存在前缀失败问题:一旦学生陷入错误的推理方向,后续所有生成都建立在这一偏差之上,产生误导性的延续,导致不可靠的监督并浪费计算资源。我们识别出失败前缀上师生延续的不对称性——教师倾向于重新引导方向,而学生则沿原方向继续——并将其转化为中继在策略蒸馏(Relay-OPD)中无标签的交接触发机制。训练时,Relay-OPD通过让教师在检测到的触发点短暂接管以生成教师段,随后学生恢复并在该轨迹上优化,从而构建中继轨迹。有限的中继预算将干预集中在关键早期位置,同时限制对学生策略的偏离。以Qwen3-4B-Instruct-2507为教师、Qwen3-0.6B/1.7B-Non-Thinking为学生,在八个数学推理基准上,Relay-OPD在每个基准上均取得最佳或次佳结果,1.7B模型平均超越标准OPD +5.73%、最强基线FastOPD +1.49%,0.6B模型也获得一致提升。训练轨迹长度减少超过50%。
$π\mathbf{R}^2$:反应式实时流策略 Sungjae Park 2026-07-28 PDF 通用操作策略日益采用基于大规模预训练骨干网络的动作分块流策略。这类分块以开环方式运行,导致策略无法响应执行过程中到达的感知输入,牺牲了反应性。更频繁地重新规划可以恢复反应性,但感知到动作的流水线(大型骨干网络加多个去噪步骤)速度过慢:这种延迟阻碍了频繁重新规划,并使已提交的动作过时,使得此类策略不适合动态闭环控制。我们提出πR²,在保留大型骨干网络、表达性多模态策略和多动作预测的同时,使这些策略具备反应性和实时性。基于扩散强迫的逐位置噪声调度,πR²贡献了两个核心思想。首先,它将条件输入分为快速通道(本体感知,每周期更新)和异步更新的慢速通道(视觉语言特征),使策略能在分块内响应本体感知,同时容忍过时的视觉信息。其次,延迟自适应流调度将进行中的动作视为修复条件,每次调用仅需一个去噪步骤即可生成动作,使单一训练模型能适应不同硬件延迟。πR²对现有架构改动极小,可从预训练策略微调:在真实xArm6+XHand平台上应用于GR00T-N1.7时,其闭环重新规划速度约为基础策略的4倍(A5000 GPU上约25Hz),每40ms基于新观测执行动作。在仿真和真实世界操作任务中,πR²相比最强基线在仿真中成功率提升最高达23%,真实世界中提升30%。项目页面:https://pi-r2-flow.github.io/
在不确定之处投入专家:面向混合专家LoRA的置信自适应路由 Tom Saliencro 2026-07-28 PDF 混合专家(MoE)变体的低秩适配(LoRA)将每个token路由到固定数量的专家$k$。不同token在模型对其的不确定性上存在差异,因此单一$k$值会在简单token上过度消耗计算资源,而对困难token则分配不足。我们观察到路由器的输出分布本身已包含每个token的不确定性信号:峰值集中的分布表示置信度高,而平坦分布则代表模糊性。我们提出CARE(置信自适应专家路由),该方法以核采样方式接纳专家。专家按路由器权重递减顺序激活,直至其累积权重达到阈值,并在已接纳专家存在分歧时进行小幅扩展。预算调节器校准该阈值,使活跃专家平均数量与任意目标值匹配。CARE是一种即插即用、单次前向传播的规则,无需额外参数。在LLaMA-3.1-8B和Qwen2.5-7B的八个常识推理基准测试,以及数学、代码和知识任务中,CARE在相同计算量下优于固定top-k MoE-LoRA,并在激活更少专家的情况下达到固定k=4基线的性能。相同的置信度与分歧信号还能在分布外检测中超越MSP、熵和多轮代理方法。我们通过核保真度、预算最优性以及分歧的认知解读支持该设计,并已开源代码。
重新思考乳腺X线摄影迁移学习:面向乳腺癌筛查与病灶诊断的数据集引导迁移学习(DITL)框架 Adarsh Bhandary Panambur 2026-07-28 PDF 在乳腺X线摄影中提升分类性能,无论是针对小型精选数据集还是大规模临床队列,始终是一项持续挑战。传统迁移学习方法常忽略数据集特定特征,而近期基于邻域信息的方法局限于狭窄任务且公式僵化,限制了其在人群级数据集上的可扩展性。为应对这些挑战,我们提出数据集感知迁移学习(DITL)框架,该框架将数据集导出的难度信号与基于邻域的三元组监督整合至统一目标函数中。DITL引入两个自适应组件:(i)自适应难度加权交叉熵(A-DWCE),基于自监督特征空间中k近邻标签纯度分配样本权重;(ii)自适应邻域表征三元组(A-NR-Triplet),通过可学习边界实现类内紧凑性与类间分离性。与焦点损失不同,DITL无需超参数调优,摒弃启发式加权与固定边界,且计算开销可忽略不计,从而形成稳健可扩展的优化策略。在大型VinDR-Mammo数据集上,DITL在全图像乳腺密度分类中达到最优性能,在准确率、F1分数和AUC指标上均实现显著提升(p < 0.0001)。除大规模队列外,DITL在小型ROI数据集上也持续取得统计显著的性能增益(p < 0.0001)。通过桥接小型病灶分析与大规模密度估计,DITL为乳腺X线摄影分类建立了临床相关、可扩展且泛化性强的框架,覆盖乳腺癌筛查至诊断的全谱系。
VetClaw:面向兽医疾病筛查的边缘-云多模态智能体系统 Syed Mhamudul Hasan 2026-07-28 PDF 我们提出VetClaw,一种用于早期兽医疾病筛查的边缘-云多智能体系统。VetClaw采用摄像头模块作为边缘传感设备,将捕获的图像(可附带症状描述)发送至服务器托管的视觉-语言模型进行零样本疾病分类。该系统将智能体交互与工作流编排分离:OpenClaw在边缘设备上提供调度、工具访问、用户交互及通知服务,而LangGraph管理包含输入验证、图像传输、模型调用、安全检查、条件路由、故障处理及结构化日志记录的状态化筛查工作流。该设计通过使系统能够收集视觉证据、调用外部模型、应用确定性安全规则并生成诊断支持警报,突破了静态图像分类的局限。结果表明,纯图像VLM预测能力有限,而症状引导及多模态输入可提升零样本分类性能。因此,VetClaw将静态预测模型转化为可调用工具、管理工作流、处理故障并升级不确定病例的协同安全感知系统。
Desktop-Delta基准测试:计算机使用模型是否理解桌面GUI转换? Abhishek Pillai 2026-07-28 PDF 计算机使用代理(CUA)日益通过桌面图形用户界面(GUI)执行长周期任务。现有基准测试主要衡量最终任务成功率或单帧定位能力,两者均无法独立评估模型能否重建动作产生的因果性任务相关状态转换——这对排除过时观测、验证进度及从失败中恢复至关重要。由于推理、远程输入、应用渲染与截图捕获存在异步性:下一观测可能延迟、遮挡、瞬态或无关,进而被误判为进度并带入后续规划。我们提出Desktop-Delta Bench(DDB),这是一个离线步骤级基准测试,包含来自约15个应用和50个任务域的新型多应用Linux轨迹中2,013个人工验证实例。DDB轨迹通过两项互补任务针对三个失效维度(状态验证、源追踪与上下文感知控制):463个三帧时序排序实例(含105个跨轨迹干扰项)及1,550个标注了5种动作及其载荷的前后对比对。我们评估了8个闭源与开源模型家族在32种排序设置和16种单动作设置下的表现,观察到持续存在的性能差距。时序排序尚未饱和:最佳无干扰项与含干扰项精确匹配率分别为65.1%和65.7%。任务上下文使干扰项识别率提升6.9个百分点,但导致无干扰项精确匹配率下降2.2个百分点;错误分析显示模型存在系统性复制给定A-B-C顺序的倾向。单动作结果表明推断动作类别比定位更难:点击F1值为0.96,拖拽为0.76,但识别出的拖拽动作通常定位良好。因此,DDB通过填补GUI定位与最终任务成功之间的诊断层缺失,补充了端到端基准测试,从而实现对桌面CUA验证、可靠性与恢复能力的针对性改进。
重新塑造的梦想家:通过潜在引导高效训练的非对称世界模型 Gaspard Lambrechts 2026-07-28 PDF 与人类在学习过程中受益于指导类似,强化学习算法可能也需要奖励之外的额外监督。利用训练过程中的额外信息来学习更好的表征和行为,一直是不对称强化学习的核心。这种学习范式在部分可观测条件下(当额外状态信息可用时)以及完全可观测条件下(当更精细的状态信息可用时)均被证明有效。聚焦于基于模型的强化学习,我们研究不对称学习对观测表征和特权信息表征的影响。首先,我们识别出名为Informed Dreamer的不对称模型驱动算法在特权信息表征学习中的局限性。随后,我们提出一种利用潜在引导的新型不对称表征学习目标,由此衍生出名为Reinformed Dreamer的新算法。在多个基准测试中的实验表明,相较于以往的不对称方法,该算法对Dreamer的改进更为稳定。
通过联邦纵向生存建模实现协作系统故障预测 Fan Yang 2026-07-28 PDF 时间-事件建模提供了一个系统框架,用于从纵向状态监测数据中估计随时间变化的失效风险、可靠性和剩余使用寿命。然而,将这些模型应用于分布式预测仍具挑战性,因为传感器轨迹和失效时间记录通常存储在不同组织或运营站点,且由于隐私或专有限制无法集中汇总。此外,经典Cox比例风险模型依赖于涉及全局风险集的不可分离偏似然函数,在标准联邦学习协议下难以直接优化。本文提出了一种用于协作式系统失效预测的联邦纵向-生存建模框架。该框架将纵向传感器表征学习与客户端可分离的离散时间风险目标相结合,使多个客户端能够在不共享原始传感器测量值或个体失效记录的情况下协作训练预测模型。从多变量传感器历史中提取的时变表征用于估计区间特定失效风险、可靠性曲线和系统剩余使用寿命。在模拟去中心化设置下对四个C-MAPSS涡扇发动机退化子集的实验表明,所提框架在异质运行条件和失效模式下,始终优于孤立本地训练的预测性能,同时保持与集中训练相当的性能。这些结果证明了联邦纵向-生存建模在协作式、数据感知的状态监测和系统失效预测中的潜力。
Wonder:视频世界模型做得更好 Jiacong Xu 2026-07-28 PDF 我们提出Wonder,一个用于实时、可控摄像机探索的通用视频世界模型。给定一张图像或条件视频,Wonder构建了一个可交互的虚拟世界,用户可通过移动摄像机实时、长期地导航,发现未观测区域并重新访问已探索场景。实现这一能力需要控制方法、记忆机制与训练策略的系统级协同设计。我们引入一种基于密集坐标场的新型摄像机条件方法,其渲染结果提供空间对齐的运动与朝向线索,使模型能够将摄像机运动直接解读为视觉证据。为支持生成上下文增长时的快速精准记忆检索,我们提出基于稀疏注意力机制的高效记忆模块,使模型在推理时仅需关注少量相关上下文标记,不受实际上下文长度限制。我们进一步开发多项技术修正自强制式蒸馏流程,提升学生模型对控制信号的响应能力,同时保留教师模型的多样化生成模式与长期记忆。这些组件共同使Wonder能够以16FPS合成分钟级多样化视频,并在长序列生成中保持连贯的几何结构、外观与动态。除图像到视频生成外,Wonder天然支持视频条件生成,允许对现有动态场景进行实时重拍。
在理想化的人工智能竞赛实验中,落后会推动不安全的发展。 Elias Fernández Domingos 2026-07-28 PDF 技术竞赛在速度与安全之间制造了紧张关系:参与者可能通过比竞争对手更快行动而获益,即使这种高风险开发是有害的。这在人工智能(AI)的辩论中尤为突出,竞争压力常被认为会激励更冒险、更忽视安全的开发行为。我们通过一个基于理想化AI竞赛的框架行为实验对此进行研究:配对参与者在不确定的时间范围内反复在"安全开发"与"不安全开发"之间做出选择。不安全开发能带来更快的进展和更高的即时收益,但会累积私人风险,风险上限根据实验条件分别为10%、60%或90%;竞赛的竞争结构保持不变,仅改变这一风险上限。预先注册的风险水平比较以及风险偏好诱发的作用均未得到数据支持。相反,基于任务重复结构的探索性分析表明,不安全行为更多受竞赛动态演变的战略状态影响,而非风险偏好:参与者更可能在对手选择不安全后也选择不安全;领先会减少不安全行为,而落后则会增加;首轮选择能预测后续行为。为解释这些效应,我们引入了一个包含四种策略(始终安全、始终不安全、条件安全、条件反社会安全)的简化演化模型,该模型复现了实验处理效应,并展示了条件性不安全行为如何被竞争性竞赛动态所偏好。实验与模型共同表明,不安全开发可能源于早期行为惯性、对手行为以及对落后的恐惧,而非单纯的风险偏好,这提示政策应聚焦于降低竞争压力并促进AI开发中的合作,而非仅关注个体风险。