跳转至

arXiv 2026-10-05

标题 作者 发布日期 PDF链接 摘要
离策略合并优于在策略自蒸馏在持续学习中的应用 Chen Henry Wu 2026-10-05 PDF 人工智能的一个长期目标,是构建能够持续学习并自我改进的模型。对于经过后训练的模型,在新数据上进行监督微调(SFT)往往会导致泛化能力差和灾难性遗忘。因此,传统观点认为,同策略训练是持续学习的先决条件。然而在实践中,包含新知识或新能力的数据往往是异策略的。尽管同策略自蒸馏(OPSD)等方法试图通过将异策略数据转化为同策略信号来弥合这一差距,但已被证明会导致推理崩溃。在本文中,我们表明,在持续学习中,异策略合并优于 OPSD。我们首先表明,SFT 能从新数据中学到有用信号,但直接应用其更新会干扰已有能力。我们通过一种称为嫁接的简单方法减少这种干扰,该方法改变了更新学习的位置以及应用方式:(1)在较早的供体检查点上学习更新,理想情况下甚至是在预训练结束之前,并将权重更新应用于后训练模型;(2)对权重更新进行缩放,这等价于一种模型合并形式;(3)可选地,当新数据分布与后训练模型相距较远时,屏蔽最敏感的更新方向。在多种持续学习设置中,包括(1)从专家轨迹中蒸馏,(2)使用 STaR 和 Pedagogical RL 进行自我改进,以及(3)在预训练截止之后注入知识,嫁接在新任务和旧任务性能上都帕累托优于 SFT 和 OPSD,同时避免了昂贵的同策略采样。因此,我们的工作挑战了同策略训练是 RL 训练模型持续学习必要条件的观点。
通过校准的内容认证对真实图像进行认证 Sarim Hashmi 2026-10-05 PDF 生成模型能够合成高质量的非真实多媒体内容,而这些内容已经被大规模滥用。我们评估了二十种深度伪造检测器,针对过去四年发布的十种生成器,发现准确率随时间下降,从近乎完美的99.5%降至76%。对抗性扰动进一步将每个基线检测器的准确率降至2%以下,实际上反转了检测器所分配的标签。我们认为,这种不可靠性反映了一个根本性的模糊性:生成器可以精确地再现真实内容(例如通过记忆),因此仅凭内容无法揭示真实的来源标签。出于这一原因,由某个生成器产生的内容必须能够被同一生成器忠实地重建,而找到这样的重建使得合成来源变得可信,同时真实性也变得可以合理地否认。因此,我们提出并评估了一种检测范式,该范式输出关于真实性是否可以被合理否认的校准预测:任何已知生成器的忠实重建都确立了合理的可否认性,而校准则限制了来自已知生成器的内容无法被再现的频率。我们的评估表明:(i) 我们的检测器可以被校准,使得至多1%的生成内容被错误认证,在这一操作点上,大多数基线检测器达到接近零的召回率,包括准确率高达93%的最强检测器;(ii) 在被评估的有界扰动攻击空间内,对受攻击样本校准更严格的安全阈值可以将这一界限保持对抗自适应对手,这些扰动打破了每一个基线,但不覆盖任意对抗性变换;(iii) 事后可验证性正在受到侵蚀,因为3000张Reddit图像中有1116张能够抵抗2022年生成器的再现,但只有55至79张能够抵抗2024年生成器的再现。
在线分位数回归的有限样本分布理论与高效大规模推断 Ziyang Wei 2026-10-05 PDF 本文研究了使用恒定学习率的随机次梯度下降(SSGD)对大规模和流式数据进行在线分位数回归。经典的分位数回归离线推断在计算和内存上都非常密集。现有的在线分位数回归推断工作仅提供渐近保证,并且通常需要次指数尾条件来建立分布理论。为弥补这些空白,我们引入了新技术,在有限矩假设下证明SSGD的淬火中心极限定理(CLT)和有限样本高斯近似。我们进一步表明,采用恒定学习率的Ruppert-Polyak平均具有非消失偏差,并且无法满足以总体目标为中心的中心极限定理。因此,我们提出后缀平均来解决这个问题,并建立其有限样本高斯近似。基于这些结果,我们提供了一种高效的分位数回归在线推断方法,避免了协方差估计。数值实验表明,与其他推断方法相比,我们的方法实现了理想的经验覆盖率并具有竞争力的性能。我们还将该方法应用于美国工资数据,以展示其实际有效性。
编织曼巴融合:用于轻量级人脸检测的全局跨尺度交互 Dohun Kim 2026-10-05 PDF 特征金字塔方法,从FPN到BiFPN,通过融合多尺度特征在人脸检测中取得了强大性能。然而,在无约束条件下检测人脸,如小尺度、遮挡和极端姿态,仍然困难,因为这需要全局跨尺度依赖关系,而局部融合无法建模。状态空间模型如Mamba通过将特征作为序列进行扫描,以线性复杂度提供全局上下文,因此为解决该问题提供了有前景的方向。然而,这种扫描需要将两个金字塔尺度合并为单个特征图,而它们的合并方式决定了跨尺度结构是否得以保留。求和方式在扫描前将两个尺度坍缩,因此扫描没有可利用的跨尺度结构,而拼接方式保留了两个尺度但代价高得多。为解决这一问题,我们提出\textbf{Weave Mamba Fusion (WMF)},它逐列交错两个相邻金字塔尺度,使水平双向SS2D扫描的每一步从一个尺度移动到另一个尺度。通过部分通道处理和无参数去编织,WMF在保留特征结构的同时实现了高效的跨尺度交互。将WMF集成到每个融合节点中产生了\textbf{WeaveBiFPN},即我们的\textbf{WeaveFace}检测器的颈部。在WIDER FACE上,WeaveFace仅以0.34M参数和1.16 GFLOPs达到91.41\%平均AP,在0.5M参数以下超越了先前检测器。其最大增益在Hard子集上,达到87.14\% AP。代码公开于\url{https://github.com/dohun-mat/WeaveMambaFusion}。
CCQ:一个多州儿童保育质量数据集,用于支持儿童健康研究的人工智能 Victor Li 2026-10-05 PDF 早期生活中的高质量儿童保育是儿童成长与发展的关键决定因素。儿童保育质量的研究一直受限于碎片化、不利于研究且受隐私约束的数据集。我们提出CCQ(儿童保育质量),一个大规模、去标识化的数据集,用于人工智能与早期儿童健康交叉领域的应用数据科学研究。CCQ整合了美国12个州的59,372条儿童保育提供者记录,涵盖多样化的提供者类型以及数据模式。为确保研究实用性并保护隐私,我们实施了一个自动化的、基于LLM的策展流程,将各州原始记录匿名化、清洗并标准化为两个互补版本:一个清洗后的文本版本和一个完全预处理的表格版本。我们还在质量评级预测和重要特征分析上对传统机器学习模型、表格基础模型和语言模型进行了基准测试。在一个州内,预处理表格上的表格分类器表现最佳。跨州情况下,零样本迁移接近随机水平,但适度的目标州监督可恢复大部分州内性能,而在其他州上预训练有利于微调后的语言模型。我们发布这两个数据集及所有代码,以加速人工智能驱动的儿童保育质量研究,并最终改善儿童的健康与发展。
想象即行动:通过图像编辑世界模型实现高保真数据合成,用于可扩展的GUI智能体训练 Yongxin Ning 2026-10-05 PDF 图形用户界面(GUI)智能体已成为一种有前景的范式,用于跨多种应用自动化复杂的数字工作流。然而,训练高能力且可泛化的智能体从根本上依赖于大规模、高保真的视觉-动作轨迹,而这些轨迹的获取极为困难。尽管人类演示难以规模化,现有的 GUI 世界模型依赖文本描述或 HTML 渲染,丢弃了图标和布局样式等关键的像素级视觉细节。为解决这一问题,我们提出了 Infinite-Dreamer,一种由像素级图像编辑世界模型驱动的无仿真数据合成方法。通过将 GUI 转换概念化为图像编辑任务,我们利用视觉-语言模型(VLM)将动作引起的 UI 变化描述为结构化增量文本。随后,我们微调图像编辑骨干网络,以可控地合成逼真的截图转换。我们利用该模型生成单帧视觉鲁棒性数据和多步想象轨迹。为验证方法的有效性,我们仅在合成数据上微调 Qwen3-VL 基线,得到 Infinite-Actor,并在 AndroidWorld、MobileWorld 和 AndroidControl-Curated 基准上进行评估。Infinite-Actor 在各规模上均持续优于 Qwen3-VL 基线:Infinite-Actor-8B 将 AndroidWorld Pass@1 提升 +4.45,并使 MobileWorld Pass@3 成功率几乎翻倍,而 Infinite-Actor-2B 将 Pass@1 提升 +9.05。代码见 https://github.com/swaydy-n/Infinite-Dreamer。
课程大脑:构建课程知识图谱作为认知诊断的基础 Shrideep Tamboli 2026-10-05 PDF 认知诊断模型(CDMs)能够识别学生掌握了哪些具体技能、哪些尚未掌握,这正是个性化学习路径所需的信号,而单一的聚合分数无法提供。然而,这类模型鲜有部署。障碍在于其前提条件:Q矩阵,即从每道评估题目到其所要求技能的映射,历来由人工编写。我们将该任务分为两个阶段:首先构建课程自身的知识图谱,即其所包含的概念与技能的完整空间,独立于任何题目;然后按需将题目映射到该图谱上。本文仅处理第一阶段。题目映射阶段已设计但未在此实现,因此“这将判断成本从每道题目一次转变为每门课程一次”这一说法是设计依据而非研究发现。我们提出Curriculum Brain,一个双仓库系统,将版本控制的知识库与一个由十一个单一职责智能体组成的智能体流水线配对,置于一个薄层确定性编排器之下。它从官方课程文档中生成候选的概念-技能映射,依据累积规则对其进行检查,并将其与独立从教科书提取的概念-技能图谱进行比较,修复自身失败,仅在无法自行解决某一情况时升级至人工处理。在241次章节运行中(168个不同章节),41.5%产生了通过两项检查且无需补丁的生成器输出,67.6%无需升级即得到解决。这两项指标均以系统自身产生的标准来衡量,因此二者描述的是内部一致性,而非与外部标准的一致性,且二者均合并了两种流水线配置,这两种配置仅在第77次运行处有一处改动;改动之后,这两项数字分别为57.0%和91.5%。观察到的支出为每章1.19美元,仅为API支出,不含人工审核。我们同时发布该框架及由此产生的课程数据集。
PreMaQ:在生成之前预测LLM生成代码的可维护性相关质量 Taiki Wakamatsu 2026-10-05 PDF 随着大语言模型在代码生成方面能力日益增强,在软件开发中采用生成的代码不仅需要评估其功能正确性,还需要评估其与可维护性相关的质量。如果能够在生成之前估计这种质量,开发者就可以避免生成、审查和丢弃低质量代码的成本。尽管已有研究表明,大语言模型生成代码的功能正确性可以提前预测,但与可维护性相关的质量是否同样可预测仍不清楚。我们提出了生成前可维护性相关质量预测,即PreMaQ,它从大语言模型生成前的内部表示中预测生成代码的代码坏味分数和可维护性指数。我们的评估涵盖四个开放权重的大语言模型和四个Python代码生成基准,共计2695个任务。我们的结果表明,在所有16个模型-基准组合中,预测的代码坏味分数和可维护性指数均与其观测值相关,平均Spearman秩相关系数分别为0.57和0.65。当用于模型选择时,在多个模型生成功能正确代码的任务上,PreMaQ相对于随机选择所能达到的可维护性相关质量提升,达到了理想的可维护性选择器所能达到提升的59.5%。将PreMaQ的预测与提示嵌入相结合,这一比例提高到60.7%,表明这两种信号具有互补性。这些发现表明,PreMaQ可用于预测并改善大语言模型生成代码的可维护性相关质量。
关于SDE诱导核的序列半可分结构及基于核的估计问题的高效算法 Mikkel Paltorp 2026-10-05 PDF 我们研究由线性时不变(LTI)随机微分方程(SDE)诱导的核函数,该方法将关于待估计函数的先验知识直接嵌入到SDE的状态空间描述中。这种核设计视角在许多以核为核心的场景中都具有相关性,包括统计学中的核方法、机器学习中的高斯过程(GP)回归,以及系统辨识中基于核的正则化方法。由此得到的SDE诱导核函数类包含若干具有实际意义的核,例如半整数光滑度的Matérn核、样条核,以及系统辨识中使用的相关核。与这些核现有的线性时间GP回归方法(通常基于对隐状态的Kalman滤波和Rauch--Tung--Striebel平滑)不同,我们直接处理观测协方差矩阵的SSS表示。这为GP回归所需的矩阵运算带来了线性复杂度的递推算法,包括分解、线性求解、对数行列式、后验协方差、对数边际似然梯度以及后验采样;同样的生成元级递推只需稍作修改,即可扩展到系统辨识中基于核的正则化方法的类似计算。与以往在GP回归中使用SSS表示的工作相比,我们在三个与应用相关的情形中推导了用于解析边际似然梯度的高效递推算法,并开发了用于后验计算和Matheron型采样的新递推。数值实验验证了所提出递推的准确性,并展示了代表性SDE诱导核的后验推断与采样。
欠驱动双足机器人无碰撞运动的分层强化学习 Jagannath Prasad Sahoo 2026-10-05 PDF 双足机器人无法在不破坏自身平衡的情况下偏离路径以避开障碍物,而这种耦合在欠驱动平台上最为严重,例如本文所考虑的双足机器人,其每条腿有四个驱动关节,且没有髋关节或踝关节侧摆。本文提出了一种分层强化学习(HRL)框架,其中高层(HL)策略观测机器人位姿、36个射线投射近距测量值、移动障碍物状态以及滚动时域局部目标,并每隔十个控制步输出一个身体速度指令$(v_x, v_y, ω_{yaw})$,而一个以速度为条件的低层(LL)策略通过PD控制的关节目标跟踪每条指令。两种策略均使用软演员-评论家(SAC)联合训练。由于收敛后的步态与任务无关,因此将其冻结,并由经典规划器通过相同的指令接口驱动,从而得到三种受控基线:SAC+A、SAC+RRT和SAC+APF。在随机化PyBullet环境中,每种方法进行100次评估试验,所提方法在静态试验中达到目标的成功率为98.0%,在动态试验中为88.0%,而规划器混合方法最高分别仅为78.0%和68.0%,路径长度与A*参考值相差在4%以内,消融实验证实每个观测通道和奖励项都对这一性能有实质性贡献。