跳转至

arXiv 2026-09-22

标题 作者 发布日期 PDF链接 摘要
OMatG-flash:一种用于可扩展材料发现的全原子流映射与强化伴随匹配方法 Thomas Egg 2026-09-22 PDF 新型无机材料的发现推动了计算和储能等关键领域的技术突破。生成式人工智能有望加速材料发现流程,但当前最先进的流模型和扩散模型仍受限于候选材料提出成本。为解决这一问题,我们提出了OMatG-flash,一种用于无机晶体结构预测(CSP)和从头生成(DNG)的全原子流映射。OMatG-flash是一种材料领域的帕累托最优推理引擎,其采样候选材料所需的推理步骤和实际耗时均比现有流模型和扩散模型少一个数量级,同时展现出与最先进方法相当的基准性能。为实现后训练微调,我们将强化伴随匹配应用于流映射,进一步提升了无条件CSP任务中的匹配率和RMSE。OMatG-flash展示了流映射在加速生成高质量候选无机材料方面的潜力,并标志着在数据密集型材料发现工作流所需的样本吞吐量方面迈出了一步。
结合分层认知过程与过程监督的可解释场景安全理解 Zhiyun Jiang 2026-09-22 PDF 场景安全理解在各种关键领域的情境意识中起着生死攸关的作用。依赖学习场景与安全等级之间直接映射的传统方法往往缺乏可解释性,限制了其在关键应用中的可靠性。克服这一挑战的有效途径在于解读人类认知过程,并为机器模型赋予类似的认知能力。本工作探索了一种将场景安全认知过程建模与过程监督相结合的有效方式。具体而言,我们首先构建了一个分层认知安全结构,这推动了基于多步推理与过程标签的新型高质量场景安全理解数据集的开发。该数据集既可作为基准,也可作为提升大型语言模型(LLMs)安全推理能力的资源,同时还能通过信息流和显著性技术对中间推理步骤进行细粒度分析。在此基础上,我们引入了一个模块化且灵活的过程监督框架,该框架反映了人类认知的分层特性。该框架以LLMs为核心架构,并融合了低秩适应(LoRA)和专家混合(MoE)策略,以实现专家模块之间的专业化与协作,每个模块负责整体推理链中的特定子过程。系统性实验评估与分析证实,与传统方法相比,我们的框架展现出更优越的可解释性和性能特征。
扩散模型中的双重下降与恶性过拟合 Raphaël Urfin 2026-09-22 PDF 深度学习中的传统观点认为,过参数化——即参数数量 (p) 多于训练样本数 (n)——是无害的:更大的模型泛化更好,即使没有正则化,插值模型也能很好地泛化,测试误差遵循双下降曲线。人们可能期望扩散模型也具有同样良性的过拟合,因为其训练可归结为回归,即最小化二次得分匹配损失。然而观察到的却相反:这里的过拟合是灾难性的,驱使模型进入记忆机制。我们通过结合在 CelebA 上训练的 U-Net 实验与一个可推导闭式学习曲线的随机特征模型,解决了这一悖论。我们表明,在每个训练样本固定有 (m) 个噪声实现时,插值峰值确实会出现,但出现在 (p\sim nm) 处,而非标准回归中的 (p\sim n) 处。然而,测试损失的上升要早得多,出现在 (p\sim n) 处,且与 (m) 无关。这种过拟合是有害的,因为尽管训练的隐式正则化完全在起作用,它却驱使模型趋向经验得分,即记忆训练集,而非趋向真实得分。偏差-方差分解揭示了其机制:得分估计器的偏差在 (p\sim n) 处开始增长;过了峰值后方差衰减,如同回归中那样,而偏差持续增长,二者都饱和在一个很大的值上。由于扩散模型以 (m\gg1) 训练,峰值被推到非常大的模型规模,因此处于其之前的上升分支上,此时有害过拟合已经发挥作用。尽管如此,过参数化在与正则化配对时仍然有益:在随机特征理论和 U-Net 实验中,最优正则化的大模型——分别通过岭惩罚或早停——优于任何未正则化的模型。
TimeInteract:面向流式时间序列的实时交互智能 Sheng Pan 2026-09-22 PDF 真实世界的时间序列持续演化,有意义的变化可能在任何时刻出现。然而,现有的时间序列语言模型(TSLMs)本质上仍是静态的。它们要么接收完整序列进行离线处理,要么在流式输入与响应生成之间交替,这导致在交互过程中无法处理新的观测。我们提出一种新范式——时间序列交互:模型持续感知传入的时间序列观测和用户意图,自主决定何时保持沉默或作出响应,并在响应生成期间继续处理新的观测。为实现这一目标,我们开发了TimeInteract,包含三项关键设计:双视角流式时间序列编码器,用于捕捉局部变化与历史动态;响应控制机制,用于学习何时触发响应;解耦流式推理机制,将控制与响应生成分离,以避免阻塞后续观测。我们进一步构建了交互能力的层级体系,从理解逐步推进到自适应。基于该层级体系,我们构建了StreamTSI-34K,这是一个大规模流式时间序列交互数据集,包含34,588个片段和77,505条响应,覆盖合成与真实世界时间序列的单轮与多轮设置。在所有四个交互层级上,TimeInteract均持续优于现有LLMs、VLMs和TSLMs,在具有挑战性的任务上提升最高达23.92分。它还在改善响应触发的同时,实现了接近零的流停滞以及最高达$2.15\times$的推理加速。
关于大型语言模型在代码理解中的词汇迷信:对低词汇质量代码的重新评估 Xin Shen 2026-09-22 PDF 大语言模型(LLMs)的最新进展使其被广泛用于代码相关任务。标识符名称在自然出现的代码中具有统计信息量,但其信息并不总是可靠的。我们研究当前LLMs在重命名保持程序结构不变时,是否对词汇线索赋予了不成比例的权重。我们提出了Face/Off,一个保持语义的标识符重命名框架,并在多个模型和代码理解任务中评估渐进式命名条件。在该框架内,词汇过度强调在所评估的模型和主要任务中普遍存在:随着标识符信息被移除或变得具有误导性,性能通常会下降,且输出往往被导向误导性名称所暗示的含义。这一模式在代表性的提示和微调干预下依然存在,表明词汇过度强调是一个根深蒂固的问题。类型推断控制实验确认了一个边界:当答案可以在没有目标名称的情况下局部恢复时,命名效应较小。这些结果并不意味着标识符没有帮助;相反,它们揭示了当前LLMs在平衡词汇线索与程序结构方面存在系统性脆弱性。我们的发现推动了评估和建模方法的发展,这些方法在保留自然代码规律性益处的同时,使结论建立在准确、形式化的代码语义之上。
在真实世界医疗数据上学习带指导的延迟决策 Emma Sun 2026-09-22 PDF 医学图像解读工作量大且耗时,尽管AI解读可以减轻工作量,但完全自主部署存在潜在安全隐患,且低特异性在实践中可能导致临床医生工作量增加。学习延迟(L2D)通过从输入特征以及AI模型和人类表现中学习,在自主预测和人类专家之间选择性地路由病例,从而解决这一问题。虽然L2D的理论保证已被证明,但其性能尚未在具有人类读者标注的真实世界医学数据集上得到验证。我们在Collab-CXR上评估了两阶段L2D的预测器-拒绝器公式,其中AI预测器模型是固定的,并与可训练的路由或拒绝器模型分离。Collab-CXR是一个多标签胸部X射线数据集,每个病例有多个专家标注。这是首个在具有人类标注的真实世界医学影像数据背景下研究L2D的工作。我们进一步引入了一种新设置,即带指导的L2D,其中决策空间扩展到三种选择:自主预测、延迟给人类专家,或延迟给人类专家并提供AI指导。我们比较了多种拒绝器架构和损失函数,以及不同的输入特征可用性。这在两个更大的数据集VinDr-CXR和CheXpert上进行了复现。我们的结果表明,带指导的两阶段L2D优于经典的两阶段学习延迟,以及人类单独、AI单独和AI指导人类基线。值得注意的是,与当前文献中正式定义的L2D代理损失函数相比,这一性能是通过更简单的损失函数实现的。
面向GROBID的布局引导掩码:大规模科学PDF摄取中的轻量级结构增益 Luca Foppiano 2026-09-22 PDF 将学术PDF转换为机器可读的全文仍然是大规模信息系统的瓶颈。近期基于视觉的解析器提高了准确性,但需要GPU,并可能向提取的文本中引入噪声。GROBID是一种在CPU上运行的模块化字体流解析器,是结构化科学文章的事实标准,并支撑着若干最大的开放学术语料库。我们将其与一个轻量级CPU检测器配对,该检测器定位图、表和副文本(页眉、页脚、页码)区域,编码为带类型区域掩码,其标记被路由到GROBID的专用模型或被丢弃。在两个PMC语料库Bioinformatics(1,926篇文章)和Materials Science(2,595篇)上,依据JATS并采用感知章节的结构化协议进行评分,我们的扩展在大多数指标上优于普通GROBID(NS $+0.025$/$+0.013$;Materials Science上段落召回率$+0.086$,$d_z{=}1.08$),并且标题关联的图恢复在两个语料库上均有改善。在外部Table-BRGM基准上,表格检测的F1从$0.16$提升至$0.94$,表格结构也随之改善(GriTS-Top $0.27 \to 0.78$,低于最强的GPU系统)。在正文文本上,与四个基于视觉的系统(Docling、MinerU、olmOCR、dots.ocr)相比,它在两个语料库上均具有最佳的段落精确率,在Materials Science上具有最佳的章节检测,并且字符错误率与最佳GPU解析器相差在0.004以内。在CPU上端到端运行时,其成本比最便宜的GPU系统(Docling)低$2.7$--$3.2\times$,比生成式解析器低$10$--$14\times$。
MAVP:面向移动操作的地图感知视觉运动策略 Jinhe Tang 2026-09-22 PDF 成功的移动操作需要基座与机械臂的协调运动,同时保持准确的空间定位。然而,经过演示训练的策略可能难以可靠地实现预期的基座运动,导致空间错位以及随后的操作失败。我们提出 MAVP(Map-Aware Visuomotor Policies,地图感知视觉运动策略),一个通过预测显式基座位姿目标并利用定位反馈进行跟踪,从而提高执行可靠性的框架。MAVP 从遥操作演示中重建静态地图,并在共享地图坐标系中表达演示的基座轨迹,从而在演示之间提供一致的空间监督。在执行时,策略接收 RGB 观测、关节状态以及机器人当前的地图坐标系基座位姿,并联合预测目标基座位姿、机械臂动作和夹爪动作。一个底层控制器利用前馈运动和位姿误差反馈来跟踪预测的基座目标,从而能够纠正执行偏差。我们还在训练期间使用位姿噪声增强,以提高对策略位姿输入误差的鲁棒性。在六个真实世界操作任务和三个策略系列上,MAVP 在所有任务中均比无锚定的速度控制取得了更高的任务成功率。视频和额外结果可在 https://123qwedsa123.github.io/mavp/ 获取。
FairMean:在标签投毒攻击下促进分布式学习中的公平性 Huigan Zheng 2026-09-22 PDF 公平感知的分布式学习优先考虑损失较大的客户端以减少性能差异,但标签投毒可以制造大损失,从而引发公平性与鲁棒性之间的冲突。我们提出FairMean来管理这一冲突。FairMean使用局部损失的有界非递减函数对客户端梯度进行加权。递增的权重优先考虑高损失客户端以促进公平性,而上界则防止由损失引起的对中毒客户端梯度的过度放大。在不存在标签投毒的情况下,我们表明最小化FairMean目标比最小化标准平均损失目标更有利于解的公平性。在标签投毒下,我们建立了一个平均平稳性界,其依赖于攻击的项与中毒客户端比例的平方成正比。实验表明,FairMean通过降低准确率方差同时提高最差客户端准确率来促进公平性。
KwaiMind技术报告 Junlong Wu 2026-09-22 PDF 商业图像编辑在通用编辑质量之外,还要求保持产品身份、准确渲染文字并具备用户吸引力。我们提出KwaiMind,一个将通用能力与电商专业化相结合的图像编辑系统。基于智能体的数据引擎维护约180万对高质量编辑样本。KwaiMind构建于多模态扩散Transformer之上,经过持续预训练和有监督微调,随后进行偏好优化和在线强化学习。通用视觉语言评判器以及针对点击率(CTR)、文字渲染和产品一致性的专用奖励引导专用策略,并通过同策略蒸馏进行整合。我们提出Ecom-Bench,涵盖11项商业编辑任务,并配有任务特定的视觉评估和基于CTR的排序。在ImgEdit、GEdit、REDEdit的两个语言划分以及Ecom-Bench视觉质量上,KwaiMind在受评估的开源编辑器中取得最强总体得分,并在所比较系统中取得最高的综合CTR排序得分。离线情况下,CTR引导优化将预测CTR超过原始产品图像的生成图像比例从12.16%提升至37.41%。在在线A/B实验中,基于CTR选择产品主图使实际CTR相对提升约2.44%。这些结果证明了领域特定数据和奖励驱动对齐对商业图像编辑的价值。