跳转至

arXiv 2026-08-31

标题 作者 发布日期 PDF链接 摘要
基于Wasserstein梯度流的一步生成模型奖励引导微调 Hoseong Hwang 2026-08-30 PDF 为缓解生成模型的时间复杂度,一步生成模型近期通过单次前向传播直接从噪声映射到数据而出现。然而,一步生成模型的奖励引导微调方法在很大程度上仍未探索。为解决此问题,我们从最优传输视角考虑一步生成器,研究Wasserstein梯度流(WGF)以建模概率空间中平滑且受控的分布演化。随后,我们提出一种通过WGF对一步生成模型进行新颖的奖励引导微调方法。我们推导出一种无需奖励梯度的实用训练方法,从而同时处理不可微和可微奖励。此外,我们的方法提供平滑且稳定的奖励引导分布更新,同时缓解奖励黑客和模式崩溃。在2D合成数据、CIFAR-10和ImageNet 256×256上,结合多种奖励(包括JPEG(不可)压缩性、类别概率、黑白和CLIP对齐)的实验表明,与基线相比,我们的方法实现了更好的奖励对齐。
先检测再归因:多智能体系统的级联故障归因 Jiayi Zhang 2026-08-30 PDF 基于大型语言模型(LLM)的智能体在通过多步推理解决复杂任务方面展现出强大潜力,但仍易受执行失败影响。因此,准确的失败归因对于提升智能体可靠性至关重要。现有的基于拓扑和频谱的方法利用轨迹结构,但往往忽视细粒度语义,而基于LLM的归因方法捕捉语义线索,却因长轨迹导致长上下文退化问题。为应对这些挑战,我们提出DUOTRACE,一种即插即用的检测过滤器,用于基于LLM的失败归因。DUOTRACE遵循先检测后归因的范式:首先检测异常执行,然后向下游基于LLM的归因方法提供聚焦的轨迹证据。为在智能体轨迹上实现有效的基于VAE的异常检测,DUOTRACE整合了双视角语义-结构节点表示、基于Tree-LSTM的轨迹编码器,以及基于前缀链和LLM的数据增强,以处理异构节点、层级执行结构和有限的失败数据。与六种基于LLM的归因基线进行的实验表明,DUOTRACE分别将智能体级和步骤级归因准确率提升了8.7%和7.0%。
通过艺术史代理对绘画进行风格分析 Marc S. Walton 2026-08-30 PDF 将一件艺术品归于某位艺术家,传统上依赖于细致的视觉观察和描述,这在艺术史中被称为风格分析。相比之下,当前该领域使用的人工智能模型仅提供无法解释的概率分类。为弥合这一方法论上的差距,我们提出了一种人工智能框架,能够自动化绘画的风格分析,为加强证据收集、发现和验证奠定基础。通过在包含元数据的大型绘画语料库上训练视觉变换器,我们的系统将这种艺术史特定数据编码为嵌入表示。这些表示通过稀疏字典学习分解为一组在训练集中反复出现的共享特征。随后,大型语言模型通过检索相关艺术品及其附带的策展人撰写的文本,对每个特征进行解读,并将其综合为反映其风格属性的描述。最后,一个自主协调的大型语言模型应用推理与行动框架,对这些特征进行加权、测试和细化,形成对一件艺术品的连贯描述或艺术品间的比较。这种方法将详细的视觉特征转化为描述性术语,解决了艺术史中的一个关键挑战。它因此将图像作为数据的运用与人文学者的语义关切联系起来,确立了基于视觉的计算艺术史作为未来发展的领域。
Harness-RL:面向中心智能体多智能体线束的基于动作参数解耦的黑盒强化学习 Xinke Jiang 2026-08-30 PDF 大型语言模型智能体越来越多地通过多智能体框架解决长时程任务,其中中央智能体协调专门的子智能体、工具和环境。在此类框架中训练中央策略面临两个挑战。首先,动作标签是低基数的决策,而其参数构成高维的条件序列;使用共享的序列级信号优化两者可能产生冲突梯度。其次,动态调度创建了具有分支、并行调用和重写上下文的相互依赖会话,无法忠实地简化为单一的扁平令牌序列。我们引入了Harness-RL,一种结构化强化学习框架,结合了冲突感知策略优化(CAPO)与接口级黑盒轨迹构建。黑盒组件捕获接口调用记录,构建每会话前缀树,并将结果和过程奖励与可训练令牌对齐。CAPO使用前向激活来识别与动作和参数令牌相关的参数分区,然后将其策略梯度路由到相应的子空间。Harness-RL支持仅中央和联合多智能体训练。在七个多跳问答和智能体检索基准上,使用Qwen2.5-1.5B和Qwen2.5-3B分别达到平均F1分数42.93和47.79,而消融实验验证了CAPO的贡献,并在评估设置中偏好仅中央优化。我们的代码可在https://github.com/jiangxinke/Harness-RL获取。
LLMODE:通过门控令牌注入对齐ODE与LLM以实现不规则时空预测 Di Zhang 2026-08-30 PDF 大语言模型(LLMs)在时空预测方面展现出潜力,但现有方法通常依赖规则采样的标记序列,并因时间异步、表示空间错位和有限上下文窗口而难以处理不规则观测。我们提出LLMODE,一种基于冻结LLM骨干的高效标记框架,用于不规则时空预测。LLMODE首先使用图感知ODE编码器将不规则图观测重建为连续时间潜在轨迹。固定预算感知器重采样器随后将该变长轨迹压缩为固定数量的动态记忆标记。同时,紧凑的统计描述符被编码并重采样为上下文记忆标记。双源门控交叉注意力模块将两种记忆注入冻结LLM,实现对外部时空证据的可控利用。在三个真实世界城市数据集和两个物理动力学基准上的实验显示整体性能具有竞争力,在稀疏或动态复杂的不规则采样下优势更明显。对未见城市区域的额外评估进一步展示了无需适应的强零样本泛化能力。
无监督多尺度Gromov-Wasserstein超图对齐 Lutz Oettershagen 2026-08-30 PDF 我们研究无监督超图对齐,其目标是在仅利用结构信息、不依赖节点特征、标签、种子匹配或辅助信息的情况下,推断两个超图之间的节点对应关系。直接的高阶公式能够忠实地表示超边交互,但计算成本高,且对非均匀超图处理起来繁琐。图简化方法引入了不同的挑战:团扩展将对齐问题保持在原始节点集上,但将所有超边证据压缩为单一成对图;而二分扩展保留了关联结构,却将问题从节点扩展到节点加超边。我们提出FALCON(基于过滤的超图对齐通过跨尺度最优传输),这是一种用于超图对齐的无监督最优传输框架。FALCON不将每个超图表示为单一的压缩团图,而是构建一个由过滤诱导的基于团的共现不相似度矩阵序列,并通过一个共享的多尺度Gromov--Wasserstein(GW)目标联合对齐所有层级。共享传输计划在过滤层级间强制实现全局一致的节点对应,同时避免了二分扩展引入的辅助超边节点。在源自真实超图的扰动基准实验表明,FALCON对结构噪声具有鲁棒性,并且在几乎所有情况下都优于强图对齐和超图对齐基线方法。
InteractBench:在未揭示信息条件下对LLMs进行竞赛编程的基准测试 Jiaze Li 2026-08-30 PDF 竞争性编程正越来越多地被用于评估大型语言模型(LLMs)的算法推理能力。然而,现有基准主要侧重于全信息任务,即所有问题输入都预先提供。这忽略了算法推理的一个关键维度:当关键信息未提前揭示时,生成程序的操作能力。交互式问题作为竞争性编程的一个独特组成部分,体现了这一挑战。这些问题要求程序在严格的协议约束和有限的查询预算下,与交互器(裁判程序)进行多轮交互,新信息仅在响应查询时揭示。为解决这一空白,我们引入了InteractBench,一个包含从Codeforces、AtCoder、IOI和ICPC精选的322个高质量交互式问题的基准。每个问题都配有可执行的本地交互器,支持完全离线评估。与现有基准不同,InteractBench评估模型生成的代码能否动态获取信息并跟踪状态。我们的评估揭示了一个显著的交互差距:即使是最先进的推理模型在交互式问题上也仅取得有限成功。除了成功率,我们提出了一个细粒度的失败分类法,以诊断这些缺陷的根本原因。尽管算法逻辑错误仍占主导,但协议违规和查询预算超支也频繁发生。代码可在https://github.com/kmsgk0/InteractBench获取。
SPLG-Mamba:面向光学遥感图像显著目标检测的结构保持局部-全局Mamba网络 Yi Xu 2026-08-30 PDF 光学遥感图像显著目标检测(ORSI-SOD)需要在复杂背景、尺度变化和不规则目标形状下进行密集预测,以保持目标的完整性和结构连续性。现有方法通常能定位显著区域,但其预测仍可能遭受结构退化,包括前景响应碎片化、不完整或局部缺失。这种退化与层级特征传播密切相关,其中浅层细节可能引入纹理引起的背景响应,深层语义可能过度平滑弱结构,而不受控制的跨尺度融合可能干扰连贯区域。为解决此问题,我们提出了一种新颖的用于ORSI-SOD的结构保持局部-全局Mamba网络,SPLG-Mamba。具体而言,SPLG-Mamba集成了平滑细节重校准(SDR)、层级感知的局部-全局Mamba和门控跨尺度融合(GCSF)。SDR在状态空间建模前重校准平滑响应和细节残差,局部-全局Mamba将局部建模分配给浅层特征级别,将全局建模分配给深层特征级别,GCSF在解码过程中控制跨尺度细节注入。在ORSSD、EORSSD和ORSI-4199上的实验展示了最先进的结果以及改进的结构完整性和连续性。代码可在https://github.com/yxu9910/SPLG-Mamba获取。
PrivBench:一个用于评估文本到文本私有化的整体性与模块化基准测试平台 Stephen Meisenbacher 2026-08-30 PDF 自然语言处理方法已在隐私领域催生了新颖解决方案与进展,尤其是在文本到文本私有化子领域中,其目标是通过理想情况下掩盖(直接或间接)可识别或其它私人信息,将敏感输入文本转化为私有化输出。然而,文本到文本私有化的评估并非易事,现有文献已采用多种技术与指标来量化私有化方法的隐私保护能力。为统一文本到文本私有化的评估,我们引入了PrivBench,这是一个面向文本私有化研究人员和实践者的整体性、模块化基准测试平台。PrivBench具有整体性,因为它在一系列定义的需求上评估私有化,这些需求被组织成模块。PrivBench不仅模块化,而且可扩展,支持未来更新和基准版本。PrivBench以用户为中心,通过实时评估和公开实时排行榜促进竞争。该平台免费使用,并可在https://privbench.com/公开访问。
MI-Distillation:从模型插值的指令-推理数据谱系中选择思维链蒸馏数据 Yangsong Lan 2026-08-30 PDF 大型推理模型(LRMs)的最新进展通过长链思维(Long CoT)推理在复杂问题上展现出强大性能。然而,将这些推理轨迹蒸馏到较小的学生模型中仍具挑战性:直接的长链思维监督往往带来有限的提升,且可能不如简洁的短链思维(Short CoT)理由有效。在本研究中,我们从梯度中心视角探讨了这一现象。我们的分析表明,长链思维比短链思维引发更大的梯度幅度和更集中的更新方向,且这种效应随着学生模型容量的增加而更加显著。这些发现表明,有效的长链思维蒸馏需要在推理轨迹的推理信息密度与其对学生模型的分布对齐之间取得平衡。受此见解启发,我们提出了\textbf{M}odel \textbf{I}nterpolation \textbf{Distillation}(\textbf{MI-Distillation})框架,该框架通过模型插值构建连续的指令-推理数据谱系。为从该谱系中选择合适的轨迹,我们进一步引入了\textbf{Seq}uential \textbf{L}earnable \textbf{S}urprisal \textbf{S}core(\textbf{SeqLSS}),该评分偏好于对学生既信息丰富又易于学习的推理路径。在推理基准上的广泛实验表明,MI-Distillation在强长链思维基线上持续提升了小模型CoT蒸馏的效果。