跳转至

arXiv 2026-09-27

标题 作者 发布日期 PDF链接 摘要
走向理解基于LLM的日志异常检测:性能、效率与鲁棒性的实证研究 Bin Li 2026-09-25 PDF 大语言模型(LLMs)在日志异常检测中展现出良好性能,但其适配策略、架构和部署配置如何影响检测效果仍缺乏充分理解。为探究这些因素,我们在三个公开日志数据集上开展了系统性实证分析,考察不同适配策略、模型架构、参数规模和量化设置。结果表明,不同适配策略之间存在显著性能差异,而模型规模扩展在不同数据集上带来的检测增益各不相同。我们进一步观察到,检测准确率相当的模型可能表现出显著不同的计算成本,且在所评估的配置中,低位量化基本能够保持检测性能。最后,我们考察了在不同扰动水平下,模型在结构噪声、语义噪声和标签噪声下的检测鲁棒性。这些发现为基于LLM的日志异常检测的性能、效率和鲁棒性提供了实证见解,凸显了超越传统以准确率为导向的评估的实际考量。
基于贝叶斯树邻接文法的方程发现 Christopher A. Lindley 2026-09-25 PDF 树邻接语法(TAGs)最近被引入非线性系统辨识(NLSI),作为一种将整个模型类编码为有限语法规则集的手段,候选模型由此组装为树。现有的基于TAG的辨识器依赖进化优化并返回模型结构的点估计。本文则在贝叶斯框架下提出TAG框架。在树结构及其参数上定义生成式先验,并使用带有保结构树移动的可逆跳MCMC采样器来推断模型结构、参数和预测的联合后验。考虑了两种训练目标,即具有共轭参数提议的一步超前目标,以及通过无似然推断处理的基于仿真的目标。该方法在模拟多项式NARX系统、Silverbox基准以及来自基督城湾塔的波浪载荷数据上进行了验证,其中将Morison方程嵌入为固定初始树产生了一个灰箱模型,其性能优于物理驱动的基线。结果表明,贝叶斯TAG非常适合量化动力系统方程发现中的不确定性,并适合拟合物理信息模型。
OpenVAM:基于视觉语言模型的开放世界视觉注意力建模 Kiana Hooshanfar 2026-09-25 PDF 预测人类注视点是从网页/UI设计分析到机器人学和人机交互等应用的核心能力。然而,大多数视觉注意力建模方法仅输出密集的显著性图,这对于行动而言往往不够:从业者需要将注意力峰值与场景中的离散元素(什么)联系起来,并理解这些峰值在上下文中的驱动因素(为什么),同时还要对自然图像、商业内容和UI/网页布局之间的域偏移保持稳健。因此,我们提出了OpenVAM(Open-world Visual Attention Modeling with VLMs),一个统一框架,能够联合解决跨异构领域(自然场景、商业图像和UI/网页布局)和监督模态的通用性与可解释性问题。OpenVAM采用解耦但对齐的设计:专用的密集视觉通路提供稳定、空间精确的定位,而遵循指令的视觉-语言语义头则基于同一图像和数据类型提示生成有依据的什么/为什么解释。三阶段训练策略在保留强定位先验的同时,逐步引入语言基础,并通过参数高效适配改善解释对齐,而不扰动显著性分支。我们进一步提出了一种可扩展的流程,用于生成多域显著性-理由标注,以支持训练和系统评估。在多样化数据集上的实验表明,OpenVAM在域偏移下提升了稳健性,同时生成基于图像的解释,使显著性预测更具可解释性。
Brenier与对抗训练相遇:稳健学习的最优传输几何 Alireza Abdollahpoorrostam 2026-09-25 PDF 分布鲁棒优化(DRO)为分布偏移下的学习提供了一个有原则的框架,但其实际应用受到非凸损失函数最坏情况风险难以评估的阻碍。我们研究了一种惩罚性DRO表述,其中对手可以选择任意分布,但偏离经验分布时会受到Wasserstein惩罚。我们证明,对手的问题可以重新表述为在将经验样本推向对抗样本的传输映射上的优化问题,并证明最优映射是循环单调的。我们还表明,基于逐样本局部优化的标准对抗训练违反了循环单调性并浪费了传输成本,除非对手受到严格限制。我们提出两种补救措施。首先,我们引入多起点粒子上升,它交替进行并行梯度上升与重新分配,以在样本间强制循环单调性。其次,我们将对抗映射参数化为输入凸神经网络的梯度,这通过构造保证了循环单调性。在鲁棒回归、图像分类和鲁棒控制上的实验表明,我们的方法始终优于标准对抗训练和最先进的基线,在分布偏移下实现了更好的鲁棒性和更好的泛化。
从皮层区域视角看大型语言模型中的层级程序 Justus Westerhoff 2026-09-25 PDF LLMs中的推理通常是对每一层进行固定深度、固定顺序的前向传播,无论输入有多难。人脑并非如此运作:它以丘脑作为中心枢纽,根据需求灵活地将信息路由到皮层的各个区域。Li等人(2026)最近用一个他们称为program-of-layers(PoLar)的系统表明,如果将transformer的层视为一个函数库而非固定序列,就可以赋予其类似的灵活性。当每个输入通过一个由跳过或重复的连续层块组成的自适应序列进行动态路由时,性能相比标准前向传播有所提升。我们比原论文更详细地重建了PoLar的诊断性MCTS,并将其应用于5个模型。我们复现了PoLar的若干发现:跳过优于标准传播,重复优于跳过,而将两者结合则优于任何单独一种。较短的程序足以应对较容易的问题,而较难的问题则需要更多的层重复。然而,我们未能复现其关于用于单次推理的学习型路由器的主要主张:其排名最高的预测始终退回到标准传播,尽管其top-k预测程序合在一起确实显示出真实的准确率提升。除复现之外,我们发现少量通用程序就足以解决大多数问题。我们还对这些程序的结构和稳健性提供了更深入的分析:例如,我们发现纠正错误的程序高度脆弱:即使撤销程序内部的单次编辑,通常也会破坏该纠正。将此与人脑的路由机制联系起来,PoLar反映了类似皮层区域的transformer层之间丘脑-皮层协调的原理。我们在https://datexis.github.io/RE-PoLar/ 公开了代码。
面向医疗AI代理的安全边界SDC到MCP网关 Bennet Gerlach 2026-09-25 PDF 模型上下文协议(MCP)提供了一个通用接口,AI 应用通过该接口发现并使用外部资源和工具。它使语言模型智能体能够将推理建立在当前系统状态之上,并与异构服务交互。然而,在医疗环境中,暴露设备状态和动作可供性需要对可能产生的效果施加确定性约束。我们提出了一种 IEEE 11073 面向服务的设备连接(SDC)到 MCP 的网关,将指标、报警、上下文引用和语义元数据暴露为只读资源,同时将选定的动作可供性表示为经策略验证的干运行工具。术语“安全受限”指一种狭义的无执行属性:面向智能体的请求不会派发任何 SDC 设备操作。一个 Python 原型支持模拟故障与生命周期实验、跨越独立 Java 和 Python 实现的软件参考协议路径、确定性基线、表示消融以及多模型智能体评估。结果表明,语义显式的资源暴露、对无效或过时状态的可见拒绝,以及在资源、提议和授权路径上对无执行边界的保持。相对于通用表示,显式语义元数据提高了结构化报警输出中对所需指标标识符的符合度,而残留的结构化输出失败则揭示了看似合理的叙述性答案与符合任务的机器可读结果之间的区别。
开放词汇领域遗忘 Sumanth Udupa 2026-09-25 PDF 视觉语言模型展现出卓越的零样本泛化能力,但它们常常编码了不期望或有害的风格域,例如医学人工智能中理想化的教科书图表,或自动驾驶中的卡通车辆。近似域遗忘旨在选择性地抹除模型对目标视觉域的识别能力,同时保持在其余域上的准确率。然而,现有的近似域遗忘方法在一个有缺陷的封闭词汇假设下运行:它们仅在遗忘微调阶段所见到的特定物体类别上评估遗忘效果。因此,这些方法并未遗忘域本身;它们仅仅过拟合到已见的类别-域配对,使得该域对于未见类别仍然易于识别,并提供了虚假的移除感。我们认为,真正的域抹除必须是类别无关的。为解决这一问题,我们形式化了开放词汇域遗忘,这是一个严格的协议,要求域遗忘必须迁移到留出类别上。为解决开放词汇域遗忘的挑战,我们提出了一个外科手术式参数编辑框架。首先,Fisher信息掩码隔离出域敏感权重,在数学上保护基础的零样本泛化能力。其次,我们的目标流形散射目标使用基于偏好的挖掘,在局部散射遗忘域的风格几何结构。在PACS、OfficeHome和DomainNet上评估,我们的方法在开放词汇泛化方面大幅优于现有基线。至关重要的是,它实现了卓越的样本效率,仅用4个样本就超越了峰值8样本基线结果。
可变记录:通过可编辑对话状态缓解上下文污染 Dan Barry 2026-09-25 PDF 当代大语言模型聊天系统将会话历史视为定义模型工作上下文的不可变轮次序列。然而,真实交互中的用户意图并非静态:它通过纠正、细化和不断变化的约束而演变。这种动态意图与静态记录之间的不匹配可能导致上下文污染,即过时或无关的信息持续存在并继续影响后续回复。我们引入可变记录,一种新的交互范式,使用户能够通过自然语言编辑请求修改先前的轮次,从而允许会话历史本身被更新而非追加。这将记录从被动记录重新定义为会话状态的可编辑表示。我们提出一个工作原型,将会话记录级别的修订集成到标准聊天界面中,并通过一项受控用户研究(n=17)和对代表性交互场景的示例性记录分析来评估其可行性。参与者在清晰度、信心和易用性等指标上显著偏好可变记录而非标准聊天,并减少了重新开始对话的意图。对代表性用户研究对话的记录分析表明,可变记录可以减少会话长度并消除过时的保留上下文。这些发现提供了初步证据,表明用户驱动的会话历史修订可以改善交互质量,并有助于维持对用户意图更当前的表示。源代码和原型可在 https://github.com/QxLabIreland/ReChat 访问。
渐进式记忆变换器:面向时间序列的记忆感知注意力机制 Tord Sture Stangeland 2026-09-25 PDF 时间序列同时在多个尺度上携带结构(细粒度变化、中程模式以及全局属性),而下游任务也在相应不同的尺度上运行。大多数现有的自监督学习方法通过实例级对比损失和有限的时间邻域监督在全局范围内监督表示,但并未显式利用结构层次。我们提出了一种学习框架,该框架在三个尺度上独立地显式强制结构层次:用于 token 连续性的局部目标、用于窗口级模式的中程目标,以及用于序列级一致性的全局目标。实现该框架需要骨干网络在每个尺度上暴露表示;我们引入了\textbf{渐进记忆 Transformer}(PMT),它通过可写、窗口对齐的记忆增强 transformer,从而在传统 transformer 已提供的 token 和序列级表示之外,额外暴露中程尺度。在七个 UCR/UEA/UCI 分类基准、一个线索保留探针以及预测基准上,PMT 学习到的表示在全局、中程和局部尺度上都能很好地探测——强大的低标签分类性能(1--5\% 标签)、在多个预测视野上具有竞争力的预测性能,以及记忆状态捕获中程模式的定量和定性证据。
DyMD:通过分布匹配蒸馏在少步视频世界模型中保持交互动态 Haojun Xu 2026-09-25 PDF 大型视频扩散模型为具身预测与学习提供了富有表现力的先验,但其多步采样对于交互式下游使用仍然代价高昂。分布匹配蒸馏(DMD)能够实现少步视频生成,但可能在保持视觉质量的同时抑制机器人—物体运动。通过考察DMD的教师信号与虚假分数信号,我们发现较弱的重新加噪会使教师后验集中在运动不足的 rollout 附近,从而限制恢复运动的引导。与此同时,运动更强的 rollout 往往会产生更大的虚假分数拟合误差,这可能阻碍生成器学习交互动力学。我们提出 DyMD,一个使教师监督和评论器拟合都适应不断变化的学生模型的 DMD 框架。时间亲和性条件重新加噪采样通过将基础调度与受局部后验变化启发的教师先验混合,使时间步分布适应每个 rollout 当前的交互保真度,从而平衡运动恢复与外观精修。为了更好地跟踪运动更强的 rollout,动力学引导的虚假分数跟踪使用噪声条件预测器,从潜在时间动力学中估计噪声相对的拟合难度,然后在评论器损失中对预测为困难的 rollout 加权。使用 DyMD,我们将一个 14B 教师模型蒸馏为一个四步 1.3B 学生模型,推理时无需辅助模块。在具身视频基准上,该学生模型相比 Base DMD 将 R-Bench 任务遵循度提高 9.6 个百分点,将 PAI-Bench-G 域得分提高 5.1 分,同时保持可比的视觉质量。作为下游动作规划的骨干,我们的学生模型在两个 WorldArena 任务上取得 34% 的平均成功率,而 Base DMD 为 16%。