| 在流式世界中,你应该静止不动吗?流中异常检测的综合基准 |
Magali Parrino |
2026-09-30 |
PDF |
时间序列异常检测(TSAD)越来越多地部署在流式环境中,其中数据按顺序到达并可能呈现非平稳性。因此,近期文献中有若干工作提出了依赖增量更新以随时间自适应的流式异常检测方法。然而,这些方法大多源自流式离群点检测文献,并在很大程度上忽略了时间序列异常的核心特征。此外,它们的实证评估通常在合成或小规模基准上进行,多样性有限,这使得流式方法在现实TSAD场景中是否真正具有优势尚不明确。在本工作中,我们开展了首个大规模实验研究,在统一的流式评估基准下比较流式与静态TSAD方法。我们考虑一个现实设定,其中有一批初始数据可用于模型训练,随后对检测准确性和计算效率进行在线评估。此外,我们提出了一个真实时间序列的分布漂移数据集,称为TSB-drift,以隔离流式更新在理论上合理的场景。我们的结果表明,与常见假设相反,静态TSAD方法在大多数流式设定中显著优于流式方法。这一发现凸显了现有流式方法的设计与现代TSAD需求之间的关键差距,并呼吁重新思考应如何将流式能力集成到TSAD中。 |
| 未知相依设计下的极小化极大加性回归 |
Baptiste Ferrere |
2026-09-30 |
PDF |
我们研究在 $[0,1]^d$ 上可能为非乘积随机设计下的可加回归,允许维数 $d$ 随样本量 $n$ 增长。我们引入耦合光滑类,分别控制边缘密度的正则性和密度加权可加分量的正则性。为处理相依性,我们为函数型 ANOVA 模型调整了一种 Riesz 基构造,并在联合密度的一致界下建立与维数无关的相容性界。我们构造阈值最小二乘估计量,并在适当的维数增长条件下,为已知或未知边缘密度的预测建立匹配的极小极大上界和下界。当边缘密度至少与加权分量一样光滑时,未知密度问题达到已知密度的极小极大速率。当密度较不光滑时,其正则性决定耦合类上的极小极大速率。最后,我们证明中心化可加分量可以以相同的聚合上速率恢复,而不会产生额外阶的误差。 |
| 大型交互语言模型群体中的共识与事实动态 |
Emanuele Ricco |
2026-09-30 |
PDF |
大型语言模型(LLM)智能体正日益被部署为相互作用的实体群体,其中共识——即对某一共享答案的一致意见——作为一种集体性的、非工程化的行为而涌现。此前关于LLM共识的研究表明,智能体可以交叉验证彼此的答案并收敛至更符合事实的回应,从而将一致性视为正确性的代理指标。然而,这些研究通常固定单一交互结构,未能揭示共识如何依赖于智能体的交互方式。为填补这一空白,我们提出RHEON,一个受物理学启发的框架,它将从单一冻结模型中采样的群体重新表述为一个不断演化的$O(n)$自旋系统,该系统位于一系列有效维度递增的交互几何结构之上——从一维环到全耦合平均场图——并以采样温度$T$作为热无序的可调来源,通过类Glauber异步动力学进行演化。将RHEON遍历提示、群体规模、通信拓扑和采样温度的$432$种配置,生成了Eraclitus-4.7M,一个包含$470$万条回应的带标签演化语料库。我们发现,智能体在最初几次更新扫描内即达到最强的共识增益,且每个智能体的邻居数量增加平均而言会加速收敛。我们进一步表明,某一配置最终稳定于事实正确的共识还是幻觉性共识,无法仅从其初始状态预测,并且最小化幻觉的温度取决于智能体之间的耦合方式,因此常见的近贪婪默认设置并非自动最安全。最后,语义一致性与事实收敛呈正相关,交互会增强这种关联,但永远不足以使全体一致成为正确性的证明。 |
| UniAE-MoE:通过专家混合实现的统一音频编码器 |
Shengbo Cai |
2026-09-30 |
PDF |
大型音频语言模型(LALMs)依赖有效的音频编码器来实现多任务性能。我们提出了 UniAE-MoE,一种统一的音频编码器,旨在通过混合专家(MoE)架构建模跨域音频表示并实现出色的下游理解性能。具体而言,我们探索了主流音频编码器,并整合了来自 Qwen2-Audio 和 Audio-Flamingo 3 的编码器,这些编码器展现出优越的下游能力。为促进有效的模型融合,我们使用带有共享专家的 SwiGLU 改进编码器以解耦编码器网络,并进一步引入两阶段指令微调策略,使模型更好地适应多样化的下游任务。此外,我们提出了任务特定数据缩放(TSDS)技术以增强 \tool 的理解能力。在 XARES-LLM 基准上,UniAE-MoE 取得了 0.802 的分数,达到了最先进的性能。它还在官方 Interspeech 2026 音频编码器能力挑战赛中取得了顶级表现,进一步证明了在多样化音频任务上的稳健泛化能力。这些结果共同验证了 \tool 在语音、音乐和通用音频领域实现统一音频理解的有效性。 |
| 乌鲁木齐:从视觉经验中学习空间认知 |
Shichao Li |
2026-09-30 |
PDF |
空间智能要求具身智能体在移动过程中维持对世界的一致理解。与人类一样,智能体必须利用自身运动来解读观测间的变化,并据此更新物体位置与空间关系。尽管空间后训练已大幅拓展了视觉语言模型(VLM)的空间智能,它们在两项原子级空间能力上仍存在困难:追踪自身运动与在运动中映射周围世界。为弥补这一差距,我们在每个训练回合内对交错的原子能力提供密集的多轮监督,模拟一个持续移动的智能体边观察边推理的视觉体验。为扩大规模,我们在广泛的3D场景中合成了11,738条主题驱动的相机轨迹,支持每次视觉体验中的自身运动追踪、持久物体映射与丰富空间操作。通过训练模型对这些原子问题进行推理,我们的URUQI${\mathrm{Syn}}$-8B在包含2.7k个回合、52k个问题的Uruqi基准上,将准确率从15.84%提升至47.73%。URUQI-SI-Mix-8B进一步达到50.41%,与GPT-6 Astra取得的50.08%相当。仅在我们的合成数据上训练,URUQI$$-8B在三个外部空间基准上相较其InternVL3-8B主干实现了17.13%的平均相对准确率提升。这些结果凸显了连续视觉体验作为可扩展监督来源,对发展VLM空间认知的价值。} |
| 面向无线拆分学习的重要性感知特征稀疏化 |
Bumjun Kim |
2026-09-30 |
PDF |
无线拆分学习(SL)通过将上层卸载到服务器来减少设备端计算,但在每次迭代中传输高维中间特征仍然是主要的通信瓶颈。现有方法在客户端使用与任务无关的准则(如幅值、统计量或聚类)来选择特征,这增加了客户端处理开销,并且在非独立同分布(non-i.i.d.)客户端数据下往往会降低准确率。我们提出了重要性感知类别平衡稀疏化(ICS),这是一种轻量级方法,其中服务器在反向传播过程中使用由真实类别 logit 获得的基于 Grad-CAM 的分数对特征通道进行排序。各类别分数被聚合为类别平衡、标签无关的重要性向量,从而在标签偏斜下缓解头部类别偏差,并且每个客户端在下一轮中复用该向量以保留前 $N$ 个特征通道,不产生额外的客户端前向或反向传播。我们进一步推导了一个非渐近收敛界,该界分离了稀疏化引起的误差,并刻画了在固定通信预算下稀疏化比例和小批量大小如何共同影响收敛,同时我们分析了 ICS 相对于代表性基线的通信和计算开销。除基于顺序 CNN 的 SL 之外,我们还将 ICS 扩展到并行拆分学习以及基于 transformer 的模型。实验表明,ICS 始终优于基线,在严重非独立同分布划分下增益更大。 |
| 动力学到决策:深度分类器中李雅普诺夫谱与决策边界的数学理论 |
Shirin Panahi |
2026-09-30 |
PDF |
深度分类器的定义不仅取决于其产生的决策,还取决于形成该决策的一系列变换。将这种演化视为跨层的动力系统,为探究决策几何如何通过深度涌现以及我们能在多大程度上回溯边界的动力学特征提供了一个自然的框架。我们将前馈分类器建模为有限非自治离散动力系统,其中各层扮演离散时间步的角色。我们研究数据样本在分类器深度中动力学轨迹的有限时间最大李雅普诺夫指数(FTMLE)。FTMLE 衡量邻近轨迹的收敛/发散速率。我们将观测端点从概率向后移至 logits,再移至隐藏表示。对于高斯类,我们证明概率层面的 FTMLE 携带决策边界的清晰几何特征,其主导方向与边界法线对齐。向后移至 logits,我们证明这一关系不再普遍成立,而是关键取决于分类器的训练方式,特别是损失函数的选择。进一步向后移至隐藏表示,这种联系变得更加有条件:与边界相关的 FTMLE 可以持续存在,但仅在可识别的结构条件下成立。我们提出几何感知微调来重构分类器的隐藏 FTMLE,并提出保证高隐藏 FTMLE 在决策边界附近集中的条件。通过数值结果,我们展示了理论结果的普遍性和有效性。将数据样本的演化理解为穿越分类器各层的过程,为识别边界相关敏感性在何处涌现以及开发层感知正则化策略提供了有原则的基础。 |
| ViLegalExpert:面向真实世界咨询的越南法律检索与问答大规模基准 |
Dat Tien Nguyen |
2026-09-30 |
PDF |
可信赖的法律人工智能需要能够在回答法律问题时,将其回应建立在权威来源之上。然而,现有的越南法律基准对现实世界法律咨询的覆盖有限。我们提出 ViLegalExpert,一个基于真实公民与律师咨询构建的大规模基准,包含跨 34 个法律领域的超过 172K 个问题,以及专业答案和经专家验证的法律证据。ViLegalExpert 支持法律信息检索、抽取式问答和生成式问答。使用代表性检索方法和语言模型进行的实验揭示了在证据检索和基于依据的答案生成方面存在重大挑战。尽管预训练模型在问答上表现强劲,但混合检索取得了最佳检索性能。这些结果表明,将自然表达的法律问题映射到权威条款具有难度,并确立了 ViLegalExpert 作为可靠越南法律人工智能的一个具有挑战性的基准。 |
| 注意力函数作为一种内在归纳偏置:模型在新颖语境中的行为如何分化 |
Dong Gyun Kang |
2026-09-30 |
PDF |
发展心理学认为,某些先验是婴儿在经验之前就被赋予的,而非从数据中归纳而来;并且这种先验的影响在强约束条件下会被抑制,但在弱约束条件下会重新显现。我们追问:类似的原则是否也适用于 Transformer——赋予注意力头的激活函数能否作为一种内在的归纳偏置?我们提出函数混合注意力(Mixture of Function Attention, MoFA),一种对多头注意力的无参数修改,在训练前固定 softmax 头与 sigmoid 头的比例。在五种比例、一个 124M 参数的 GPT-2 模型以及五个随机种子上,我们发现这一给定比例在分布内几乎没有影响——对于中等程度的混合,各比例之间的差异在统计上可忽略不计,即使在极端情况下也仍然很小——但其影响在跨 15 个分布外领域的零样本分布偏移下会急剧重新显现。在若干领域上,各比例之间的困惑度差距扩大了一个数量级以上,并且表现最佳的比例沿着领域结构的单一轴线变化,将简短、非正式文本(偏好 softmax)与技术性、长文本(偏好 sigmoid)区分开来,这解释了领域响应中 78.3% 的方差。这种重组在注意力头层面可见:随着其比例增加,sigmoid 头的注意力熵呈现加速下降,而 softmax 头的响应则较为温和,从而在两类头之间形成了一致的分工。我们的结果表明,激活选择作为一种给定的先验发挥作用,其影响在分布内被掩盖,而在分布外重新显现。 |
| 量化循环状态缓存中的低差异抖动 |
Snigdha Chandan Khilar |
2026-09-30 |
PDF |
Mamba 风格与混合语言模型将其历史压缩为一个固定大小的循环状态,该状态在每生成一个 token 时被重写。以低精度存储该状态可节省内存带宽,但每一次舍入误差都会反馈到下一次更新中,并可能在长序列生成过程中累积。生产系统对状态进行随机舍入;我们追问此类缓存应采用何种舍入规则。我们发现,一种确定性的黄金比例 Weyl 抖动无需随机数,在纯模型与混合模型、各种存储格式以及长解码时域上,始终比随机舍入使量化模型更接近全精度模型,且不增加额外成本。就近舍入的表现则不同:由于它丢弃了微小更新,其误差持续增长,因此在短评估中可能表现最佳,但在长序列生成中远远落后。一项差异分析解释了这一排序,并且我们记录了会悄然消除该收益的实现陷阱。 |