| TaskBridge:通过虚拟任务连接无监督表格异常检测与上下文学习 |
Doyun Choi |
2026-09-29 |
PDF |
无监督表格异常检测旨在利用正常训练样本识别表格数据中的异常行。传统方法依赖特定数据集的训练和配置搜索,而近期的表格基础模型通过上下文学习实现了对未见数据集的零样本异常检测。然而,大多数基于表格基础模型的方法需要从头进行异常特定的预训练,使检测本质上依赖于合成的表格异常检测特定先验,且更新成本高昂。一些方法转而改造预训练的通用表格基础模型用于表格异常检测以规避这一负担,但依赖于计算开销大且异常归纳偏置受限的公式化方法。在本工作中,我们提出了TaskBridge,一个新框架,通过构建虚拟监督任务,将异常检测直接重新表述为表格基础模型的监督上下文推理,从而高效地改造预训练的通用表格基础模型用于无监督表格异常检测。由此产生的虚拟任务诱导出预测结构,在该结构下,正常查询及其目标对获得高支持度,而异常往往违反所诱导的结构并获得较低支持度,从而提供直接的异常证据。在790个真实世界数据集上,TaskBridge持续优于30个基线方法,包括最先进的基于表格基础模型的方法,且无需异常特定的表格基础模型预训练或数据集特定的模型优化。 |
| JudgeCast:基于经验信息协变量判断的时间序列预测 |
Donguk Kwon |
2026-09-29 |
PDF |
协变量效应因情境而异并随时间变化,这要求预测者评估如何在每个预测情境中使用它们。随着预测的推进,早期预测的观测值变得可用,为后续预测中过去协变量的使用提供反馈。然而,当多个协变量共同作用时,预测误差揭示了与观测值之间的数值差异,但并未揭示协变量应如何被使用。我们提出JudgeCast,一种基于经验的时间序列协变量预测框架。遵循判断性调整实践,一个冻结的TSFM提供基础预测,而一个冻结的LLM利用当前情境和相关经验对其进行调整。在调整过程中,评估协变量效应和确定数值调整扮演不同角色,因此JudgeCast首先形成显式的逐协变量判断,然后确定调整量。在观测之后,JudgeCast利用基础预测的观测残差来重构替代判断,并通过其产生的调整来评估原始判断和替代判断。表现最佳的决策被选中并保留为经过验证的经验,用于后续预测。在多样化的真实世界数据集上,JudgeCast优于强基线。消融实验表明,显式的逐协变量判断能够改进预测时的调整,而残差引导的经验构建比将原始决策保留为经验能产生更可靠的预测增益。 |
| 中文-Jev:将系统一模型引入中文任务 |
Zexiao Wang |
2026-09-29 |
PDF |
System One 模型(如 Jev)为需要决策而非开放式回答的任务提供了一种高效的生成式语言模型替代方案。然而,现有的 Jev 模型在中文决策准确性方面表现有限,限制了其在通用和专业场景中的实用性。本文提出了 Chinese-Jev,一种 System One 模型,通过统一的数据处理和训练流程弥补了这一差距。我们的数据处理协议将异构的中文标注转换为候选选项上的概率目标,从而实现了跨领域和问题格式的共享训练公式。为实现高效推理,Chinese-Jev 采用轻量级的仅编码器骨干网络进行文本编码,并通过面向决策的训练学习对候选答案进行评分。为解决预训练分布与下游中文场景之间的不匹配问题,我们首先在包含 1000 万条样本的通用语料库上训练模型,然后分别针对医学、法律和金融领域进行微调。为评估通用和领域特定中文场景下的决策准确性和校准性,我们提出了 Chinese-Jev Bench(CJ-Bench)。在第一阶段预训练后,Chinese-Jev 在通用领域任务上的准确率超过闭源 Jev 模型 1.24%,同时实现了 20.3 倍的加速。后续的领域特定微调在医学领域相比 Jev 取得了 4.0% 的准确率提升,并在专业领域达到了 Jev 平均准确率的 92%,加速 17 倍,平均每个样本的延迟仅为 15 毫秒。我们进一步展示了 INT8 量化模型在移动设备上的端侧部署,实现了每次决策约 1.0 秒的推理延迟。项目地址为 https://gulucaptain.github.io/Chinese-Jev/。 |
| 大规模多体激发态电子结构的深度学习GW准粒子哈密顿量 |
Xiaoxun Gong |
2026-09-29 |
PDF |
准确的准粒子电子结构是理解材料激发态性质以及解释光电、量子和输运现象的基础。然而,对于大体系或构型复杂的体系,第一性原理GW计算仍然计算量巨大。在此,我们提出DeepH-GW,一种深度学习框架,可直接从原子结构预测有效的GW准粒子哈密顿量。基于DeepH的局域等变消息传递架构,DeepH-GW通过实空间哈密顿量重构接口,在高保真平面波GW计算上进行训练。该方法将平面波方法的系统精度和广泛化学适用性与线性标度神经网络推断相结合。在所考察的体系中,DeepH-GW再现准粒子能带结构,误差在几meV量级。此外,我们表明,尽管多体相互作用具有内在非局域性,DeepH-GW仍展现出从相对较小的训练结构到显著更大的超胞的强跨尺度可迁移性。我们证明,该框架能够通过在具有热位移的超胞中进行预测,准确捕捉GW级别的电子-声子带隙重整化,展示了该方法的强大能力。因此,DeepH-GW为大规模多体模拟和激发态电子结构基础模型提供了一条实用路径。 |
| 钴:利用专家共激活实现高效分布式MoE训练 |
Junkang Zhou |
2026-09-29 |
PDF |
专家混合(MoE)已日益成为扩展大语言模型的主流方法,因为它在扩大模型容量的同时保持计算成本几乎不变。训练大规模MoE模型依赖于专家并行(EP),它将专家副本分布到各GPU上,并通过全对全通信交换token。EP的效率通常受限于两个系统瓶颈:跨节点token传输受限于节点间带宽,而专家工作负载倾斜导致GPU间计算不均衡。先前的工作基于每个专家的工作负载统计来缓解这些瓶颈,但忽略了专家可以共享通信这一事实。在这项工作中,我们通过实证观察发现,许多专家对会被单个token频繁共同激活。受此启发,我们提出了Cobalt,一种高效的MoE训练框架,利用专家共同激活来减少跨节点流量和工作负载不均衡。Cobalt采用两阶段专家布局规划器,使专家布局适应不断变化的专家共同激活和工作负载状况。它周期性地将频繁共同激活的专家共置于同一节点上以减少跨节点通信,并执行每步的节点内调整以重新平衡工作负载。随后,我们开发了一种通信感知的任务分配方法,根据当前专家布局将token路由到更少的远程节点。在32块B200 GPU上的实验表明,与现有MoE训练框架相比,Cobalt实现了高达1.53-2.41倍(平均1.28-1.89倍)的加速,同时将跨节点token流量减少了75.74%-99.26%。 |
| VStress:面向重复验证者的相关性感知审计与自适应预算分配 |
Miaobo Hu |
2026-09-29 |
PDF |
重复的验证器调用只有在提供条件信息时才有用。我们引入VStress,一种可审计的重放契约,以及VStress-CA,一种相关性感知的分配策略,它在密封的校准划分上估计未查询验证器的条件边际信息,对不确定性进行折扣,按调用成本归一化,并在下一次调用不具信息量时停止或弃权。控制器在接入干净预言机之前冻结其决策和成本账本;依赖偏移警报会禁用通道偏好并回退到精确停止。受控审计给出了该机制的边界:在35%对称 corruption 下,多数-5将平衡准确率从0.6578提升到0.7739,而在65%下则损失0.1226个点。在匹配的固定预算比较中,广度、冗余和自适应分配获得的平衡准确率分别为0.6048、0.6375和0.6538,每项调用3.4216次,VStress-CA的RLVR得分为0.6417。依赖诊断也从同模型重复到跨家族通道递增,条件边际增益分别为0.0126、0.0462和0.0913。这些测量将相关性从事后警告转变为可审计的分配决策。 |
| 超越可读性:评估任务信息可恢复性 |
Yiwei Liu |
2026-09-29 |
PDF |
直接视觉可读性与任务信息可恢复性是不同的量。无法从固定观测中解码目标,并不必然意味着无法通过另一条恢复路径获取该目标。我们提出一种评估视角,使观测、查询、目标和可用知识显式化,并度量各路径成功集合之间的重叠。对于在合适成像条件下原始可见表面上可获得的信息,直接光学恢复从图像中读取目标,可选地在恢复之后进行;实体关联恢复利用残余视觉证据识别所描绘的实体,并通过指定知识资源中的实体—属性关系获取其目标。此类获取可以利用存储知识或外部来源。一项受控的书封研究以固定的标题—作者目录实例化外部获取,在分辨率退化条件下比较光学作者恢复与视觉标题解析及确定性查找。实体关联的成功在受测的视觉—语言模型中持续存在,揭示了超出受测直接视觉前沿的信息获取,尽管绝对性能存在显著差异。仍存在一个相当大的纯光学区域。这些互补的结果表明,为何视觉退化应通过沿指定路径和知识资源可获取的任务信息来评估,并与直接可读性并列考量。 |
| 对黑盒大语言模型的受控解码攻击 |
Jesson Wang |
2026-09-29 |
PDF |
在生成过程中操纵下一词元概率可以绕过大型语言模型的安全对齐。然而,现有方法依赖于对模型权重或数值化词元概率的访问,因此不适用于仅返回采样文本的接口。从采样输出中重建概率提供了一种可能的替代方案,但有限采样会产生稀疏且带噪的估计,而在每个生成步骤重复这一过程会带来大量查询成本。我们的实证观察表明,在成功的越狱轨迹上,大的分布变化集中在少数位置上,这促使我们进行选择性控制。我们提出\method{},一个通过纯文本续写接口进行越狱的框架,该接口允许重复采样和助手前缀续写。基于采样的分布重建将采样输出与对未观测动作的先验相结合,以获得可用的控制信号。风险门控残差控制利用不断演化的响应前缀来决定何时重建和修改分布,将采样成本集中在选定位置。推测性多词元执行通过验证并接受无需干预的草稿前缀,进一步分摊目标调用。在四个目标端点和三个基准上,\method{}在大多数比较中相对于基线取得了最高平均分。 |
| Purlin:将集合通信的编排与数据通路分离 |
Osayamen Jonathan Aimuyo |
2026-09-29 |
PDF |
分布式推理依赖于GPU集合通信,而后者必须跟上不断演进的硬件和专用工作负载。然而,现有的集合通信实现往往将语义、编排(数据在何处以及何时移动)和数据通路(数据如何移动)耦合在一起。这种耦合使得采用新的硬件机制以及为应用定制通信变得代价高昂。我们提出Purlin,一个将上述关注点分离的纵向扩展通信框架。在Purlin的顶层,我们将集合通信指定为输入和输出布局的命名以及复制或归约操作。在中间层,我们引入一种共享编排协议,即Stage, Notify, And Consume(SNAC),它从这些规范中推导出协调逻辑。SNAC之下是一个我们称为Atom的硬件特定数据通路,它为集合通信实现了两个关键的数据移动原语:复制和归约。这种分离使我们能够定制集合通信并采用新的硬件机制,同时通过SNAC复用编排逻辑。我们在A100、H200和B200 GPU上评估Purlin。在七种集合通信上,Purlin相比基线实现了最高5.14倍的延迟加速和最高4.50倍的带宽提升。集成到SGLang后,Purlin将离线LLM服务吞吐量和交互性平均提升1.13倍,最高提升1.37倍。对于在线LLM推理,Purlin将交互性平均提升1.26倍,最高提升2.85倍,其中最大增益出现在过载情况下。对于扩散图像生成,Purlin将端到端延迟最多降低1.13倍。 |
| 冷却采样器,而非学习器:采样温度移动重要性校正GRPO的陈旧性悬崖 |
Taiheng Pan |
2026-09-29 |
PDF |
语言模型的在线强化学习会让采样器落后于学习器,并用截断的重要性权重来修复由此产生的失配。我们追问在这种校正下采样器可以多久不刷新,并发现了一个悬崖:在 Qwen2.5-Math-1.5B 和 GSM8K 上,每 192 次更新刷新一次的重要性校正 GRPO 在前 180 步学习良好,随后在三个数据种子中都在刷新到来之前严重退化。已发表的针对陈旧性的补救措施作用于更新;我们则作用于采样器。解耦冷却以温度 0.8 采样,而学习器、参考模型和重要性权重保持在温度 1,行为概率从退火分布中记录,因此学习器的目标不变。所有相应的冷却运行都稳定,且更长的间隔保持了短间隔所提供的结果:在相同的更新预算下,每 192 步刷新一次的冷却采样器在训练结束时与每 96 步刷新一次的未冷却采样器相当(两者均为 0.857),并在整个训练过程中平均为 0.79,而将学习率降低到安全值则最终低 3-7 个点。在 Qwen2.5-Math-7B 上,间隔 192 处的退化点预测间隔 144 在不冷却时是致命的,而在冷却时可存活;在两个数据种子上,未冷却的运行在首次刷新前就退化,而冷却的运行通过了它,最终达到 92-93%,而未冷却为 68-81%,其中一个冷却运行在第二个周期后期短暂退化。这种收益有一个窗口:在安全间隔的三倍处以及在高失配的 MATH 设置中,冷却会延迟退化但无法阻止它,更强的冷却并不更好,而没有校正的冷却会崩溃。采样温度是对陈旧性容忍度的控制,温度和刷新间隔应一起选择。 |