跳转至

arXiv 2026-08-03

标题 作者 发布日期 PDF链接 摘要
面向暗光环境下的鲁棒且三维感知的RGB-NIR成像 Muyao Niu 2026-07-31 PDF 鲁棒的低光成像仍然是社区面临的挑战。近期研究探索了将近红外(NIR)与噪声RGB融合以实现增强效果,但大多数方法依赖于精心整理的训练数据对,在不同场景下的鲁棒性有限。本文通过引入3D感知神经建模,为RGB-NIR低光成像提供了新视角。在无干净RGB监督的情况下,一个强大的模型可以被优化,在3D空间中隐式融合极度噪声的RGB观测与NIR线索,有效恢复干净的RGB图像。所提模型免除了干净RGB数据收集的需求,并能适应不同噪声水平。在合成和真实数据上的广泛评估证明了其优越性。代码见:https://github.com/MyNiuuu/3DarkFusion
视觉生成中文本条件控制的缩放特性 Zilong Chen 2026-07-31 PDF 我们研究了视觉生成中文本条件设定的经验缩放特性。这类特性很少被测量,因为扩散损失并不随自然语言提示中的标记数量而缩放。令人惊讶的是,我们发现收敛的扩散损失随提示中结构化语言的数量而缩放。为了量化结构化语言,我们采用了两种互补的度量:一种白盒似然度量(GPG)和一种黑盒属性度量(ED)。在受控的训练运行中,收敛的扩散损失随GPG近似线性下降,并随ED遵循幂律关系。在这些缩放特性的指导下,我们通过构建带有从图像中提取的语义和几何注释的结构化提示来改进“可扩散性”,并通过监督微调、冷启动和验证器门控的在线策略蒸馏来训练提示器以改进“可提示性”。由此产生的系统在几乎所有组合性、推理和世界知识基准测试中均优于所有评估过的开源权重模型,同时在大多数评估中达到或超越最强的闭源权重模型。
TokTier:面向智能体LLM服务的精确有状态分词 Zhenyu Zhang 2026-07-31 PDF LLM服务系统会缓存提示词的KV状态,但大多数前端在每次调用时仍会对完整请求文本进行重新分词。这一开销对编码代理影响显著,因为它们在每次小型工具结果后会重新提交长对话记录,且复用困难,因为即使短小的追加也可能改变前序序列末尾的令牌边界。在来自两个代理生态系统的153,951次调用中,中位调用追加约1.4K字符,仅有1.0-3.6%的调用启动或重建包含数百万字符上下文的会话。在94.1%的集群提示缓存命中率下,分词耗时可达首令牌时间的64%。TokTier是一种有状态分词服务,其唯一契约是:输出的令牌ID始终与请求文本的完整参考分词结果一致。对于会话延续,它围绕追加点重新分词一个小窗口,并在每次请求的稳定边界检查通过后才进行拼接,失败时扩大窗口或回退到完整分词。对于无可复用前缀的调用,它将GPT家族的正则预分词分解为运行局部规则,并在GPU上执行精确预分词和BPE。一个采样影子验证器会重新检查实时流量。在17个分词器家族中,差异测试覆盖了1.5x10^10次分割检查、12.4 TB真实文本语料库和93,000多个重放代理步骤,零分歧。增量修复在100K到3M字符范围内耗时0.5-1.1毫秒,比HF分词快达437倍,在1M字符时比最强缓存基线(Gigatoken)完全预热状态下快2.1倍。GPU完整分词在0.87毫秒内编码1M字符请求,比HF低达491倍,比最快已发布CPU方法低23.4倍。与vLLM配合使用时,中位首令牌时间下降16-34%,在记录突发流量下P99下降23%。在50毫秒P99目标下,四个修复核心加一个GPU可维持1,821请求/秒,而16核无状态前端在40请求/秒时即饱和。
ExtractBench:面向模式引导的企业文档抽取基准 Boyang Zhang 2026-07-31 PDF 企业工作流越来越依赖智能体进行模式引导抽取:给定文档和用户定义的模式,智能体忠实遵循模式,生成正确输出,并以源证据作为基础元数据。我们提出ExtractBench,一个用于模式引导抽取的基准,据我们所知,这是首个同时评估值准确性、大规模记录完整性、基础依据和测量成本的基准。评估系统包含370份企业文档中的4,869页,覆盖8个业务领域和67种文档类型,并带有清晰标签区分挑战场景。可扩展的模式和真实数据整理流程结合了真实文档的独立系统一致性、合成列表的已知值以及表单的人工验证。我们报告顺序不敏感的值F1用于值准确性,以及两个用于源可追溯性的基础依据指标:词级和页级F1。商业VLM在短文档上表现良好,但在长文档上常截断记录列表,而编码智能体在更高成本下保持更高准确性。LlamaExtract Agentic Plus在所有三个指标上排名第一,其准确性与编码智能体相当,但成本仅为后者的一小部分。数据集和评估代码可在HuggingFace和GitHub上获取。
基于差分隐私的非参数众数学习及其在回归与聚类中的应用 Arkajyoti Bhattacharjee 2026-07-31 PDF 密度模式为多峰分布提供了局部且可解释的摘要,但在严格差分隐私约束下的估计仍 largely 未被探索。我们研究了在局部平滑性、曲率和分离条件下,多变量分布的密度模式的差分隐私恢复。我们提出DP-GRAMS,一种受均值平移启发的方法,在差分隐私得分估计器上执行噪声上升。假设密度局部属于平滑参数$β> 2$的Hölder类,我们的得分估计器使用偏差减少的高阶核,然后通过梯度裁剪和校准高斯噪声在梯度上升步骤中实施隐私。一种私有初始化方案结合了密度感知效用与抑制规则,并在公共$h_{\mathrm{DAP}}$网格上以$k\asymp M\log n$次抽取和抑制半径$ρ_{\mathrm{init}}\asymp (\log n)^{-1/d}$,通过连续抑制竞争区域中的选定局部邻域,以高概率覆盖模态盆地,而多个起始点间的相关噪声使得在单一$(\varepsilon,δ)$-差分隐私保证下进行联合发布成为可能。我们证明所有总体模式以高概率被恢复,并建立了形式为$O!\left((\tfrac{\log n}{n})^{\frac{2(β-1)}{d+2β}}\right) + O!\left((\tfrac{\mathrm{polylog}(n,δ)}{n^2\varepsilon^2})^{\frac{β-1}{d+β}}\right)$的渐近误差率。我们还提供了私有模式估计的极小极大下界,并表明我们的估计器在均方误差上,除对数因子外,几乎是最优的。我们提出了两个自然扩展:DP-PMS,一种私有模态回归方法,以及DP-GRAMS-C,一种聚类流程。在合成和真实数据上的广泛实验表明,相对于常见基线,我们的方法具有有利的隐私-效用权衡。
Muon的符号压缩:SignMuon、MuonSign及误差反馈的极限 Maria Smirnova 2026-07-31 PDF SignMuon通过取逐元素符号将Muon更新压缩为每个参数一位,这是在极低通信预算下运行矩阵感知优化器的最直接方式。它在实践中优于SignSGD,但即使在线性函数上也可能上升。在梯度进入线性最小化预言机(LMO)之前而非之后进行符号化,并不能修复此问题:我们构造了一个小的显式实例,在该实例上,符号化在前的(MuonUSign)和符号化在两侧的(MuonSign)也会上升,因此围绕预言机的符号放置位置在一般情况下均不能保证下降。误差反馈,作为有偏压缩器的标准补救措施,无法拯救SignMuon:当应用于Muon的输出时,误差反馈可能对任何光滑常数、步长和动量都失效。应用于梯度时,误差反馈确实有效,且EF21-MuonUSign和EF21-MuonSign在光滑非凸问题上达到了平方梯度范数的标准$\mathcal{O}(T^{-1/2})$速率,后者在每个方向上仅使用一位。实验随后反转了排序:在集中式CIFAR-10、联邦CIFAR-10和nanoGPT速度跑中,最强的压缩方法始终是LMO之后的符号化,这正是我们证明会发散的放置位置,而可证明收敛的变体则落后于它。在LMO之后压缩,这是一种启发式方法,在这些规模上比保证更重要。
冻结,然后选择:结构化场适配器与稳定性验证的弱选择用于稀疏观测下的PDE发现 Juncheng Zhong 2026-07-31 PDF 从稀疏观测中开展偏微分方程发现,需要重建连续场并选择正确的微分项。我们对耦合神经偏微分方程发现中优化路径的分析揭示了三种行为:精确支持集可能持续到训练结束、仅短暂出现或始终未能形成。为将方程选择与神经优化解耦,我们开发了一种“先冻结后选择”的方法,结合结构化场适配器与稳定性验证的弱形式选择(SVWS)。该适配器在无偏微分方程残差的情况下从观测中训练,将场分解为学习到的空间特征和由三次样条表示的时间系数。在冻结场之后,SVWS在独立弱形式系统中识别重复出现的项,重新拟合候选支持集,并在留出的弱形式系统上选择最终方程。除固定库外,我们将相同原理应用于遗传编程生成的表达式,并从稀疏、含噪观测中恢复了未知非线性扩散函数的幂律形式。在所有六种稀疏MDBench场景中,我们的方法达到了最高的精确支持集恢复率,在具有挑战性的Kuramoto-Sivashinsky动力学上,相较于经典和神经基线,其优势最为明显。
GQ-FSL:绿色量化联邦分裂学习 Idan Roth 2026-07-31 PDF 在无线边缘部署最先进的深度神经网络(DNN)受到移动设备严格能源和资源限制的严重制约。虽然联邦分割学习(FSL)通过将工作负载卸载到边缘服务器来减轻设备端计算负担,但这可能引入系统性开销,而切割层数据和子模型的持续交换仍会产生显著的能量消耗(EC)。为解决此问题,我们提出了一种绿色量化联邦分割学习(GQ-FSL)框架,该框架在本地协作训练和无线传输中均采用随机量化。值得注意的是,GQ-FSL支持客户端和服务器端子模型的不对称精度级别,有效将设备能量约束与全局收敛退化解耦。为量化这些权衡,我们为分割架构开发了参数化能量模型,并在统计异质性数据下推导了理论收敛界限。在此基础上,我们制定了一个联合优化问题,以配置DNN分割点和精度级别,在满足严格目标精度约束的同时最小化系统总能量消耗。最终,我们证明GQ-FSL能够在资源受限设备上实现大规模DNN部署,与量化联邦学习和全精度FSL相比,实现了更优的能量效率。
通过层级轨迹抽象复用过往修复以支持编码智能体 Yisen Xu 2026-07-31 PDF 尽管基于大语言模型的修复智能体能够处理复杂的仓库级问题,但它们将每个问题独立对待,并丢弃了从先前修复中积累的程序性知识。我们提出了STAIR框架,该框架将历史修复轨迹转化为分层、可复用的计划,这些计划可被调整以指导未来的修复。每条过去的轨迹被转换为一个多级树,从细粒度的诊断操作到高层次的修复策略,在不同粒度上编码经验。当新问题出现时,STAIR从多个抽象层级选择相关的计划节点,将其定制为可执行的、针对具体问题的计划,并通过提示提供给智能体。在SWE-bench Verified上,集成STAIR的Lingxi使用MiniMax M2.5达到81.2%的Pass@1,使用GPT-5达到79.2%。生成的计划也能跨智能体泛化:无需任何代码更改,它们将结构不同的智能体mini-SWE-agent v2的Pass@1从75.8%提升至81.0%。消融实验进一步表明,混合多个抽象层级优于任何单一层级,而未抽象化的原始轨迹迁移效果显著较差。
FDD-ON的开发:面向VAV HVAC系统故障检测与诊断的本体论 Yimin Chen 2026-07-31 PDF 故障检测与诊断(FDD)技术对于提升暖通空调系统可靠性、能效及维护有效性至关重要。然而,在建筑中有效部署FDD解决方案需要结构化的领域知识,以桥接异构数据源、多样设备类型及不同诊断输出。FDD领域内数据可解释性和互操作性的局限导致了信息孤岛碎片化,阻碍了FDD及其相关应用(如数字孪生驱动的FDD框架和人工智能(AI)驱动的维护决策系统)的实施。本文提出了一种FDD本体(FDD-ON),一种模块化且可扩展的本体,用于正式表示变风量(VAV)暖通空调系统组件、故障类型、症状状态、故障影响及相关属性。FDD-ON整合了暖通空调系统FDD语义,以提供故障和症状属性的全面表示,并辅以定义明确的受控词汇表。此外,FDD-ON提供了全面的故障、症状及影响库,以捕获VAV暖通空调系统中广泛的运行异常及其后果。通过明确的致因-故障-症状-影响关系,FDD-ON作为机器可解释的基础,用于查询诊断知识、映射异构FDD输出及开发可互操作的FDD相关应用。FDD-ON使用公开可用的VAV暖通空调系统数据集进行评估,并通过FDD开发应用进行演示。结果表明,FDD-ON为跨各种应用推进可扩展、透明且可互操作的FDD解决方案提供了基础语义框架。