跳转至

arXiv 2026-09-01

标题 作者 发布日期 PDF链接 摘要
针对WhisperX的上下文感知交错批处理 Carlos Bain 2026-08-31 PDF WhisperX通过音频内批处理加速语音转录,但它隔离了音频片段,失去了连贯标点和术语转录所需的历史上下文。相反,标准Whisper按顺序保留上下文,但推理速度慢且易陷入幻觉循环。为兼得两者优势,我们提出上下文感知交错批处理。通过利用基于VAD的片段边界,我们的算法稳定了Whisper的文本条件化,从而在批处理音频片段间安全地维持连续历史上下文。如长音频基准测试所示,该方法降低了词错误率(WER)并改善了专有名词转录,同时保持了高吞吐量的推理速度。
一般博弈中的恒定个体遗憾 Mingyang Liu 2026-08-31 PDF 解耦的无遗憾动态提供了一条去中心化地达到均衡的途径,但先前对个体遗憾的保证仍依赖于时间跨度的多对数项。我们在完全信息反馈下,对每个有限的$N$人正规形式博弈移除了这一依赖。我们引入了\emph{ECHO-OFTRL}:配备用于高阶乐观的EMA级联(ECHO)的乐观跟随正则化领导者(OFTRL),其中EMA指指数移动平均。该算法是确定性的且完全解耦的。若$m_{\max}$表示最大的行动集大小,则对于每个时间跨度$T\geq1$,它同时保证博弈中每位$N$个玩家的遗憾上界为$O(\textrm{poly}(N, \log m_{\max}))$。我们的算法利用了受现代滤波器设计启发的一种新形式的乐观。
SUN:面向语言接地控制-学习-现实策略的持久程序 Weiqi Wang 2026-08-31 PDF 在长时程操作中,将基于模型的控制与学习策略相衔接,一直潜藏着一个未言明的分歧:控制执行明确的目标,学习则将这种行为摊销为反应式策略,然而现有协议丢弃了任务语义,导致奖励需手工设计,行为偏离控制所验证的内容。我们引入了语义统一(SUN)程序,这是一种类型化可执行文件,其中几何和接触关系被定义一次,并编译为对齐的模型预测控制(MPC)成本、满足谓词、强化学习奖励、转换守卫和诊断信息。我们的系统Kuafu,由大型视觉语言系统驱动,能从语言和场景语义中自动合成SUN程序,通过MPC筛选可行性,并在训练阶段条件策略时保留语义。在九项任务中,Kuafu实现了82.03%的宏观成功率,优于稀疏奖励(35.67%)和阶段行为克隆(24.75%)基线。在8192路规模下,它每小时人类遥操作产生的成功轨迹时间是后者的10.57倍。每项任务使用500条轨迹,Kuafu数据训练DP3策略,在模拟中达到46.0%的成功率(对比替代方案的22.4%),在物理Franka和Kinova机器人上达到34.7%。这些结果表明,经模拟筛选的任务语义能有效将控制摊销为稳健策略,无需演示或手动密集奖励,统一了符号规划与数据驱动执行。
代理式研究是自相矛盾的 Natalie B. Hogg 2026-08-31 PDF 代理型大型语言模型的使用消除了人类对科学结果的解读,这将导致文献中产生大量不信任。
BRF-GS:基于三维高斯泼溅的高光谱双向反射因子建模与图像生成 Yiling Yao 2026-08-31 PDF 双向反射因子(BRF)表征了地表的方向性辐射特性。然而,现有的三维(3D)辐射传输模型需要复杂的场景构建和计算密集型的辐射传输求解器,限制了多角度高光谱反射率影像的高效生成。3D高斯泼溅(3DGS)为神经场景表示和新视角合成提供了高效框架,但其低阶球谐函数表示不足以应对复杂的方向性反射,而高光谱数据的高维性和波段间质量差异又带来了额外挑战。为解决这些问题,我们提出了BRF-GS,一种基于3DGS的BRF建模和高光谱反射率影像生成框架。BRF-GS引入了一种混合BRDF驱动核来表示复杂的方向性反射,选择几何可靠的谱段以进行稳健的3D场景初始化,并采用两阶段训练策略,将几何优化与光谱建模解耦。我们进一步构建了AIR-BRF数据集,这是一个包含三个场景、涵盖多样自然和人工目标的多角度高光谱方向性反射率数据集。实验表明,BRF-GS在空间和光谱保真度上表现优异,并能准确再现特征性的视角依赖BRF响应。所提出的框架为遥感场景中的BRF建模和多角度高光谱反射率影像生成提供了一种高效的数据驱动方法。
具有仿射潜在参数化的神经网络的尖锐逼近率 Shijun Zhang 2026-08-31 PDF 许多参数高效方法从低维潜在表示生成大型神经网络的参数。给定一个具有$P_Φ$个参数槽的架构$Φ$,我们写作$\boldsymbolθ_f=\mathcal{G}(\boldsymbolξ_f)$,其中$\mathcal{G}\colon\mathbb{R}^M\to\mathbb{R}^{P_Φ}$是参数生成器,$\boldsymbolξ_f\in\mathbb{R}^M$是目标函数$f$的潜在表示。架构$Φ$和生成器$\mathcal{G}$在整个目标类别中共享,而每个目标$f$由其自身的潜在向量$\boldsymbolξ_f$表示,其中$Φ_{\mathcal{G}(\boldsymbolξ_f)}$近似$f$。这一框架涵盖了超网络、低维参数化、参数高效适应和模型压缩。因此,理解潜在维度$M$与网络预算$P$之间的权衡对于刻画这些方法的表达效率至关重要。我们针对仿射生成器和全连接ReLU架构研究这一权衡。更精确地说,在满足$P_Φ\leq P$的架构$Φ$和仿射生成器$\mathcal{G}:\mathbb{R}^M\to \mathbb{R}^{P_Φ}$上联合优化,我们证明了在$[0,1]^d$上$α$-Hölder函数单位球上的最优最坏情况均匀逼近误差,其中$0<α\leq1$,具有尖锐阶数$ \bigl(P\min{M,P}\bigr)^{-α/d} $。特别地,我们的结果表明,即使固定维度的潜在空间也足以随着网络预算的增加实现逼近误差趋于零。
审计匿名AI模型:黑盒身份验证的四阶段协议 Yisen Xi 2026-08-31 PDF 2025-2026年AI市场出现了一波隐秘发布潮:前沿模型以代号形式匿名部署在开发者平台上。对用户而言,身份决定了数据处理条款、供应链风险和性能预期。目前尚无经过验证的方法论可用于匿名模型的黑盒身份验证:从业者检查清单缺乏准确性证据,而自我声明在设计上就不可信。我们提出一个针对API服务模型的四阶段取证审计协议。阶段0通过存档平台快照(Internet Archive)重建发布时的配置,揭示预览与生产版本之间的漂移。阶段1将配置(上下文长度、输出上限、推理能力、模态)与平台目录进行指纹比对。阶段2通过跨长度差分测试分词器身份,排除短提示词碰撞。阶段3用行为探针进行佐证。我们在10个已知身份发布上测试了声明一致性(7个完全匹配,2个精度差异,1个部分匹配,0个反向),而非匿名条件下的端到端识别。识别在一个旗舰案例上进行了前瞻性验证,该案例2026-08-23的分析指向GLM-5.3版本线,官方揭晓确认了家族和版本线的推断(部署变体未预先断言;Flash在揭晓后一致),并在三个仅阶段0的案例上验证,协议在这些案例中给出了分级假设或拒绝猜测而非随意判断。仅使用标准库的实现作为补充材料提供。
可配置的语义分块用于检索增强生成中的生物医学信息提取 Riya Ahuja 2026-08-31 PDF BioMedRAG引入了检索增强生成,并配备了一个学习得到的块评分器,用于生物医学信息提取。然而,它依赖于固定大小的分块,这可能会割裂语义证据。我们提出了一种可配置的语义分块框架,通过结合实体保留窗口、触发词中心分块、命题优先提取、分层触发词优先级排序以及层级关系解析来解决这一局限。该框架与BioMedRAG集成时,仅替换分块构建阶段,同时保留嵌入模型、学习得到的块评分器、生成器和评估协议。我们在生物医学关系提取基准(GM-CIHT、DDI、ChemProt)和不良事件分类(ADE)上评估了该框架。在GM-CIHT上,完整的混合配置达到了82.6%的F1分数,在我们的实验设置下,相比固定大小基线(74.2%的F1分数)提高了8.4个百分点。跨数据集分析表明,语义分块改善了具有明确关系线索的提取数据集,如GM-CIHT和DDI,而固定分块在密集生化提取和二元分类设置(如ChemProt和ADE)中仍保持竞争力或更强。通过将分块逻辑外部化到配置文件中,该框架为生物医学RAG流水线提供了一种可解释且可适应的替代方案,以取代僵化的固定大小分块。
OntoAligner-Ensemble:基于投票的异构本体对齐技术融合 Hamed Babaei Giglou 2026-08-31 PDF 本体对齐(OA)已通过多种方法论范式演变,涵盖从词汇和结构对齐器到知识图谱嵌入(KGE)模型,以及最近基于大语言模型(LLM)的方法。尽管现代OA框架为部署这些异构对齐器提供了统一生态系统,但系统性地调和其互补且有时冲突的预测的机制仍相对未被充分探索。我们提出OntoAligner-Ensemble,一个模块化且对齐器无关的框架,通过可配置的两阶段过程组合候选对应关系,该过程包括基于投票的融合策略,随后是融合后选择策略。该框架支持OntoAligner中实现的任何产生候选对应关系的对齐器,从而通过统一决策过程集成多样化的对齐范式。为展示其有效性,我们使用代表性的轻量级字符串对齐器、基于KGE的对齐器以及由开放权重和基于API的LLM驱动的检索增强生成对齐器来实例化该框架。我们在来自五个OAEI轨道的八个基准任务上评估个体对齐器和集成配置,涵盖从生物医学到超越等价性的范围。结果表明,集成融合持续改善精确率和召回率之间的平衡,并经常在多样领域超越独立对齐器。此外,我们的分析揭示集成组成直接影响精确率-召回率权衡:异构跨范式集成通常提高精确率,而同质LLM集成更常实现更高的总体F1分数。这些发现表明,系统性集成学习为OA提供了稳健且可复现的策略,同时为在不同对齐场景下选择集成组成提供实用指导。
在Template Model Builder(TMB)中实现神经网络混合效应模型 Nan Zheng 2026-08-31 PDF 神经网络混合效应模型(NMMs)通过结合人工神经网络的强大表征和预测能力与混合效应建模捕捉复杂相关结构的优势,已获得广泛关注。然而,现有估计方法严重依赖目标函数和梯度的手动推导,这固有地迫使采用简化近似,并严重限制了NMMs的复杂性和准确性。在本工作中,我们引入了一个使用模板模型构建器(TMB)实现NMMs的通用框架。通过利用自动微分和拉普拉斯近似,TMB仅要求用户指定负联合对数似然及任何正则化项。该框架自动积分出随机效应,并评估边际目标函数及其精确梯度,无需手动推导或临时近似。我们通过两个数值示例展示了基于TMB的NMMs的效率、灵活性和统计性能,包括一个应用于单调NMMs的案例。提供了可复现代码以促进更广泛的采用。