跳转至

arXiv 2026-10-04

标题 作者 发布日期 PDF链接 摘要
S$^{2}$-PINN:随机可分离物理信息神经网络 Zhendong Li 2026-10-02 PDF 随机偏微分方程的不确定性量化在计算科学与工程中无处不在。然而,针对这类问题的经典谱求解器面临维数灾难,而现有的神经求解器往往忽略了使矩和校准变得可处理的随机结构。我们提出了一种随机可分离物理信息神经网络,称为S$^{2}$-PINN,它将随机偏微分方程的解$u(t,\mathbf{x},\mathbf{Z})$表示为可学习的高斯空间字典、傅里叶时间特征和广义多项式混沌随机基,并通过低秩规范多态张量分解核心耦合。该方法使用混合强形式与gPC投影残差损失进行训练。我们的理论分析表明,在温和条件下,可分离类在$L^2$中是稠密的,并且投影残差恰好对应于随机伽辽金约束。此外,我们表明小批量投影系数对数依赖于gPC模式的数量,并且正交性惩罚控制着所学空间字典的条件数。使用四个制造随机偏微分方程基准,我们表明S$^{2}$-PINN在均值和方差精度以及校准方面优于九个基线,同时使用的参数显著更少。进一步在非制造泊松和达西问题、随机纳维-斯托克斯问题、更高随机维度的扩散缩放研究以及两个随机反问题上的评估,揭示了所提出结构的泛化能力。总之,这些结果支持将随机可分离性作为物理信息神经不确定性量化的有效设计原则。实验代码可在https://github.com/DMax1314/s2pinn找到。
JOVE:面向资源感知的LLM任务图的联合执行与验证 Haoran Zhang 2026-10-02 PDF 复杂推理查询可以被分解为有向无环任务图,并分布到异构LLM上执行,通过并行化降低延迟,并使较小的模型能够解决复杂任务。然而在实践中,某个LLM是否适合给定子任务可能是先验未知的,且仅凭执行无法揭示输出正确性。我们提出JOVE,一个在线框架,它联合分配执行器LLM并选择中间输出以进行付费验证。验证异步运行,并用于改进未来的分配,因此系统必须在当前执行支出与后续学习之间取得平衡。我们研究如何在长期预算和每查询延迟约束下优化这一权衡,其中LLM服务质量、调用成本和执行时间均为随机的且初始未知。JOVE通过求解一系列每查询混合整数线性规划来做出执行和验证决策。在线学习基于验证反馈更新任务相关的LLM质量估计,而信息增益奖励将学习的价值纳入分配决策。在一组自然的假设下,我们为JOVE建立了次线性质量学习遗憾。在四个推理基准上,JOVE相对于标准推理基线取得了有竞争力的准确率,同时将平均成本和延迟至少降低3.17倍。
并行时间对齐脉冲自注意力:用于一致的整数值训练和脉冲驱动推理 Peng Xue 2026-10-02 PDF 整数值泄漏积分发放(I-LIF)神经元和脉冲发放近似(SFA)分别通过将脉冲序列表示为发放计数和归一化发放率,降低了时间训练成本。然而,将脉冲自注意力(SSA)直接应用于这些压缩后的查询、键和值表示,会引入在脉冲驱动推理中不存在的跨时间交互。我们将这一算子层面的差异称为时间交互失配(TIM)。我们提出并行时间对齐脉冲自注意力(PT-SSA),它从 I-LIF 计数或 SFA 发放率中重建连续的虚拟脉冲切片,仅在时间对齐的切片之间并行计算注意力,并对每一步的输出求和。为适应 SFA 下注意力输出尺度的减小,我们进一步引入自适应 PT-SSA,它在输出 SFA 神经元之前学习一个逐块的正缩放因子,以提高发放水平的利用率。在 CIFAR-10、CIFAR-100 和 ImageNet-1K 上的实验表明,所提方法大幅降低了训练-推理失配。在 CIFAR-100 上使用 I-LIF 时,PT-SSA 将平均 Top-1 差距从 1.85 个百分点降至 0.29 个百分点。在 ImageNet-1K 上,自适应 PT-SSA 将 Top-1 差距从 27.78 个百分点降至 0.06 个百分点,并实现了 74.53\% 的脉冲驱动 Top-1 准确率。一个 Triton 融合的 PT-SSA 训练内核相较于循环 LIF SSA 保持了 $2.91\times$ 的吞吐量优势。
错误的器官,正确的物理原理:将超声心动图预训练迁移至肺部超声用于结核病筛查 Christiaan M. Geldenhuys 2026-10-02 PDF 肺部超声(LUS)在初级保健层面的结核病(TB)筛查中具有吸引力,但带标注的队列规模较小。超声心动图则不受此限制,同时与LUS共享相同的底层超声成像物理原理、信号处理和B模式外观。我们追问:在高资源超声领域预训练的编码器,其表征是否在低资源领域仍然可用。仅编码器发生变化,涵盖三个架构家族的十七种编码器。其中,在通用视频上预训练的潜在预测视频编码器(V-JEPA2-L)与其超声心动图对应版本(EchoJEPA-L)仅在预训练语料上不同。在这些编码器之间的选择并不能解决分类问题,整个家族的跨度仅为2.50个百分点,而测量分辨率为2.71。真正推动任务的是特征条件化。在编码器与分类器之间对特征进行标准化,使全部十七种编码器平均提升+1.23个百分点,$p=1.5\times10^{-5}$。在留出测试集上,每一个在开发折上选出的编码器都高于基线系统,受试者工作特征曲线下面积(AUROC)最多提升+2.57个百分点,90%灵敏度下的特异度达到79.3%,而基线为60.3%。预先指定的对比,即EchoJEPA-L对V-JEPA2-L,测得-0.16个百分点,$p=0.926$。因此,我们没有发现证据表明仅凭共享的超声物理原理就能使超声心动图成为比通用视频更高产的预训练语料,而且任何优势即使存在,也小于该队列所能分辨的程度。然而,视频编码器接收的是复制后的静态图像,因此这种效应的缺失究竟反映的是预训练领域,还是视频编码器应用于静态帧,无法区分。限制因素是带标注的队列,而非编码器。
MLLM中依赖架构的融合路径 Hebao Zhu 2026-10-02 PDF 多模态大语言模型(MLLMs)在视觉-语言任务中取得了强劲性能,但视觉与文本信息跨层融合的内部机制仍未被充分理解。我们研究了来自两种架构范式的代表性MLLMs:拼接架构和原生多模态架构。我们进行了三项逐步关联的分析:对齐解耦识别哪种模态发生变化,注意力路由与熵刻画跨模态信息如何分布,内在维度考察融合如何重塑特征空间。此外,我们进行因果干预实验,以验证由此得到的解释。作为补充分析,我们使用视觉CKA来检验柏拉图表示假说。这些分析共同揭示了两条不同的融合路径:拼接模型遵循文本优先、视觉在后的路径,而原生模型表现出更早的视觉-文本协同适应和特征空间重组。这项工作为理解多模态融合提供了机制性视角,并支持多模态表示的架构感知诊断。
VenusRL:一个具有优先级调度和可扩展交互的完全解耦的智能体强化学习系统 Mingjun Zhang 2026-10-02 PDF Agentic RL通过多轮交互与外部工具环境训练LLM智能体。其多轮特性暴露了现有agentic RL框架未解决的两个系统级瓶颈。第一,端到端训练吞吐量受限于完成最慢的轨迹,而仅优化每GPU利用率会将rollout进度分散到多个组中,延迟足够多组的完成以解除下一步训练的阻塞。第二,工具沙箱按其声明的内存上限被静态超额配置,导致大部分物理内存被闲置,同时在由同一提示启动的沙箱之间复制几乎相同的状态。我们提出VenusRL,一个完全解耦的agentic RL系统,解决这两个瓶颈。VenusRL的优先级感知动作调度器使用长度预测启发式来识别其完成最有可能解除下一步训练阻塞的样本组,并在批次准入、KV Cache驻留和跨worker请求编排中将其推到其他组之前。VenusRL的环境资源管理器结合了内存感知准入阈值与模板键控的页共享池,通过写保护页表项别名和写时复制在保持严格内存隔离的同时,每节点打包更多沙箱。在代表性agentic RL工作负载上,VenusRL相比最先进的基线实现了高达4.24倍的端到端训练加速,并将环境成本降低高达89%。
HexVIO:通过商用DSP实现全天候立体惯性跟踪 Patrick Wolf 2026-10-02 PDF 设备在周围环境中定位自身的能力是空间计算的基本前提。视觉惯性里程计(VIO)已被证明是完成这一任务的一种经济高效且准确的解决方案。机器人、可穿戴设备、XR 设备和无人机都能从 VIO 的高效实现中显著受益,因为这使得设备可以更凉爽、更轻便、更便宜,同时拥有更长的电池续航和更好的用户体验。在这项工作中,我们提出利用 Hexagon DSP 来提升 VIO 系统的效率,这是一种存在于许多现代智能手机和 XR 设备中的通用协处理器。我们的方法将立体惯性里程计系统的视觉前端卸载到 DSP 上,同时将后端保留在主 CPU 上。通过针对 DSP 架构优化实现,与仅使用 CPU 执行相比,我们实现了功耗和延迟的显著降低。我们的系统 HexVIO 在商用智能手机上展示了 67% 的功耗降低或 86% 的吞吐量提升,能够以 0.83 W 的功耗维持长期实时 30 fps 跟踪,相当于在测试设备上约 18 小时的跟踪。这些结果凸显了通用 DSP 在机器人和移动设备中实现全天视觉惯性跟踪的潜力。
基于神经网络的投资加速原理再探讨 Guido Fioretti 2026-10-02 PDF 投资加速原理是一种从消费时间序列建模投资时间序列的启发式方法。本文提出的模型构建了一个分解的加速方程,其系数是代表企业决策的Kohonen神经网络的权重。根据该模型,当管理者识别出新兴的技术模式时,投资就会发生。此外,借用自组织系统理论的一种技术被用来将创新驱动的投资与工厂复制投资区分开来。
推进视频显著性研究:一个运动至关重要的新数据集与基准 Susmit Agrawal 2026-10-02 PDF 视频显著性预测由于增加了时间维度,本质上比静态图像显著性更难建模。视频显著性基准建立在这样一个前提之上:预测视频中的注视需要利用分布在帧间的时间活动。先前的工作对此提出了挑战,表明静态基线在LEDOV这一流行的视频显著性数据集上恢复了可解释注视信息的相当大一部分,并且视频显著性模型在与该静态基线相同的地方失败。我们验证了这一诊断仍然成立:在比原始分析更强大的金标准下,以及一组更新的近期架构中,该组中最强的时间架构仍未显著优于微调后的静态基线。然而,目前尚不清楚这种边际增益反映的是当前时间架构的局限性,还是基准本身缺乏时间模式。我们引入了SalTempto,一个具有更强动态性的视频显著性基准:224个高度动态内容的片段,来源于HACS-Segments数据集,使每个片段包含一个事件及其前因和后果,并配有最多16名被试的注视记录以及用于适配预训练模型的训练集。在SalTempto上,静态基线仅恢复了中心偏置之上约13%的提升空间,而在LEDOV上则超过一半。一个微调后的时间架构相较于静态基线表现出显著的性能提升,表明它确实捕捉到了更多有意义的时间信息,而这是LEDOV未能衡量的。然而,即便是这一最先进的模型,仍未解释SalTempto近一半的提升空间,表明视频显著性建模仍有改进余地。对SalTempto的考察还使我们能够描述模型所遗漏的人类倾向。SalTempto链接:https://huggingface.co/datasets/bethgelab/video_saliency。
EVOL:模拟器引导的进化专家合成用于免部署学习路径推荐 Geonwoo Bang 2026-10-02 PDF 用于学习路径推荐(LPR)的强化学习(RL)面临两个相互耦合的障碍。第一,策略必须在没有中间反馈的情况下确定一个长度为L的概念序列,这产生了一个随L超指数增长的组合搜索空间,并且仅在最后一步提供奖励。第二,专家学习路径本是稀疏奖励RL的自然解法,但它们在教育数据中并不存在,因为学生日志记录的是学习者做了什么,而不是他们本应做什么。我们通过引入机器人学中基于模拟器的示范学习方案来解决这两个障碍:知识追踪模拟器既用于通过进化搜索为每个学习者合成专家示范,也用于训练一个无需部署的策略,将这些示范蒸馏为一个前馈学习器。我们的框架EVOL用非对称演员-评论家实例化这一流程,其中演员在训练期间坚持符合部署现实的盲规划,而评论家则利用特权模拟器状态。在三个数据集(ASSIST15、Junyi和EdNet;39–189个概念)以及路径长度L = 5、10和20上,EVOL超越了涵盖启发式、序列式、RL、图增强RL和LLM增强方法的8个基线。我们进一步比较了三种模仿策略(BC、AWR和DAPG),并表明最终性能由进化专家的质量决定,而不是由特定的模仿目标决定。