跳转至

arXiv 2026-08-11

标题 作者 发布日期 PDF链接 摘要
感知先于监督:从反事实盲点进行自包含视觉蒸馏 Shravan Venkatraman 2026-08-10 PDF 多模态大语言模型(MLLMs)的自我提升通常依赖于基于奖励的方法,这些方法仅提供粗略的标量反馈。蒸馏通过密集的令牌级监督提供了更丰富的替代方案,但在视觉领域,它通常依赖于使用外部标注和工具或更强模型构建的特权上下文。我们引入了\textbf{CVPD}(对比反事实视觉过程蒸馏),据我们所知,这是首个完全自包含的框架,用于MLLMs的密集、在线策略、令牌级视觉自我蒸馏。CVPD识别视觉盲点,在这些盲点中,放大某个区域会改变并锐化模型的答案分布,而移除相同区域则使全图行为基本不变。这些区域揭示了模型能够编码但在全图条件下未能一致利用的感知信息。我们提出了一种三门反事实准则,直接从模型自身的响应中识别这些区域,并将其转换为密集的对比监督用于自我蒸馏。在Qwen3-VL-8B-Instruct上,CVPD在十二个基准测试中优于六个自我进化基线,包括依赖外部GPT-4o监督的方法,且没有出现任何回归。它在OCRBench上取得了$+3.60$的提升,在MMStar细粒度感知上取得了$+3.38$的提升,在MMStar逻辑推理上取得了$+3.08$的提升,同时在更广泛的多模态基准测试上保持或提高了性能。
超越自然度:在语言学维度上探究自动文语转换评估器 Oluwanifemi Bamgbose 2026-08-10 PDF 自动文本转语音(TTS)评估方法(平均意见得分(MOS)预测器和音频大语言模型(Audio-LLM)评判器)预期反映人类感知,但尚不清楚它们在多大程度上捕捉到听众实际感知的语音的不同方面。我们将“自然度”解构为一个基于语言学的标注模式,涵盖10个不同的感知维度,并利用该模式构建了首个维度级TTS元评估基准,包含860条由训练有素的语言学家评分者标注的语音样本。对四个MOS预测器和四个Audio-LLM评判器进行基准测试的结果显示,MOS预测器主要聚焦于声学信号质量,而Audio-LLM评判器则表现出选择性的、依赖提示的检测能力,且无法在所有维度上泛化。这两类方法均未能可靠地捕捉到广泛的语言结构化语音错误。我们的数据集、标注模式和评估代码已公开,以支持更具针对性和可解释性的TTS评估。
多模态模型差异分析用于特征发现与控制 Hunar Batra 2026-08-10 PDF 多模态大语言模型(MLLMs)展现出强大的视觉理解能力,但导致这些行为的内部特征仍难以识别、审计或控制。虽然适用于事后检查,但使用稀疏自编码器(SAEs)分解为可解释特征方向的隐藏状态,既不能轻易隔离多模态训练改变了哪些特征,也不直接用于针对性控制。我们引入MMDiff,一种多模态模型差异框架,它训练多模态SAEs并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff支持三种用途:(i)特征隔离,通过将基础语言模型SAE与其多模态适配版本进行差异比较,识别多模态训练改变的特征;(ii)任务特定特征检测,通过逐令牌对比激发分析隔离因果特征;(iii)特征级控制,通过因果移除或引导所发现的特征方向。我们为三个MLLM家族——LLaVA-MORE、PaliGemma 2和InternVL3.5——训练多模态SAEs,并在视觉空间理解、多模态安全和OCR上评估。MMDiff发现稀疏、因果特定的特征,其移除在空间任务上平均选择性退化目标行为12%,在OCR上退化17%,并将多模态安全攻击的成功率降低24%,且对VQA性能无影响。引导这些特征在标准单层引导基线上平均提高空间和OCR准确率+3.6%和+1.8%。这些结果表明,多模态SAEs不仅可作为可解释性工具,还可作为审计、引导和控制MLLM行为以生成更安全、更强大输出的机制。
学习世界如何演化:通过潜在动态推理实现外推式视频世界模型 Haodong Li 2026-08-10 PDF 世界按照其动力学(即运动定律)演化。然而,领先的视频扩散模型主要拟合像素,而不建模像素如何随时间转换。因此,它们生成视觉上合理的帧,但可能无法准确遵循这些定律。为了纯粹从像素中捕捉动力学,我们引入了潜在动力学推理(LDR)。LDR将潜在转换视为显式运动学积分,其中低阶动力学被数值积分,模型仅回归驱动推演的三阶及更高阶残差。为使此积分更好地外推,LDR在结构化潜在空间而非密集卷积特征上运行。遵循PhyWorld,我们在一个受控的白盒物理基准上验证LDR,该基准涵盖五个任务(匀速运动、抛物线、碰撞、弹跳、逼近),重点关注分布外场景,以揭示模型是否真正学习了底层动力学。LDR能更好地外推所学动力学:在单任务和联合任务训练下,256²分辨率时,其分布内与分布外误差之间的差距比视频扩散基线小20倍以上,同时使用参数少26倍,运行速度快143倍。LDR甚至能在严重偏移下泛化:例如,仅用红色球从左向右移动训练,它能正确预测蓝色方块从右向左移动。据我们所知,这是首个能将其所学动力学外推到训练分布之外的视频世界模型。项目页面:https://lat-dyn-reason.github.io/
从价值观到基准:评估荷兰政府应用中大型语言模型的表现 Laurens Samson 2026-08-10 PDF 大型语言模型正日益部署于政府环境之中,然而现有评估框架鲜有同时反映公共行政价值观及非英语语境的语言要求。我们提出了“Grip on LLMs”框架,这是一套专为荷兰政府使用而设计的系统性评估套件,与一家大型荷兰市政组织的领域专家合作开发。通过咨询委员会流程、用户研究以及对公务员聊天机器人用户的调查,我们确定了六个评估维度(事实性、诚实性、社会偏见、能源消耗、成本及训练数据透明度),并将其操作化为一个涵盖30多个多语言及荷兰语特定模型的基准套件。我们的结果显示,没有任何单一模型能在所有维度上表现出色,且权衡不可避免:更高质量始终伴随着更大的环境影响和财务成本,而偏见则大体上独立于这两者。我们进一步发现,事实性(模型是否正确回答)与诚实性(模型是否承认其未知内容)受不同属性支配,高事实性并不意味高诚实性。为使这些发现对非技术受众具有可操作性,我们发布了一个公开可访问、用户友好的模型概览,旨在服务于参与政府LLM选择的各类利益相关者,从工程师到政策制定者。
GENCO——嵌入开发框架中的统一神经求解器,用于稳态电网分析 Alban Puech 2026-08-10 PDF 基础模型正在改变业务流程并提升生产力,但在电力系统分析等工程领域仍基本缺失,这些领域必须严格遵循物理一致性。我们提出GENCO(几何神经校正优化器),一种统一的神经求解器,用于稳态输电网分析,在单一架构和共享网络表示中处理潮流(PF)、最优潮流(OPF)和状态估计(SE)。为支持神经电力系统求解器的进展,我们推出开源GridFM开发框架,该框架在低代码环境中标准化合成数据生成和训练。我们还发布大规模数据集,包含跨多种电网拓扑的数百万个PF和OPF场景,以支持可复现的基准测试。我们在PFDelta和OPFData基准上评估GENCO,与最先进的神经求解器和经典求解器(包括Newton-Raphson和IPOPT)进行比较,并在真实世界Hydro-Québec SCADA数据上测试。对于大规模PF,GENCO恢复完整交流运行状态,包括直流PF无法提供的电压幅值和无功功率,同时匹配直流PF级别的有功功率平衡残差。它比Newton-Raphson快达30倍,仅比直流PF慢2倍。对于OPF,它比IPOPT快达85倍,同时在可行性、最优性和运行时间上优于直流OPF。对于SE,GENCO比经典加权最小二乘法对噪声测量和网络参数误差更稳健,即使加权最小二乘法无法收敛时也总能返回高质量估计。统一架构和开发框架共同为大规模稳态电网分析提供了新方法,降低了电力系统工程师的入门门槛,标志着向电网基础模型迈出一步。
使用基础模型检测Python重构实现中的行为变化 Jonhnanthan Oliveira 2026-08-10 PDF Python是一种广泛采用的编程语言,因其简洁性和灵活性而受到重视。然而,尽管重构是软件演化中旨在改善内部代码结构而不改变外部行为的重要实践,Python的自动化重构仍然具有挑战性。理解重构过程中如何引入行为变化至关重要,因为这类问题可能损害软件可靠性并降低开发人员生产力。我们提出了一种基于基础模型预言机的方法,该方法分析git风格的差异,以识别Python重构引入的行为变化。我们在Rope重构实现上评估了我们的技术,重复使用了先前研究中的1,152次重构尝试,并使用预言机分析了217个结果转换对。我们的基于模型的分析在研究的七种重构类型中发现了13个不同的缺陷。所有报告的缺陷都已提交给相应的开发人员,根据问题跟踪器的证据,13个问题报告中有12个被接受。这些结果突显了提高当前Python重构工具鲁棒性的必要性,以确保自动化代码转换的正确性并支持可靠的软件维护。
通过合成生成克服硬件保障中的数据稀缺与保密性问题 Gijung Lee 2026-08-10 PDF 硬件保障依赖于扫描电子显微镜(SEM)来验证纳米级结构,但组装自动化分析所需的大规模高质量数据集,受到耗时采集和对专有设计严格知识产权(IP)限制的阻碍。我们提出了一种隐私保护流程,通过大幅扭曲功能设计来保护IP,同时从少量初始样本生成视觉上逼真的合成数据集。StyleGAN首先学习硬件布局掩码的分布,以生成新颖的、宏观上多样化的结构。随后,条件生成对抗网络(Pix2PixHD)将这些掩码转换为保留真实纹理和噪声的逼真SEM图像。本研究的主要发现是,仅在此合成数据上训练的分割模型不仅成功实现了对真实图像的“模拟到真实”迁移,而且性能优于在有限真实数据集上训练的基线模型。由于底层合成布局明显新颖,且不复制原始设计的任何特定专有布线,部署最终分割模型可降低将敏感IP暴露于梯度反演和成员推断等攻击的风险,为硬件保障提供了高度安全且高性能的解决方案。
超越危险相似性:面向免训练视频异常检测的对比事件裁决 Wenti Yin 2026-08-10 PDF 视频异常检测(VAD)旨在识别并时间定位视频中的异常事件。监督方法从目标域标注中学习异常决策边界,但需要大量域内数据。现有的免训练方法利用预训练模型的丰富语义知识和推理能力来解读视觉内容,然而这些能力并未直接定义异常决策标准:更丰富的异常描述能更好地捕捉危险相似性,却无法解决异常判定问题。为此,我们提出用于免训练视频异常检测的对比事件裁决方法(CEAVAD),将推理单元从孤立的异常概念转向可证伪的事件假设,并通过竞争性解释与视频证据之间的交互建立推理时的解释性边界。具体而言,CEAVAD首先利用公共安全知识构建危险-良性事件对比,将每种危险机制与通用正常描述及机制特定的良性对应项配对。随后,它判断目标区间更支持危险解释还是其良性竞争者,从而为目标生成可修正的对比边界提案。最后,CEAVAD在竞争性解释之间进行裁决,以确定危险假设是否在视频证据中成立,同时支持时间定位的异常检测和基于证据的解释。在三个广泛使用的VAD基准上的实验表明,CEAVAD在免训练范式下达到了最先进的性能。
DistMoE:分布式指令微调中混合专家模型的私有数据免排练路由机制 Mainak Singha 2026-08-10 PDF 多模态大语言模型(MLLMs)已展现出强大的多模态指令跟随能力,但将其适应于多样化的视觉-语言领域通常假设集中式数据访问和昂贵的联合训练。当数据分布在私有、领域特定或权限受限的客户端时,这种假设具有限制性。为此,我们提出DistMoE,一种用于分布式视觉指令调优的混合专家(MoE)方法。在语言解码器的每一层中,它通过客户端特定的私有前馈网络(FFN)专家增强公共前馈网络,旨在获取领域特定知识。然而,独立的专家训练导致私有FFN学习到不同尺度和量级的表示,使得合并专家变得困难。为减少客户端特定漂移,我们引入一个公共锚定的专家组合阶段,该阶段仅通过各向同性正则化损失,在本地客户端数据和公共数据的混合上更新路由器和轻量级私有投影适配器,从而实现无需跨客户端重放的组合。在推理时,DistMoE在公共和私有专家之间执行模块化路由,实现无需显式领域标签的令牌级领域组合。跨多种视觉-语言基准的实验表明,DistMoE支持灵活的专家重用、有效的领域适应和竞争性能,同时保持对客户端特定知识的模块化控制。代码可在https://github.com/mainaksingha01/DistMoE获取。