跳转至

arXiv 2026-07-09

标题 作者 发布日期 PDF链接 摘要
通过深度原生结构推理实现准确、跨学科且透明的结构-性能理解 Chen Tang 2026-07-08 PDF 结构-性质关系是生物学、化学和材料科学的基础,功能、反应性和物理响应源于空间、化学和周期性的组织。从机制上解释这些关系需要运用科学原理和物理约束(从立体化学和键合到对称性、能量学和周期有序性)来解读结构证据。然而,将人工智能应用于这一过程面临着表征与推理的双重挑战:模型必须保留领域原生的结构信息,同时展示特定证据如何在这些约束下支持预测。在此,我们提出SciReasoner,这是一个跨蛋白质、小分子和无机晶体的多模态科学基础模型,专用于原生结构推理。SciReasoner将坐标、拓扑结构和周期性连接离散化为统一的结构感知词汇表,在推理过程中将结构标记视为可寻址的证据单元。在同源性控制的基因本体预测中,SciReasoner改进了低同源性和孤儿样蛋白质的细胞组分注释,将$F_{\max}$从0.42提升至0.55。在化学领域,它将单步逆合成准确率从0.63提升至0.72,同时生成片段级断键和前体验证轨迹。在材料科学中,其表征能够区分元素相和化合物相,并分辨高带隙与低带隙区域。在86个基准测试中,SciReasoner在67项任务上达到了最先进性能。双盲专家评估显示,其推理轨迹在98%的案例中优于或至少与前沿大语言模型相当。通过将结构作为科学约束下可检验的推理基底,SciReasoner将准确预测与可解释的科学推断联系起来。
Co-LMLM:连续查询有限记忆语言模型 Yair Feldman 2026-07-08 PDF 有限记忆语言模型(LMLMs)在预训练阶段将事实性知识外化到知识库(KB)中,而非将其记忆在模型权重内。生成过程中,模型按需从知识库获取知识。这一新近提出的范式具有多重优势,包括传统大语言模型(LLMs)无法实现的知识控制能力。我们提出连续查询LMLM(CO-LMLM),其知识库将连续键与文本知识值配对,这显著区别于以往依赖关系型知识库和查询的方法。CO-LMLM以极低成本生成灵活向量查询,同时仍能将人类可读且可归因的检索知识整合到生成过程中。我们为该设计配套开发了标注流水线,可对任意文本中的自由形式事实片段进行标注,突破了先前工作仅限维基百科的限制。在维基百科和FineWeb-Edu上的预训练实验及多模型规模测试中,CO-LMLM在困惑度和事实精确度上均优于先前的LMLMs和标准LLMs。在360M参数规模下,其困惑度甚至低于使用40倍数据预训练的模型,且SimpleQA验证性能与gpt-4o-mini相当,高于Claude Sonnet 4.5。
实现线性化的关键:分析驱动的Transformer线性化 Anna Kuzina 2026-07-08 PDF 因果自注意力的二次复杂度严重制约了长上下文Transformer的推理效率。尽管存在多种事后线性化方案,但难以判断哪些组件能保持模型质量。本研究在严格冻结骨干网络的框架下,分离了状态更新设计的影响。我们证明softmax依赖于键相关的秩一正交投影,揭示了为何delta式网络优于纯门控累积机制。我们识别了近似误差的潜在来源,并引入结构性干预措施——具体包括汇合令牌、短卷积和固定预算缓存路由——有效缩小了剩余差距。我们将该线性化方法扩展到LLaMA和Qwen系列中参数规模达320亿的模型,在MMLU基准上超越此前所有事后基线方法,并在长上下文检索任务中达到与复杂自适应缓存框架相当的水平。
从噪声轨迹到根本原因:面向智能体优化的结构轨迹分析与因果提取 Ying Chang 2026-07-08 PDF 长周期智能体的优化越来越依赖于基于反思的机制,即利用大型语言模型作为优化器来诊断智能体故障并改进智能体策略。然而,真实的执行轨迹难以直接用于优化:大量轨迹集合往往冗余且异构,导致优化效率低下且容易过拟合于低价值故障;同时,每条单独轨迹也包含许多无关步骤,而简单的上下文缩减方法(如截断或滑动窗口)可能丢弃因果关键证据,产生误导性优化信号。为解决这一困境,我们提出STRACE(结构轨迹分析与因果提取)框架,该框架构建高信噪比的优化上下文,以实现更精准有效的优化。在批次层面,STRACE挖掘故障模式以过滤冗余轨迹并保留代表性故障;在每条选定轨迹内,它通过文本依赖图进行因果定位,移除非因果步骤并识别出需要优化的真正根因模块。实验结果表明,STRACE显著优于标准上下文过滤基线。值得注意的是,在具有挑战性的形式化验证任务(VeruSAGE-Bench)上,它成功优化了人类专家设计的智能体,将成功率从42.5%提升至58.5%(提升1.4倍)。代码已开源:https://github.com/moomight/STRACE。
打破数据库锁定:面向数据库绕行的高性能存储读取器的智能再生 Victor Giannakouris 2026-07-08 PDF 在外部数据库系统中运行的分析型工作负载面临一个根本瓶颈:数据访问完全受限于数据库驱动程序(如JDBC或ODBC),所有读取操作都必须通过查询执行及其他驱动层,而这些层并非为批量列式分析而设计。我们提出Jailbreak方法,通过直接读取存储文件并物化为内存列式缓冲区,完全绕过数据库引擎。Jailbreak的核心洞察在于:数据库文件格式虽然复杂,但其源代码和文档已完整定义了规范,大型语言模型(LLM)可吸收这些人工制品,无需人工解析逻辑即可重新生成特定于操作符的表读取组件。Jailbreak利用LLM辅助的代码合成进行数据库存储解码,将传统上不透明的格式转化为可直接查询的制品。我们在PostgreSQL和MySQL存储文件上评估Jailbreak,针对只读副本和离线处理管道中常见的分析快照场景。生成的读取器可直接产生Apache Arrow缓冲区,被大多数广泛使用的查询引擎(包括DuckDB、Apache Spark以及GPU加速框架如cuDF和Spark RAPIDS)消费。我们使用TPC-H基准测试,在所有查询结果上验证了与基于JDBC/ODBC基线的正确性,并展示了端到端分析吞吐量的显著性能提升,最高实现27倍加速。结果表明,LLM辅助的存储读取器合成是一种可行且可泛化的方法论,可打破跨数据库系统的数据锁定,其应用范围超越PostgreSQL和MySQL,适用于任何文件格式可通过文档或源代码提供给LLM的系统。
机构红队测试:部署规则而非仅模型本身,因果性地塑造多智能体AI安全。 Yujiao Chen 2026-07-08 PDF 我们提出机构红队测试,一种用于测试多智能体AI中部署规则的评价方法论:固定智能体、目标和任务状态,仅改变一条规则,并将由此产生的集体行为变化归因于该规则。我们将该方法论实例化为IABench-CA,一个涵盖228个情境、五条经典规则和七个模型群体(33,924场博弈)的后果分配基准,并配有规范性合作参考和自动标注的推理轨迹。三项发现浮现:(1)部署规则因果性地改变集体安全:仅改变后果规则,每个群体内的平均致死率变动22至58个百分点。(2)不存在安全默认设置,但针对危害具有普遍性:最安全规则、最不安全规则甚至发病率效应的方向在不同群体间各异,然而回归性身份针对在任何情境下对任何群体都从未成为决定性最安全选项,在30-87%的博弈中消除资源最少的智能体,且对所有七个群体而言,相对于合作参考在选择性上不安全。(3)身份显著性为机制:对最易受剥削群体(gpt-5.1)进行的一次性匿名化消融实验表明,仅在规则文本中命名损失承担者,就在相同收益下将针对性消除率从22%提升至81%;在重复博弈下,匿名化仅延迟针对行为,因为智能体从观察到的消除中重新推断隐藏规则。我们将该方法论打包为安全案例工作流,为每个部署情境和群体认证一个临时规则区域Φ(c,P),并附带明确的残余风险和监控义务。
选择性时间步加权与基于优势的回放在样本高效扩散RLHF中的应用 Eric Zhu 2026-07-08 PDF 基于人类反馈的强化学习已成为将生成模型与人类偏好对齐的强大范式。然而,将RLHF应用于扩散模型仍存在严重的反馈效率问题,现有方法通常需要大量人类或奖励模型评估。这一局限性降低了扩散RLHF在反馈成为主要瓶颈的真实场景中的实用性。本文提出两种互补策略,在保持对未见提示泛化能力的同时,显著提升扩散RLHF的反馈效率。我们的关键发现是扩散轨迹中的奖励信息分布不均:并非所有去噪时间步或轨迹对从奖励信号中学习的贡献相同。通过在优化过程中强调信息量大的时间步和轨迹,我们获得了更有效的梯度更新。首先,我们引入逐时间步加权方案,在策略优化期间重新加权去噪步骤。我们从理论上将该加权与近端策略优化的最优收敛特性相关联,并通过实验近似所得加权趋势。其次,我们引入优先处理信息量丰富轨迹的回放机制,使模型能够复用过往样本而无需重复查询新奖励。这些策略共同显著提升了扩散RLHF的反馈效率。在相同超参数设置下,与广泛使用的扩散RLHF基线相比,我们的方法实现了高达6倍的样本效率提升。
Agon:基于隐式对手推理评级的竞争性跨模型强化学习 Vladislav Beliaev 2026-07-08 PDF 基于可验证奖励的强化学习(如GRPO)是当今推理模型的引擎,但它仅对最终答案进行评分。在困难问题上,这训练模型写更多内容而非更好思考,因为推理过程本身从未被评分,且不存在良好思考的标签。我们提出Agon,让两个竞争模型互为评分者。两者尝试同一问题;在交替角色中,一个起草解决方案,另一个在解题时阅读该方案,每个模型因比对方解题更优而获得奖励。为了获胜,模型必须比看到其工作的对手推理更出色,因此在训练过程中隐式地评判推理,无需过程标签和奖励模型。由于两个模型都被优化,每个模型面对逐渐增强的对手,这是单模型强化学习无法提供的。两者只需实力相当且行为不同。推理时,模型按训练方式部署,即两阶段级联:一个模型起草,另一个在阅读草稿后作答。在DeepMath的困难子集上结合Qwen3,该方法使GRPO的pass@1翻倍,大约是未经训练的混合专家模型在相同基线上增益的八倍。该结果在竞赛编程代码和不同模型家族(Qwen3.5、Gemma 4)中均得到复现。目前模型以文本交流;下一步是让它们在潜在空间中共同推理。
代理交付工程预测可靠性框架 Dexing Liu 2026-07-08 PDF 长周期大语言模型多智能体系统面临基础设施监控无法察觉的可靠性风险。我们提出ADE预测性可靠性框架(ADE-PRF),实现从被动退化检测到主动健康轨迹预测。ADE-PRF将跨五层的20个异构信号聚合为信任裕度指标(TM,动态范围39.2点)。三重并行预测方法支持8小时预测:指数方法达到MAE=1.228,方向准确率76.8%,99.65%的预测落在±10点容差内。生产验证涵盖15个连续天内六种智能体配置的380,227次预测与280,579次验证,以及七项沙盒控制实验。关键发现包括检测到"虚假繁荣"——正常表面指标掩盖的退化——以及ADE插件集成后TM与真实状态的即时耦合,其中16/20个因子依赖ADE采集数据。指数方法持续优于卡尔曼方法。ADE-PRF为生产环境LLM智能体提供了最早期的可靠性量化与前瞻性预警之一。
使用MPI和改进的几何多重网格求解器扩展WaterLily.jl Bernat Font 2026-07-08 PDF 我们介绍了WaterLily.jl近期面向性能的进展,这是一个用纯Julia编写的可解析尺度的不可压缩流求解器,能在任意厂商的CPU和GPU上无缝运行。在新加入的基于MPI并行机制支持下,强可扩展性测试呈现出接近理想的线性趋势,弱可扩展效率在节点内存并发竞争主导并行性能前保持在85%以上。当网格规模达到10亿单元时,节点间弱可扩展性仍维持在96%以上。我们还进一步评估了通过自适应欠松弛红黑高斯-赛德尔平滑器结合各向异性粗化算子实现的几何多重网格泊松求解器的改进效果。