跳转至

arXiv 2026-08-25

标题 作者 发布日期 PDF链接 摘要
如何稳定且高效地训练评论家 Penghui Qi 2026-08-24 PDF 基于组的方法(如GRPO)通过为每个提示采样多个响应来避免训练评论家,从而用于大型语言模型。可靠的评论家可以从单个响应中估计令牌级优势,但标准的基于评论家的训练配方往往不稳定。我们研究了这种不稳定性,并开发了最佳实践评论家优化(BPCO),该配方结合了DPPO、限制在奖励范围内的价值预测、蒙特卡洛价值目标、未归一化的策略优势以及长度自适应广义优势估计。由于评论家仅在训练期间使用,BPCO还可以将其条件化于奖励定义信息(如参考答案或评分标准),这些信息对策略隐藏。受控实验隔离了每个设计选择的效果。在从1.5B参数到30B-A3B混合专家的数学推理任务中,BPCO一致地改进了强评论家基线,并在每个提示采样一个响应的情况下匹配或超过了基于组的基线。同一配方也改善了基于评分标准的奖励学习。这些结果表明,精心设计的评论家为组相对优势估计提供了可靠的替代方案。代码可在https://github.com/QPHutu/golden_critic获取。
ReWorld:一种具有长时记忆的交互式世界模型 Zhifei Chen 2026-08-24 PDF 交互式世界模型必须跟随用户的操作,记住其展示过的场景,并实时流式生成。这种张力是结构性的:控制需要短视界,记忆则需要无界视界。ReWorld在训练时将两者分离,并在推理时加以约束。混合逐头注意力窗口将大多数注意力头限制在近期,而一小部分全局头则关注整个历史,随机头路由确保任一能力不绑定到特定头;随机块丢弃使稀疏历史处于分布内。推理时,整个过去在固定预算下运行:一个受边界约束的KV缓存,由姿态索引的地标库支撑,模型从中检索最接近当前姿态的地标。一个度量尺度对齐的数据引擎将八个来源——虚幻引擎渲染的飞越、游戏漫游和真实世界视频——置于同一物理动作尺度上,因此每次按键在所有来源中移动相机的距离相同,回文轨迹为记忆训练提供所需的回访证据。限于LoRA适配器的分布匹配蒸馏将采样压缩至四步:一个骨干网络同时支持高保真多步模式和实时交互模式,以704x1280视频流式生成,覆盖逼真、游戏风格和风格化世界。在涵盖动作跟随、长视界回忆和视频质量的三轴协议下,与六个近期交互式世界模型相比,它实现了最佳控制保真度(旋转误差$11.95^\circ$和最佳相机运动一致性)以及最佳生成质量;在长达一分钟的往返展开($64$秒,$384$个潜在变量)中,其固定的12块缓存仍能重新生成起始视图——而在滑动窗口早已清除证据、全KV注意力内存耗尽的展开长度下。
SWE重构基准:编码智能体能否完成长周期、全仓库的堆栈迁移? Deyao Hong 2026-08-24 PDF 现代软件系统在数十年的开发过程中积累了技术债务,这使得迁移成本高昂且在很大程度上依赖人工。随着编码代理在修复错误方面变得越来越有能力,它们能否自主执行此类迁移?现有基准无法回答这个问题,因为它们仅评估行为正确性,而不评估迁移是否实际发生。这导致了一个简单的漏洞:代理复制原始实现以使测试通过。我们称之为“盲区”。为解决此问题,我们引入了SWE Refactor Bench,一个包含20个全仓库迁移的基准,覆盖4种技术债务。一个三阶段评估协议同时衡量迁移完整性和行为正确性。(1)迁移审计验证迁移是否发生。(2)行为测试使用固定测试套件衡量正确性。(3)代理验证使用6个独立编码代理生成针对隐藏行为差异的定向测试。在来自8个前沿模型和26个模型努力配置的520次运行中,仅28次运行(5.4%)通过所有三个阶段,20个任务中有13个未获得接受方案,最佳模型(claude-opus-5)得分为47.0/100。迁移完整性和行为正确性是不同能力:少数运行通过跳过迁移保持行为,并在迁移审计阶段被阻止;大多数尝试迁移但破坏行为,并在行为测试阶段被阻止。代理无法实现完美迁移:在通过迁移审计的340次运行中,58%达到固定检查的99%,但仅26%达到100%。代理能力在不同迁移类别间存在差异:在构建工具链重写上得分为31.4,但在语言重写上仅为5.6。综合这些发现,SWE Refactor Bench定位为开发可靠全仓库迁移编码代理的严格测试平台。
EG-ARSA:面向低资源环境下视觉道路安全审计的专家驱动开放模型 Md Thamed Bin Zaman Chowdhury 2026-08-24 PDF 道路交通伤害在中低收入国家仍然是一项重大挑战,在这些国家,主动式道路安全审计受到不完整的事故记录、合格审计人员短缺以及大规模实地检查成本高昂的限制。为解决这一问题,我们提出了专家接地蒸馏(EGD),这是一种新颖的人工智能框架,将机构道路安全专业知识迁移到紧凑的视觉-语言模型中,用于可扩展的视觉道路安全审计。关键创新在于一个量化的专家接地阶段,在此阶段,教师视觉-语言模型根据权威实地审计进行校准。只有在教师与专家风险评估达到实质性一致(Cohen's kappa = 0.74)后,才允许进行大规模标注。校准后的教师随后生成结构化监督,通过低秩适应和单一无泄漏提示蒸馏到80亿参数的视觉-语言学生模型中。我们还引入了孟加拉国道路安全审计数据集(BD-ARSA),这是首个开放的、专家接地的孟加拉国视觉道路安全审计数据集,包含21,947条图像-审计记录,覆盖近乎全国范围,以及专家接地道路安全审计器(EG-ARSA),这是首个专门为此任务开发的视觉-语言模型。实验结果表明,接地微调显著改善了相对于零样本基线的序数风险评估,而盲法专家评估显示,紧凑的学生模型优于其310亿参数的教师模型和Gemini-2.5-Flash。这些发现表明,EGD为资源受限环境中的主动式道路安全审计提供了一种有效且可扩展的工程解决方案。
基于物理约束的深度学习模型用于三轴体震信号无接触血压监测 Yuanyuan Zhang 2026-08-24 PDF 心冲击图(BCG)在实验室环境中用于无创长期血压(BP)监测具有前景,但传统BCG信号易受身体与床交互变化的影响,导致时间或幅度轴上的特征点偏移,且血压随个体血流动力学变化而变化,造成表征不对齐,影响模型的泛化性和鲁棒性。在本工作中,我们提出了一种基于三轴体震图(BSG)作为BCG扩展的无创血压估计框架Phy-BP。首先,设计了一种自适应质量控制算法,通过联合考虑相邻心跳模式和通用心源性模板,选择富含心源性成分的BSG片段。其次,建立了一个物理模型来描述身体-床系统中的三维波传播,并将其嵌入深度学习模型中,以表征由单一心源性激励驱动的三轴BSG信号间的内在耦合。因此,在模型训练过程中多轴特征得以对齐,提高了对真实场景中失真的鲁棒性。在21名受试者收集的162小时医院数据集上的实验表明,所提出的Phy-BP能够动态过滤低质量测量,且深度学习模型训练受不同轴间物理一致性的约束,以提供可靠的血压监测,尤其是在训练样本有限时。
可证明自适应的均匀与重掩码离散扩散模型采样 Daniil Dmitriev 2026-08-24 PDF 离散扩散模型通过支持并行更新,为自回归生成提供了一种有前景的替代方案,但其采样效率在很大程度上取决于前向过程和采样器的选择。对于均匀前向过程,现有标准τ跳跃采样器的下界随环境维度d线性增长,这引发了一个问题:这种依赖性是否前向过程所固有的。我们对此问题给出了否定回答。我们考虑一种基于留一法去噪器的均匀和重掩蔽过程的一阶采样器,其坐标更新可并行执行。在两种情况下,采样器都能在采样过程中纠正去噪错误,这在许多坐标同时更新时变得必要。我们的主要结果建立了一个自适应采样保证:在对数因子范围内,$N = O(\mathrm{DTC}(X_0) / \varepsilon)$ 步离散化足以实现采样误差 $O(\varepsilon_{\mathrm{score}}+\varepsilon)$,其中 $\varepsilon_{\mathrm{score}}$ 是分数估计误差。因此,采样复杂度由目标分布的内在依赖结构决定,通过其双重总相关 $\mathrm{DTC}(X_0)$ 来衡量,而非直接由环境维度d决定。我们的分析通过一个贝叶斯最优辅助采样器进行,该采样器将离散化误差与分数估计误差分离。我们还推导了离散化误差的精确信息论表示,该表示以不同时间前向过程不同坐标之间的互信息形式给出。这一表示适用于一般前向过程,并且在均匀和重掩蔽情况下,可由 $\mathrm{DTC}(X_0)$ 控制。在结构化合成分布上的数值实验展示了预测的维度自适应行为。
Prime Agent:一种自我改进的RLM工具框架 Seth Karten 2026-08-24 PDF 语言模型是顺序处理器,但长期目标导向的行为需要超越模型权重和活动上下文的外部信息与计算。Prime Agent 是一个用于长期评估和编码代理工作流的开源框架。一个持久的 IPython REPL 遵循递归语言模型抽象,用于程序化上下文处理与测试时计算,而持续框架则在轨迹间保留历史、记忆、技能、提示和子代理规范。递归子代理通过直接的代理间通信进行协调,代理视图允许人类检查和管理由守护进程支持的会话。Prime Agent 标准化了执行、恢复、验证和资源核算,同时将策略构建留给模型。这种低摩擦、表达力强的界面防止框架故障变成模型故障,并将测量推向模型真实的最大潜在能力。Prime Agent 将 ARC-AGI-3 RHAE Best@1 从 30% 提升至 95.5%,并在长上下文编码、GPU 内核生成、模拟器构建和自主 nanoGPT 速度竞赛中匹配或超越原生及流行框架。在 Factorio 中,我们发现细化允许持续技术进展,而专用子代理能实现并行工作。代码可在 https://github.com/PrimeIntellect-ai/prime-agent 获取。
ConvergeFlow:具有可证明收敛到Token嵌入的语言流 Na Li 2026-08-24 PDF 连续扩散和基于流的语言模型(LMs)的最新进展已实现了与离散LMs竞争的性能。然而,现有的连续框架仍依赖于通过交叉熵(CE)监督的解码器,因为流轨迹不能保证终止于有效的词元嵌入。受此限制的启发,我们引入了\textbf{ConvergeFlow},一种基于嵌入空间的流式语言模型,它将数据预测器约束在词元嵌入的凸包内,并仅使用流匹配引起的均方误差目标进行训练。在适当的正则性条件下,我们证明了尽管数据预测器存在误差,所得到的流仍能收敛到有效的词元嵌入,从而无需CE监督的解码器即可直接进行词元预测。我们进一步开发了三种采样机制,以控制生成困惑度与熵之间的权衡。在OpenWebText上的实验表明,ConvergeFlow实现了与现有连续和离散扩散LMs竞争的性能。这些发现展示了基于流的范式在语言建模中的潜力。我们的代码可在https://github.com/Na-Li66/ConvergeFlow获取。
当“不要”并非拒绝:CLAUDE.md中的安全规则与内置控制 Ting Yan 2026-08-24 PDF 在CLAUDE.md中,“do not”是模型解读的自然语言指令。Claude Code的deny是一种内置控制,能在代理采取行动前阻止该行为。两者都能表达相同的安全目标,但控制代理的方式不同。我们在481份公开的CLAUDE.md文件中衡量了这一差距。一个LLM将提取的候选规则与Claude Code文档化的控制进行匹配,两名安全从业者独立检查了样本,未查看模型的答案或彼此的标签。根据控制与书面规则的匹配紧密程度,仅约4-16%的检索到的安全规则有对应的内置控制。在最严格标准下,估计值为4.4%(95%置信区间:2.6-6.7%),两位标注者对哪些规则有匹配项的意见高度一致。对完整文件的人工审查发现,我们的提取方法捕获了66.3%符合条件的安全规则;因此,报告的比例适用于其捕获的规则。这是一个可用的安全问题:CLAUDE.md是一个只写通道。开发者编写安全规则,但得不到关于控制是否会执行该规则的反馈。同样的纯文本形式隐藏了两类规则:一类可由权限规则、模式或沙箱强制执行,另一类则留给模型自行解读。
FixAnything:基于视频生成先验的三维一致渲染细化 Khiem Vuong 2026-08-24 PDF 使用三维场景表示(如高斯泼溅(3DGS)、神经辐射场(NeRF)、网格甚至点云)进行视图渲染时,当输入视图稀疏或目标视图远离输入时,会产生伪影。近期工作利用基于扩散的生成先验来缓解这些伪影,但这种方法针对特定表示,需要定制架构或大量重新训练。我们提出FixAnything,一个用于修复多种渲染伪影的单一模型。它通过重新利用预训练的视频生成模型实现,仅需最小修改和轻量微调,即可利用其隐式多视图先验。我们的关键洞察是,即使噪声渲染序列也保留了相机运动和粗略场景结构,使得清理可被表述为视频到视频的转换。为控制应保留的场景结构,我们引入一个二进制掩码标记干净像素,使模型能将输出锚定到高质量输入(如训练视图),同时优化其余部分。为鼓励FixAnything产生支持下游重建的三维一致渲染,我们使用通过运动恢复结构获得的相机姿态精度作为直接偏好优化(DPO)的奖励信号。在四种不同的三维表示中,FixAnything通过轻量微调持续提升渲染质量,证明单一通用视频先验可替代多个专用细化流程。该框架的简洁性使其无需架构重新设计即可直接采用未来更强的视频模型。