| UrbanGround:从局部感知到真实尺度城市中的空间能动性 |
Tianjie Ju |
2026-08-27 |
PDF |
多模态大语言模型(MLLMs)能够解读街景,但城市行动能力取决于这些局部证据在智能体开始移动后是否仍然有用。本文探讨了当前MLLM智能体在复杂真实规模城市中,能将局部城市感知转化为可靠行动的程度。我们提出了UrbanGround,这是首个沙盒环境,使得这一问题能在基于全港三维地理空间数据构建的物理约束香港复制品中得以测试。UrbanGround支持第一人称视角的闭环交互,并提供交互式地图用于导航。智能体可直接进入三维城市,从第一人称视角探索。我们的分析通过三个研究问题追踪空间问题的增长。首先,我们测试智能体在主动观察后,是否能充分理解局部场景以回答空间问题。然后,我们考察当目的地变得更远且更不明确时,这种理解是否支持导航。最后,我们检验所得行为在路线可用性和行人运动变化下是否依然有效。当前MLLM智能体通常在视觉识别和短距离空间推理方面表现出有用的原子能力,而方向感和行人感知移动仍不可靠。其核心失败出现在扩展探索中,局部能力无法组合成持续的目标导向行为,且错误累积而无有效纠正。我们希望UrbanGround能支持更广泛的研究,探讨当前MLLM智能体在复杂、开放城市环境中可靠探索的极限。 |
| CritICL:从小型语言模型失败模式中实现推理时的弱到强泛化 |
Yufan Wu |
2026-08-27 |
PDF |
推理时扩展(inference-time scaling)的最新进展显著提升了大语言模型(LLMs)的推理性能。然而,这些方法通常依赖于重复生成或外部验证。为解决这一局限,我们引入了CritICL,一种新颖的推理时框架,它在保持高效率的同时提升推理能力。我们的关键洞察在于,同一模型家族内,LLM的失败模式在不同模型规模间表现出结构化规律。我们并未将失败视为不理想的输出,而是利用它们作为指导来源。具体而言,我们利用从较弱模型中得出的失败模式,并通过基于批判的上下文示例将其融入推理过程。我们提出了两种变体:CritICL-dynamic,它自适应地预测特定于输入的失败模式并检索批判;以及CritICL-static,它利用全局失败模式概况提供稳定指导。实验结果表明,CritICL在标准上下文学习上持续表现更优,并且在与测试时扩展方法相比时,性能具有竞争力或更优,同时所需生成次数和令牌成本显著降低。代码可在 https://github.com/umwyf/CRITICL 获取。 |
| WikiSkill:将智能体经验编译为持久知识以促进技能进化 |
Liyan Tang |
2026-08-27 |
PDF |
Agent技能包将专业知识和流程整合为可复用资源,以扩展AI代理能力。近期研究从代理经验中自动发现此类技能,使代理能够通过交互逐步适应。然而,指导技能发展的洞察通常分散在优化历史中,限制了其在迭代中的系统性复用。我们引入WikiSkill框架,该框架将代理技能与持久知识库(wiki)共同演化。在高层次上,WikiSkill分离原始执行经验、积累的知识和可执行技能,同时持续将经验整合到wiki中,后续技能更新可在此基础上构建。在多种基准和模型中,WikiSkill始终优于最先进的技能演化方法,并在大多数模型-基准设置中优于无技能基线。我们发现技能演化与模型扩展互补:较大模型通常从演化技能中获益更多,而带技能的较小模型可超越不带技能的显著更大模型。我们还发现演化技能在模型和模型家族间有效转移,且由其他模型演化的技能可优于自我演化技能。最后,我们的消融研究确认,wiki中的持久知识积累对有效技能演化至关重要。这些结果证明了系统性积累和精炼代理经验对开发可复用和可转移技能的优势。 |
| SWE-Prime:更少的轨迹,更优的性能 |
Dewu Zheng |
2026-08-27 |
PDF |
为提升大型语言模型解决真实世界软件问题的能力,先前研究主要聚焦于构建大规模智能体轨迹数据集,并对成功轨迹进行监督微调(SFT)。然而,任务成功并不保证监督质量高:成功轨迹可能仍包含无效、冗余或风险步骤。直接使用此类轨迹进行SFT会引入噪声监督,并促使模型模仿不良的问题解决行为。因此,我们提出SWE-Prime,一种多粒度、两阶段的SFT数据选择方法,逐步在轨迹和片段层面过滤训练数据。具体而言,第一阶段基于过程质量、结果质量和数据代表性进行轨迹级筛选,选择高质量且具代表性的成功轨迹子集。第二阶段通过将连续步骤分组为语义片段,并根据每个片段对最终解决方案的贡献、可学习性和潜在风险进行评估,进行片段级选择。在SFT过程中,所有片段保留在序列中以维持上下文,而仅选中的片段参与损失计算。在SWE-Bench Pro和SWE-Bench Verified上的实验表明,使用SWE-Prime选择的10%轨迹子集进行训练,优于在完整已解决数据集上的训练,分别带来高达12.2%和24.2%的相对性能提升。 |
| TTPO:测试时策略优化 |
Aozhe Wang |
2026-08-27 |
PDF |
近期一些突出的后训练方法,如强化学习(RL)和同策略自蒸馏(OPSD),推动了大型语言模型在数学推理方面的快速进展,但它们对真实标签的依赖阻碍了测试时训练(TTT)。用多数投票伪标签替代真实标签是一种自然的替代方案,但这种方法较为脆弱:一个错误的投票会污染教师模型,并误导每一个令牌。我们观察到这种失败模式是不对称的:与伪标签不一致的展开结果,无论投票本身是否正确,通常都是错误的。基于这一观察,我们提出了测试时策略优化(TTPO),这是一种不对称目标,通过OPSD蒸馏一致的展开结果,并通过分组RL惩罚不一致的展开结果。令牌级选择进一步优化了这两个分支:蒸馏降低已收敛位置的权重,而RL仅惩罚高置信度的错误。即使在频繁出现伪标签错误的情况下,这两种更新仍能保持良好基础,并且随着模型改进,多数投票路由能提供更紧密的自我监督。在无任何标签的情况下,TTPO在五个竞赛级基准上匹配了标签监督的OPSD,将Qwen3-1.7B在TTT中的性能从38.0%提升至45.2%,在无思考模式下实现了+25.2%至+36.4%的提升,并展现出强大的跨任务泛化能力。 |
| 从静态到动态:使用MCR-Bench对真实世界代码审查进行基准测试 |
Dewu Zheng |
2026-08-27 |
PDF |
在真实世界的软件开发中,代码审查通常涉及开发者和审查者之间的迭代交互以提升软件质量,这使得该过程成本高昂且耗时。尽管近期研究探索了利用大型语言模型(LLMs)进行自动化代码审查,但大多数方法将代码审查过度简化为单轮、静态的决策任务,未能捕捉真实审查场景中固有的多轮交互性质及复杂问题解决过程。为弥补这一差距,我们引入了MCR-Bench,这是首个面向真实多轮代码审查的缺陷状态感知基准。MCR-Bench涵盖五种常用编程语言,包含2,269个真实世界多轮代码审查任务,每个任务均标注了细粒度的缺陷信息和跨轮状态标签。MCR-Bench中的每个任务配备有细粒度缺陷元数据(如描述、类型、严重程度)以及动态状态注释,捕捉缺陷在多轮过程中的完整演化轨迹。通过在MCR-Bench上对主流LLMs进行广泛实验,我们获得了若干发现。(1)整体能力有限:实验表明,主流LLMs在缺陷检测和缺陷生命周期状态跟踪方面的整体性能有限,且随着交互轮数增加,性能显著下降;(2)缺陷敏感性能:LLMs的性能在不同缺陷类型和严重程度间差异显著,语义复杂或低显著性缺陷更易被遗漏;(3)潜在失败机制:我们的深入错误分析剖析了误报和漏报的不同驱动因素,揭示了跨轮时间错位和长程记忆不足等关键弱点。 |
| RedEvoAgent:具备经验驱动技能演进的自动红队智能体 |
Junjie Zhang |
2026-08-27 |
PDF |
基于LLM的智能体越来越多地部署在产品级执行框架中,在此类环境下,越狱可能触发有害的工具使用和持久状态变更,从而比单纯生成不安全文本带来更大风险。现有的自动红队方法往往依赖固定攻击,而近期的智能体攻击者协调多种越狱工具,并通过基于轨迹的检索展现出更强潜力。然而,此类检索可能因检索偏差和工具归因不清而重用误导性经验,且完整轨迹会增加上下文开销并降低可解释性。我们提出RedEvoAgent,一种黑盒红队智能体,将跨案例攻击轨迹提炼为简洁、可读的攻击技能。该攻击技能通过工具效能分析和决策工具归因进行技能更新的自适应演化,并采用验证棘轮机制,仅保留能提升验证性能的更新。在多个基准、目标模型和目标执行框架上的实验表明,RedEvoAgent优于固定和智能体基线,提升工具效率,并在攻击者模型和目标执行框架间具有迁移性。 |
| 基于图结构电子占据的离散流匹配实现机理反应预测 |
Nguyen Xuan-Vu |
2026-08-27 |
PDF |
化学反应本质上是电子空间中的变换,然而大多数机器学习方法要么通过从头生成产物分子,要么通过直接作用于分子拓扑的启发式图编辑来建模反应。我们提出MAELLE(基于电子重排的机理编辑流匹配),该方法将反应建模为电子占据向量上的离散流匹配。具体而言,我们将反应物到产物的映射形式化为一个连续时间马尔可夫链(CTMC),该链定义在所有成键、非键和氢位点上的图结构整数电子占据空间上。为构建中间编辑轨迹,我们利用最优传输将离散流匹配混合路径推广到离散电子重排,从而生成一系列机理上可解释的编辑步骤,无需基元步骤标注。MAELLE在USPTO-480K基准上取得了与领先反应预测模型相当的性能。除分布内准确性外,我们还在两种分布外设置(结构复杂性和反应类型)下评估了鲁棒性,发现MAELLE在现有方法性能下降的情况下仍保持强劲表现。最后,由于学习到的流作用于完整的电子再分布,MAELLE自然恢复出与已知化学一致的机理轨迹,并能预测反应的副产物。 |
| 转导语言模型的随机估计 |
Vésteinn Snæbjarnarson |
2026-08-27 |
PDF |
转导语言模型(TLMs)将一个预训练的源语言模型与一个功能性有限状态转换器组合,以在目标字符串上诱导出一个语言模型。在TLM下计算目标前缀的概率,相当于对所有源字符串的源模型概率求和,这些源字符串被转换器映射到以该前缀开头的目标字符串。这个集合可能是指数级大或无限的。先前的工作使用基于源前缀概率的计算捷径,然后通过阈值剪枝的束求和来近似所得总和。这产生了一个误差未知的下界。相反,我们无放回地重新采样源前缀,并根据每个被选前缀的包含概率的倒数重新加权。我们展示了递归应用此校正可得到目标前缀概率的无偏估计器,并使我们能够估计由阈值剪枝丢失的质量。我们的束求和算法扩展了保留的源前缀,并采样要保留的前缀,随着更多概率质量被添加到运行估计中,减少了它们的数量。这可以节省计算,并保证运行以概率一停止。我们在百科全书文本和DNA上,与有放回重采样的顺序蒙特卡洛基线进行了评估。它在文本上实现了更好的计算-方差权衡,在DNA上以相同的最大粒子数实现了更低的误差。在DNA到氨基酸的转导中,相对于阈值剪枝的束求和,它将运行时间减少了几个数量级,并使长目标字符串的前缀概率估计变得可行。在已发表的阅读时间分析中,用无偏采样替换阈值剪枝,显著降低了估计的语料库惊异度,但发表的结论保持不变。 |
| Persona-执行分离:一种在执行审计下演化LLM智能体的架构模式 |
Yisen Xi |
2026-08-27 |
PDF |
大型语言模型(LLM)代理在受治理组织中必须让人格(指令、语气、自我呈现)自由演化,同时保持执行(有状态、经审计的工作)可追溯。单一信任域无法廉价地同时满足这两点。我们提出人格-执行分离(PES):人格和执行位于不同信任域,通过受治理的契约桥连接。人格是单宿主的,可以漂移;执行是无面孔的,且经审计。状态摘要可返回;数据主体保留在限制域内,除分级数据丢失防护(DLP)例外;身份保持连续。审批矩阵、DLP和审计强制执行跨越。PES源于三个目标——自由漂移、执行可追溯性和解耦。在LLM表征不可区分性下,任何满足所有三点的单域机制必须重新引入类型化变更对象、外部门和稳定审计锚点:即PES以更高耦合成本重建。一个受监管数字员工平台中的开发/试点案例记录了一个月内的五个决策,每个都有被拒绝的替代方案。对已部署实现的机制检查发现,在人格扰动(五种模型配置)下没有执行侧重新验证,硬断言字段上没有人格指纹。对恢复的预分离构建的探测发现,受治理执行路径通过遗漏而非构造与人格解耦;后续接线更改可能逆转该隔离,而PES将其变为经审计的架构规则。该模式适用于多用户部署、执行审计和预期人格变动同时成立的情况。 |