跳转至

arXiv 2026-07-15

标题 作者 发布日期 PDF链接 摘要
AI代理能否判断任务是否简单?迈向复杂度感知的推理与执行 Junjie Yin 2026-07-14 PDF 大语言模型(LLM)智能体日益自动化地处理多步骤工程与信息学工作流,却鲜少评估任务实际所需的工作量。它们常采用"最大上下文优先"策略——重复读取已见过的文件和依赖项——将单行编辑演变为小型代码库审计。我们认为缺失的能力是任务感知型执行范围预估:在投入预算前判断任务难度、真正需要的信息以及最短可靠路径。我们形式化定义了最小充分执行与智能体认知冗余比(ACRR),并提出E3(预估、执行、扩展)框架:智能体先预估初始操作点,执行最小可行路径,仅在验证失败时扩展范围。在MSE-Bench(包含121次编辑的能力可控模拟器确定性基准)上,E3在保持最强基线100%成功率的同时,将成本降低85%、令牌减少91%、检查文件减少92%,并进一步超越强自适应检索基线16%;这些优势在保留的指令措辞和几乎所有成本权重下依然成立。配套的真实模型测试平台(LLM-Case)在实时gpt-4o智能体编辑真实开源库的场景中验证了该效果,每个候选补丁均通过运行项目真实pytest套件与测量标准进行评分:过度读取现象虽较温和但真实存在,而E3在任务成功率相当的情况下是最精简且最快的策略——其唯一短板是供应商速率限制,而非错误编辑。我们将此定位为执行冗余的可控探针,而非对任何部署智能体的测量,并将任务感知型执行定位为迈向工程导向型AI(EGAI)的一步——这类智能体的工作投入锚定于任务的工程现实。我们已发布该框架与基准。
视频扩散模型中的序列性差距 Jorge Diaz Chao 2026-07-14 PDF 当一个球撞击另一个球,进而再撞击下一个球时,视频模型应能预测每次碰撞的结果。在多球硬球动力学的受控实验中,我们发现标准双向视频扩散模型的性能会随因果链的延长而下降,即使增加去噪步数也无法改善。在长度匹配的单球对照组中(不存在球间相互作用),这种性能下降基本消失,从而将原因锁定为依赖事件结构而非视频长度。通过干预研究,增加有效串行计算的方法(包括自回归/分块生成和架构深度)能显著提升性能。我们将这一模式定义为"串行性差距":任务需要不断增长的串行计算,而视频扩散模型的去噪循环无法提供可扩展的串行计算能力。我们进一步证明,在确定性视频预测中,去噪步数不会在骨干网络之外增加串行计算量,这表明视频扩散模型在串行推理和模拟任务中存在结构性障碍。
TerraZero:面向零演示大规模自对弈的程序化驾驶仿真 Zhouchonghao Wu 2026-07-14 PDF 训练鲁棒的自动驾驶智能体需要模拟器具备三个特性:足够快的强化学习规模化训练速度、能基于真实地图结构约束行为的逼真度、以及覆盖日志数据中罕见安全关键长尾场景的多样性。我们提出TerraZero——程序化驾驶模拟器与自博弈训练栈。可配置的C引擎通过零拷贝路径在CPU上运行仿真、GPU上运行策略推理,单服务器级GPU即可维持每秒130万智能体步进,远超现有对象级模拟器速度,同时保持轻量级单智能体系统缺失的保真度:异构智能体、多动力学模型、完整交通规则执行。TerraZero仅将日志数据作为真实地图几何来源,通过随机化基于规则的交通参与者与信号控制器,以及每回合随机化智能体动力学、奖励和尺寸,使每张地图生成无限场景集。所有报告策略完全通过强化学习在跨GPU的高效自博弈方案上从零训练,无需人类示范,推理时无备用规划器。策略可零样本跨城市和数据集泛化,包括无显式监督下涌现的左舵驾驶行为。作为自车策略,TerraZero是首个登顶InterPlan长尾基准的全学习策略,超越更大规模学习型规划器;在常规驾驶val14上位列最佳方法之一且最安全,取得最优碰撞与碰撞时间指标。在Waymo开放模拟智能体真实性评估中,相同方案优于其他无示范方法,与最强参考锚定自博弈方法竞争。单一技术栈同时服务于两种角色:面向汽车与卡车不同动力学的驾驶策略,以及联合控制车辆、行人、骑行者等交通参与者的模拟智能体。
PalmClaw:一种面向手机的原生设备端智能体框架 Hongru Cai 2026-07-14 PDF 大型语言模型(LLM)智能体已从生成响应发展为通过调用工具、观察结果并迭代决定下一步行动来执行多步骤任务。大多数智能体系统运行在支持工具使用和任务自动化的桌面端或服务器上。移动设备同样是重要的智能体环境,因其广泛普及且包含用户数据、传感器及日常应用。现有移动智能体主要通过图形用户界面(GUI)操作(如点击、滑动和输入)控制智能手机,这些操作往往形成冗长且依赖界面的序列,无法直接访问设备功能,且执行边界难以界定。我们提出\textbf{PalmClaw}——一个原生运行于手机的开源智能体框架,直接在设备上管理会话、记忆、技能、工具及智能体循环。PalmClaw将设备能力暴露为具有显式参数、结构化结果和清晰执行边界的设备工具。该设计使智能体能够直接使用移动设备功能,同时保持每个操作的显式性和可控性。实验表明,与最强基线相比,任务成功率相对提升11.5%,完成时间减少94.9%,且设置负担更低,执行边界应用轨迹清晰可见。代码已开源:https://github.com/ModalityDance/PalmClaw
使用流匹配快速实现统计稳态湍流 Gianluca Galletti 2026-07-14 PDF 许多非线性物理系统在达到统计稳态之前会经历一个初始瞬态阶段,其中扰动增长直至非线性相互作用主导。尽管饱和状态是主要关注对象,但直接数值模拟必须解析整个瞬态动力学过程才能达到该状态,这会产生显著的计算成本。在计算流体力学中,大涡模拟等降阶方法通过对小尺度动力学进行建模来降低计算成本,从而实现对湍流的可处理近似。相比之下,对于回旋动力学等系统,目前尚无普遍适用的全动力学闭合模型,因此仍需高保真模拟。现有针对这些系统的代理建模方法采用自回归方式,因而存在误差累积问题。我们提出通过遍历性假设直接建模饱和状态的分布,即样本的系综平均等价于单次长时模拟的时间平均,从而绕过显式时间演化。我们引入GyroFlow,这是一种潜在生成模型,可直接估计五维相空间中回旋湍流的稳态统计量,无需解析瞬态阶段。GyroFlow能从噪声中生成饱和快照,并以无量纲运行参数为条件,其性能优于自回归方法、降阶方法及其他生成方法,同时实现显著加速。为评估生成质量,我们提出FGyD指标——该分布度量在预训练回旋动力学模型的潜在空间中计算,并证明其与下游通量精度及求解器收敛性相关。最后,GyroFlow可用于热启动生成数据所用的数值代码。
软件供应链已死:面向用例的重生 Tanmay Singla 2026-07-14 PDF 现代软件开发正建立在一个日益可疑的前提上:采用外部依赖所节省的前期实现成本,是否足以抵消其维护成本。两个变化正在重塑"自建vs.复用"的权衡:软件供应链攻击提高了外部依赖的成本,而生成式AI降低了本地实现的成本。我们提出"面向用例的再生"作为新的软件获取范式,将供应链从外部信任转向本地验证。我们评估了一种智能体工作流,该工作流仅合成代码仓库实际使用的依赖功能切片。对180个仓库-依赖对的测量表明,该方法可行:替换后的代码在基线验证检查中保留了仓库观测行为的99.8%,并将导出的API接口减少了93%。软件获取可能向可验证的仓库特定代码合成演进,尤其在所需功能范围狭窄、稳定且经过充分测试的场景下。
FlowWAM:光流作为世界动作模型的统一动作表示 Yixiang Chen 2026-07-14 PDF 世界动作模型(WAMs)能够利用预训练的视频生成器同时进行世界建模和动作预测。然而,直接利用此类视频生成器进行控制带来了新的挑战:如何以与预训练视频生成器兼容的形式表示动作,同时携带足够的运动线索以实现精确控制。现有的数值动作无法满足前者要求,而先前的视觉动作表示则忽略了帧间的时间运动结构。我们通过FlowWAM解决这一问题,这是一种双流扩散框架,采用光流作为统一的、视频原生的动作表示。光流视频与RGB视频格式相同,并编码了丰富的逐像素位移。通过在共享的预训练视频生成器中联合建模,FlowWAM能够自然实现WAM的两种模式。在策略模式下,FlowWAM生成光流用于动作预测;在世界模型模式下,它使用目标光流序列引导未来视频生成。此外,由于光流无需动作标签即可从原始视频中轻松提取,FlowWAM能够利用大规模无动作标签的视频数据集进行预训练。实验发现,基于光流的动作表示在两种模式下均能带来性能提升。在RoboTwin操作任务中,FlowWAM在Clean设置下将成功率提升至92.94%,在Random设置下达到92.14%,优于VLA和WAM基线。在WorldArena世界建模任务中,它取得了最佳整体EWMScore(63.71),轨迹准确率相对提升18.4%。更多结果可访问项目网站:https://flow-wam.github.io。
对稳定婚姻的隐私攻击 Stephan A. Fahrenkrog-Petersen 2026-07-14 PDF 稳定婚姻问题出现在许多隐私敏感领域,例如美国的全国住院医师匹配项目。在此类应用中,保护用户偏好列表的隐私对于防止策略性操纵、抑制虚假报告以及遵守数据保护法规至关重要。本研究探讨了针对稳定婚姻算法的隐私攻击。假设攻击者(如医院)能够反复与稳定婚姻算法交互,我们展示了此类交互如何泄露非恶意方(如住院医师)的私人偏好。研究表明,广泛应用的Gale-Shapley匹配算法(当提议方为恶意时)易受隐私攻击,所有诚实代理的偏好均可被揭露。我们进一步探究了诚实非恶意方的哪些偏好分布易受隐私攻击,并证明在非易感偏好分布中,由诚实方提议的Gale-Shapley匹配算法能够保护隐私。我们将研究结果扩展至去中心化场景,表明攻击方可以推断所有偏好排序。通过实验评估,我们在合成数据和真实世界数据上测试了隐私攻击,结果显示真实世界数据确实易受隐私攻击。本研究凸显了开发新型隐私保护稳定婚姻算法的必要性。
基于冻结离散扩散语言模型的音频原生语音识别 Harsha Vardhan Khurdula 2026-07-14 PDF 自动语音识别目前主要由自回归解码器主导,这类解码器每次只生成一个词元。我们探究是否可以用离散扩散语言模型替代传统方法,通过少量去噪步骤并行优化整段转录文本。我们为DiffusionGemma训练了原生音频接口——这是一个260亿参数的混合专家模型,其文本生成采用均匀随机词元离散扩散机制,而非近期扩散语言模型常见的吸收掩码方案。冻结的Whisper编码器提供声学特征,轻量级投影模块将其映射至模型嵌入空间,低秩适配器使冻结的主干网络能够关注新模态。仅需训练约4200万参数(占主干网络参数的0.16%)。研究发现,常规训练目标无法有效锚定音频信号,因为其梯度仅能通过已忽略音频信息的注意力机制到达投影模块。通过冻结输出头应用连接主义时序分类损失可打破这一僵局。最终模型在LibriSpeech测试集清洁数据上达到6.6%的词错误率,无论语句长度如何均可在约8个并行步骤内完成转录,且仅需使用在六种语言上训练的单一适配器(本文评估了英语、印地语和普通话)。
DermDepth:面向皮肤科的单目度量尺度三维重建模型 Héctor Carrión 2026-07-14 PDF 皮肤科临床实践中,常规需要测量和追踪病灶的尺寸、形态与质地,这是伤口或皮肤癌筛查、监测和诊断的关键环节。为实现这一目标,临床医生常使用市售的普通相机传感器对皮肤表面进行成像。这导致研究过度聚焦于二维方法,而此类目标本应从三维信息中获益。本文证明,对于皮肤镜和宏观病例,无需额外硬件或多角度拍摄,即可实现密集单目三维重建、公制尺度测量及丰富的表面法向纹理估计。我们提出DermDepth——首个面向皮肤科领域的单视角公制尺度三维模型,以及D-Synth——首个包含像素级完美三维信息的合成皮肤镜数据集。实验表明,在D-Synth上训练DermDepth可将真实皮肤镜数据的公制尺度误差从超过16倍修正至低于1.1倍,同时保持几何质量并提升纹理丰富度。通过少量真实临床样本微调,我们的方法在三个涵盖毫米至厘米范围、不同肤色及慢性伤口的真实世界基准测试中实现泛化,其测量结果与医学文献报道的病灶尺寸高度一致。所有代码、数据和模型均可在https://github.com/hectorcarrion/dermdepth获取。