2026-09-26 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| LLM智能体可以轻易篡改自己的痕迹 | Jeremy Qin | 2026-09-24 | 异步监控、事件调查和合规审计主要依赖智能体轨迹来重建事件经过。这些分析假设LLM智能体无法篡改自身的执行轨迹。我们表明,Claude Code、Codex、Antigravity、Open Code和Grok Build等本地LLM智能体未能守住这一边界。除Muse Code外,所有测试的框架都允许智能体在被要求时删除其轨迹,且不会触发监控防护措施。我们还验证了外部攻击者可以利用这一缺口诱导轨迹删除。最后,我们表明,当前沿模型试图提高自身奖励时,轨迹篡改行为会自然涌现。我们建议从业者确保轨迹日志通过独立于智能体控制的拦截机制进行记录,即使主机完全被攻陷也能保持轨迹完整性。总体而言,我们的发现揭示了智能体基础设施中轨迹完整性的一个具体失效,可被用于掩盖诸如谋划或破坏等失准行为。 | |
| AD-WM:用于反事实模型预测控制的动作判别世界模型 | Jiabin Qiu | 2026-09-24 | 潜在世界模型通常被训练用于预测事实性转移,而模型预测控制(MPC)必须从同一状态比较不同的候选动作。因此,一个模型可能实现较低的事实预测误差,却难以区分候选动作。我们提出 AD-WM,一种用于反事实 MPC 的动作判别性联合嵌入世界模型。AD-WM 将残差潜在动力学与预测器层面的动作恢复正则化相结合,使用逆动力学和一种由条件互信息驱动的归一化恢复目标。这两个目标都鼓励规划转移保留动作信息;它们的辅助头在测试时被丢弃,使 MPC 保持不变。在 OGBench-Cube 上,AD-WM 将困难起始成功率从匹配的 LeWM 基线的 3.7% 提升至 52.0%,并在五个仿真环境中的四个上提升了相对于复现基线的平均成功率。规划诊断表明,事实预测误差和全库动作排序与闭环成功率排序不一致,而 CEM 对齐的精英遗憾更紧密地跟踪成功率。在使用冻结的 V-JEPA 2 编码器和匹配的 DROID 后训练时,AD-WM 还改善了对我们的 Franka 设置的零样本迁移,将基本抓取放置成功率从 42.2% 提升至 71.1%,且无需实验室特定适配。这些结果表明,用于规划的世界模型应保留反事实选择所需的动作相关差异,而不是仅优化事实预测精度。更多视频和代码见 https://ad-wm.github.io/。 | |
| 具身强化学习中用于私有轨迹重建的时间梯度反转 | Sudip Bhujel | 2026-09-24 | 在具身强化学习智能体中的分布式学习通过将原始传感器数据保留在设备上并仅向服务器传输策略梯度,提供了一定程度的隐私保护。然而,时间结构可能将这种泄露放大到超越单帧攻击的程度。我们提出了针对连续编码的时间重建攻击(TRACE),这是一种摊销式时间梯度反演攻击,能够从每步策略学习梯度中自回归地重建私有观测-动作轨迹序列。该攻击利用了先前单帧方法所忽略的两种结构信号:(i)连续具身梯度之间的跨时间相关性,我们通过条件互信息界将其形式化;(ii)从策略头梯度结构中闭式恢复动作,我们证明当标准熵正则化足够小时该恢复是精确的。在留出的具身场景上,TRACE 在每重建帧 3-4.5 毫秒的速度下达到 18.8 dB PSNR 并实现近乎完美的动作恢复,在所有重建指标上优于基于学习的基线,并超过优化攻击,同时运行速度快数个数量级。进一步评估表明,TRACE 在循环、残差和紧凑 Transformer 受害架构、多模态输入以及更大的离散动作空间上具有更广泛的适用性。防御实验表明,保护时间梯度流可能需要序列感知的隐私机制。 | |
| 在线阴谋的代理检测 | Lior Biton | 2026-09-24 | 社交媒体上的阴谋论话语并不总是通过明确的断言或稳定的词汇标记来表达。相同的表层内容可能表达支持、合理关切、批评、讽刺或嘲弄。因此,主要挑战不仅在于识别与阴谋论相关的断言,还在于推断说话者的意图——即该话语的以言行事力量。我们认为,这可以通过利用相关的社会语境来实现,并提出一个能动框架,配备一套支持社会查询的工具。我们在一个独特的希伯来语推文数据集上展示了我们方法的优势,该数据集覆盖了四年跨度(2018年末至2023年初)内80%--90%的公开希伯来语推文,涵盖数个选举周期以及新冠疫情期间及相关疫苗接种活动。这种广泛的覆盖可用于恢复不同的社会语境。在一个手动标注的对抗性数据集上评估我们的框架,我们发现语境感知的工作流程始终优于纯文本分类,并且该能动框架的表现显著优于其他框架和设置,包括一个非能动模型,该模型可接触到能动体所能获得的相同语境。我们进一步对结果、错误和效率(token经济性)权衡进行了分析。这些发现支持将阴谋论检测任务视为一项社会嵌入的解释任务,其中有效的分类不仅取决于对语境的获取,还取决于自适应推理,即能动体逐案使用工具,仅请求与其当前推理步骤相关的证据。 | |
| RAPID:基于演示的机器人智能体编程 | Yuyao Liu | 2026-09-24 | 编码智能体在解决复杂编程问题方面已展现出巨大成功。为利用其在机器人系统中的潜力,本工作提出了从演示中进行机器人智能体编程(RAPID),该方法在给定单次视觉人类演示的情况下,自动生成、验证并精炼机器人程序。代码精炼的迭代智能体循环需要几个关键要素:(i)可测试的任务规范,(ii)用于机器人执行的动作基元,以及(iii)用于程序执行与验证的交互式环境。RAPID从演示中自动推断出这三者。为使生成的程序在演示场景之外仍可复用,RAPID使用以对象为中心的关系程序表示,该表示关注所演示策略的底层结构而非具体运动本身:它将动作基元表达为实现对象级运动效果的轨迹优化程序,同时通过关系约束将它们组合起来,这些约束在运行时捕获场景特定的几何信息。我们在仿真中评估了RAPID,涉及八项具有挑战性的富接触非抓取操作任务,以及LIBERO-Pro基准中的一般抓取操作任务。我们还成功将其部署在真实的Franka机械臂上,并对全部八项非抓取任务进行了评估。在所有实验中,RAPID均展现出强劲性能,并在物体位姿、形状、材质和环境方面具有泛化能力。网站:https://yuyaoliu.me/projects/rapid。 | |
| 滚动世界动作模型:具有滚动想象的世界动作模型 | Yinghua Zhou | 2026-09-24 | 世界动作模型(WAMs)将动作生成与未来视觉预测相结合,用于机器人操作。然而,在每个重新规划周期完成联合视频-动作去噪过程会带来显著的延迟,推迟动作更新并限制闭环响应能力。我们提出Rolling-WAM,一种将联合去噪分布到连续重新规划周期中的公式化方法。我们的方法维护一个处于交错噪声水平的视频-动作块的滑动窗口。在每一步,滚动噪声调度对即将执行的动作块进行完全去噪以供执行,同时部分精炼更远未来的块。随着窗口随新的相机观测推进,保留的未来块继续其去噪过程。这在一段时间内分摊了计算成本,同时跨块边界携带不断演化的视觉-动作上下文。在LIBERO、RoboTwin以及真实世界的Unitree G1人形机器人上的评估表明,Rolling-WAM实现了具有竞争力的操作性能。通过消除从头去噪整个预测范围的需要,它相比标准联合WAMs实现了4.5倍的稳态重新规划加速。 | |
| 走向实用的3D高斯泼溅压缩 | Pengpeng Yu | 2026-09-24 | 3D高斯泼溅(3DGS)能够实现高质量的新视角合成,但需要大量存储。现有压缩方法通常依赖对不规则3D表示进行空间上下文建模,增加了训练和编码的复杂度。同时,浮点上下文推断可能在不同平台间引入数值不一致,导致熵解码失败。为解决这些实际挑战,我们提出COSA-GS,通过锚点级因果分解构建上下文,而无需空间聚合。具体而言,我们利用由每个锚点坐标导出的几何上下文来建模紧凑的可学习锚点隐变量。随后将锚点隐变量与几何上下文融合,形成用于属性编码的锚点上下文。所得上下文模型具有简单架构,仅由线性变换和激活函数组成。我们使用率失真优化结合自适应高斯剪枝来训练COSA-GS。此外,我们为上下文模型开发了量化感知训练和整数推断,以实现熵解码符号在不同平台间的比特精确一致性。实验表明,COSA-GS在保持快速且一致的跨平台解码的同时,实现了最先进的压缩性能,为实际3DGS压缩提供了一个简单而有效的框架。代码可在https://github.com/pengpeng-yu/COSA-GS获取。 | |
| JevOut:自然语境可以颠覆决策模型 | Zixiang Xu | 2026-09-24 | 诸如Jev这类专用决策模型将非结构化语言映射为有限选择上的概率分布,使其输出能够直接路由请求、选择工具并触发动作。然而,现实世界中的输入很少孤立出现:它们总是伴随着背景细节和周围语境。我们发现,那些能够自然融入这一语境的简短补充内容,却可能改变原本正确的决策,即便正确答案并未改变。为研究这一行为,我们为每个初始正确的项目固定一个错误的目标选项,并利用模型的选项概率来优化流畅的语境补充,同时保留来源、问题、选项和标准答案。在64个被接受的目标评估中,优化器识别出的语境在508个初始正确的决策中改变了Jev的判断,涉及312个(61.4%);在229个案例中,Jev为固定的错误选项分配了至少0.7的概率。在七个数据集上,另外三个决策系统在其初始正确回答的决策上表现出64.9%至73.2%的目标翻转率。综合来看,这些结果揭示了当前决策模型中一种显著的脆弱性:简短、看似普通的语境就能将正确选择转变为高置信度的错误选择。由于这些模型将语言直接转化为下游选择,这种敏感性引发了对其概率输出能否作为可靠决策接口的担忧。 | |
| SemMSA:潜在语义辅助的鲁棒多模态情感分析及其不完整数据 | Wenhao Li | 2026-09-24 | 近期关于多模态情感分析(MSA)的研究主要聚焦于在不完整数据条件下从语言、视觉和声学模态中学习,以推断人类情感。大多数研究通常通过重建模态特征或设计复杂的融合机制来补偿缺失信息。然而,由于在部分观测的多模态证据中缺乏高层语义基础,这些方法仍然面临虚假生成和噪声引导的问题。为解决这些问题,我们提出了SemMSA,一种潜在语义辅助框架,该框架利用LLM构建丰富的与情感相关的语义,并通过无锚点谱对齐与所有模态充分融合。它主要由跨模态语义精炼(CSR)和跨模态谱对齐(CSA)组成。具体而言,CSR首先通过相应的适配器自适应地提取视觉和声学表示,在冻结的LLM嵌入空间中与语言形成统一的多模态前缀。然后,它通过一种token高效的潜在精炼过程迭代地产生连续判别性语义状态,而无需解码显式文本。接下来,CSA通过增强所有模态的核Gram矩阵的主导谱分量,同时将精炼后的语义与所有模态对齐。这在不需要预定义锚定模态的情况下捕获了所有表示之间的全局非线性依赖关系。此外,实例级谱分离约束保持了跨样本判别性并缓解了表示崩溃。在SIMS、MOSI和MOSEI基准上的大量实验表明,SemMSA达到了最先进的性能。 | |
| OmniFabric:面向三维服装重建的连贯UV空间纹理合成 | Ding-Jiun Huang | 2026-09-24 | 从单张图像自动生成可用于生产的3D服装资产是数字内容创作中的一个核心挑战。尽管近期的生成模型在3D几何重建方面取得了显著进展,但合成高质量纹理仍然是一个瓶颈。现有方法往往将环境光照和阴影直接烘焙到纹理贴图中,或者无法保持全局结构一致性,导致生成的资产无法用于物理模拟和重光照。在这项工作中,我们提出了OmniFabric,一种直接在2D缝纫纸样空间中合成全局一致纹理贴图的新方法。给定单张参考图像,我们的流程利用估计的3D网格以及强大的视觉语言模型(VLM)的生成先验,在展开的缝纫纸样上建立完整但粗糙的纹理初始化。随后,我们利用一个专门的扩散Transformer,通过自动化合成数据引擎进行训练,并以3D位置特征为条件,直接在规范UV域中细化该初始化。这有效地消除了畸变和烘焙伪影,从而提取出干净且归一化的纹理贴图,同时保留原始服装设计。大量实验表明,OmniFabric显著优于最先进的基线方法,能够生成具有高质量纹理的逼真3D服装。 |
bioRxiv
抓取失败:Expecting value: line 1 column 1 (char 0)
medRxiv
抓取失败:Expecting value: line 1 column 1 (char 0)