跳转至

arXiv 2026-09-18

标题 作者 发布日期 PDF链接 摘要
具有障碍感知约束装置的编码代理用于安全机器人操作 Bingxin Xu 2026-09-17 PDF 编码智能体已成为机器人操作领域一种颇具前景的范式:语言模型将机器人控制器编写为程序,以这种方式构建的智能体如今无需针对特定机器人进行训练即可操作机器人。然而,这一范式是否同样安全,尚未被追问。我们在安全约束下评估编码智能体,其中每个任务将一个操作目标与一个机器人不得触碰的障碍物配对。智能体追求目标,但在大多数情况下会与障碍物发生碰撞,将任务完成视为其唯一目标而忽视安全。智能体在其推理轨迹中会对障碍物进行推理,且提示词中已经禁止触碰它,因此无论是感知还是指令都没有过错;过错在于规划,其中所陈述的约束从未成为优先事项。通过将操作分解为路径阶段和接触密集时刻,我们定位了失败的根源。在路径上,模型无法将安全约束置于优先位置,因为它既没有畅通路径的概念,也没有在所选路径变得不可行时重新规划的概念。在接触时,它没有意识到接触执行同样受同一约束的约束。为弥合这一差距,我们提出 SafeHarness,它为模型配备了两个障碍物感知 harness,使其能够将安全约束置于优先位置。障碍物感知路径规划将物体作为边界框进行定位,并在其上以路点序列的形式绘制候选路径。随后,智能体提前规划一条路径,对其进行验证,必要时重新规划,然后才执行。障碍物感知接触执行则选择接触位置,使接触本身避开障碍物。SafeHarness 达到了 71.9% 的任务成功率和 87.5% 的避碰率,分别超过此前 SOTA 6.5% 和 27.0%。这些结果分别是同一智能体在没有 harness 时的 $2.3\times$ 和 $1.5\times$。
嵌入模型以独特的方式进行度量 Juri Opitz 2026-09-17 PDF 嵌入空间定义了语义相似性和距离的概念。我们研究这些嵌入是否反映了质量、距离、时间和体积的物理测量,这些测量具有唯一、客观的语义等价性和距离概念。我们发现物理测量在嵌入空间中仅被弱建模,相反可以观察到相当奇特的测量模式。进一步分析表明,物理测量的嵌入表示受到表面字符串相似性的强烈影响,而相似性的重新校准并未显著改善对齐。
工作空间模型:通过显著性驱动监督的轻量级机器人记忆 Nitish Dashora 2026-09-17 PDF 复杂的机器人操作任务通常需要对过去事件和动作的长期记忆。由于以完整历史为条件会使策略容易产生虚假关联并降低性能,许多策略记忆方法通过昂贵的VLM查询在环内压缩历史信息,仅处理任务显著信息。在本文中,我们提出了一种替代方法,在训练时进行计算密集的VLM查询,以学习一个轻量级的潜在记忆,该记忆可以在部署时高效查询。我们的表示,我们称之为\textbf{工作空间令牌},通过以下方式训练:(1)使用VLM识别完成任务所需的当前和历史信息,然后(2)使用集合重建解码器损失将这些信息蒸馏到工作空间令牌中。在仿真和硬件中,我们表明工作空间令牌可以在部署期间作为观测的即插即用替代品,使策略能够解决记忆密集型任务,而无需在环内进行VLM推理。有趣的是,我们发现工作空间令牌不仅更轻量,而且还能带来更好的策略性能。
4D基础模型能记住吗? Guangzhao He 2026-09-17 PDF 感知和记忆视觉世界是导航和与环境交互的基础。当前的4D基础模型,例如相机可控的视频模型或4D重建模型,能够感知和重建动态环境,但它们对已感知内容的记忆能力如何仍是一个未解问题。现有基准大多依赖像素级指标,并且缺乏物体离开视野后的真值,使其无法以物体为中心的方式对照参考来评估视觉记忆。为填补这一空白,我们提出了PersistBench,一个数据集和指标套件,利用360°视频作为全知真值,并提出三个评估方面:物体恒存性、运动连续性和外观保持性。跨多种类别评估各类模型后发现,当前模型只能维持短期一致性,一旦物体离开视野,这种一致性就会显著下降。我们的发现凸显了当前模型能力与稳健视觉记忆之间的差距(“看见并不等于记住”),为4D基础模型的未来发展提供了指导。数据集和代码可在项目页面获取:https://guangzhaohe.com/persistbench。
SplashSplat:从真实世界多视角视频重建飞溅液体 Peiyu Liu 2026-09-17 PDF 一次飞溅仅持续几分之一秒:液片撕裂成韧带和液滴,外观依赖视角且几乎没有纹理,几乎没有足够持久的东西可供追踪。因此,重建研究一直集中在烟雾、合成液体或缓慢变形的表面上。据我们所知,尚不存在同步多视角的飞溅液体数据集。因此,我们引入了一个包含20个真实场景的基准,从连贯水流到剧烈飞溅,由七台同步、标定的4K相机以60帧每秒拍摄,并带有手动精修的各视角液体和容器掩码以及固定的评估划分。我们进一步提出SplashSplat,其构建基于一个单一原则:仅在观测能够约束之处施加物理结构。从掩码融合得到的逐帧液体SDF提供几何,连续SDF之间的水平集传输产生粗略速度场,沿该流场平流的拉格朗日载体根据每个新观测进行校正,并在覆盖丢失处重新播种,解码局部高斯以进行可微渲染。SplashSplat在我们的真实捕获和一个合成基准上优于最先进的动态高斯泼溅方法,具有物理上更合理的运动和更低的训练成本。同一表示无需重新优化即可支持时间插值和风格迁移。
FAMOS:从稀疏观测中进行前馈三维关节建模 Kevin Qu 2026-09-17 PDF 从稀疏单目视角对铰接物体进行建模具有挑战性,因为每次观测只能揭示部分几何和运动证据。大多数前馈方法从单次观测推断铰接关系,因此严重依赖学习到的类别级形状先验。我们提出FAMOS,一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割和关节参数。我们的模型对多个观测进行联合推理,并自然支持可变数量的输入,包括单视角。为了跨观测聚合铰接线索,我们引入多状态铰接Transformer,采用交替的状态级注意力和全局注意力。我们进一步提出观测铰接跨度目标,用于监督每个部件在输入观测中所表现出的运动范围,鼓励模型充分利用整个观测集。为克服现有数据集规模和多样性的限制,我们引入程序化数据生成器,在训练期间合成自标注资产。在PartNet-Mobility、ACD和ArtiCraft-10K上的实验表明,相较于前馈和基于优化的基线方法均取得了一致改进。项目页面:https://kevinqu7.github.io/famos
Paint-Anything:面向图像生成与编辑的统一任意颜色控制 Ji Xie 2026-09-17 PDF 专业设计要求任意颜色控制:能够以任意24位十六进制值为对象指定目标颜色,用于图像生成和编辑。已有研究探索了颜色生成、编辑和着色,但通常依赖专用的颜色表示或专门的推理流程。大语言模型的进展提供了更简单的起点:即使是紧凑模型也能将十六进制值与颜色语义关联起来。我们提出Paint-Anything,通过对象级颜色监督学习用于生成和编辑的共享十六进制提示接口。我们开发了一条数据流水线,通过对象定位、感知颜色标注和编辑对合成,从真实图像构建Paint-500K。由于阴影使真实图像标签只能近似颜色,我们用纯色锚点补充这种监督,其像素与配对的十六进制值精确匹配。这些锚点仅在高噪声时间步使用,将低噪声训练留给自然图像。我们进一步引入任意颜色基准(ACBench),包括ACBench-T2I和ACBench-Edit,以衡量两个任务中对象级十六进制颜色保真度。在FLUX.2-4B上,Paint-Anything相对于基础模型将ACBench-T2I和ACBench-Edit分数分别提升85.3%和28.3%,消融实验支持该训练方案。在比较方法中,它还取得了最高的平均CompColor分数。
ERCPMP-Gx:用于结直肠息肉病形态学、组织病理学和基因组学表征的内镜图像与视频数据集 Zahra Ghaffari 2026-09-17 PDF 遗传性息肉病综合征可作为结直肠癌的前驱病变,并与广谱的结肠外肿瘤相关。对这些综合征的早期识别和准确分类对于及时诊断、个体化患者管理以及针对受影响家族的目标性监测策略至关重要。然而,公共内镜数据集大多围绕单个散发性息肉进行组织,且没有任何一个在患者层面将息肉病表型与组织病理学和胚系检测结果相关联。在此,我们提出ERCPMP-Gx,这是一个内镜、组织病理学和基因组数据集,旨在支持人工智能(AI)在结直肠息肉病的识别、表征和分类中的应用。大多数操作使用Olympus EVIS X1系统,采用白光内镜(WLE)、窄带成像(NBI)、放大NBI(M-NBI)以及带近焦模式的NBI,产生了160张图像及配套视频片段。约80%的病例代表临床和/或遗传学确诊的遗传性息肉病综合征(PG),包括家族性腺瘤性息肉病(FAP)、Peutz-Jeghers综合征(PJS)、幼年性息肉病综合征(JPS)和神经节细胞瘤综合征(GNS),而其余20%包括具有重叠形态特征的非遗传性息肉和息肉样病变(Non-PG),纳入以支持鉴别分类。每条发布的记录在可用的情况下均与标准化内镜标注、代表性组织病理学和临床报告的胚系检测结果相关联,形成一个AI就绪的患者层面标注框架。该数据集可在Mendeley公开获取(https://doi.org/10.17632/nzyfc544bx.2)。有关最新更新和更多信息,读者可参阅DataBioX网站:https://databiox.com。
分布偏移如何塑造神经偏微分方程代理模型中的预训练收益? Pochinapeddi Sai Bhargav 2026-09-17 PDF 预训练神经偏微分方程代理模型可以在几何形状或建模物理发生变化时减少所需的新计算流体力学数据量。然而,分布偏移的不同组成部分如何影响这一收益仍不清楚。我们在一个翼型族的254,909个RANS解上预训练代理模型,并在两个匹配来流范围的目标设置下,将其微调到一个新的翼型族:相同的Spalart-Allmaras(SA)建模,以及加入$e^N$转捩建模的SA。在$N=1000$时,预训练模型在相同SA目标上达到了从头训练模型使用$3.25\times$样本量的精度,而在转捩建模目标上则需要$2.58\times$样本量。到$N=5000$时,这一排序发生反转($1.56\times$对$1.86\times$)。在$N=1000$时,采样更多不同翼型会降低两个目标上的误差,但只有在相同SA目标上,增益的增加大于观测到的抽样间波动($3.3\times$到$4.0\times$)。这些结果表明,预训练价值联合取决于目标数据预算、目标数据覆盖范围,以及源域与目标域是否在建模物理上存在差异。
量化前沿LLM智能体的过度声称倾向 Nolan Smyth 2026-09-17 PDF 前沿编码智能体正日益被信任能够长时间自主工作,然而智能体的最终回复往往是用户所能看到的关于其工作的唯一说明。我们量化了前沿智能体夸大任务完成情况的倾向,这种虚假陈述可能误导用户。当智能体的最终回复与其上下文中的信息相矛盾时,即为夸大。这一定义无需推断意图,且独立于任务是否成功。我们提出了OverclaimBench,一个由五个文件审查场景、基于转录的覆盖度测量以及已注册的植入缺陷组成的评估套件。我们在其各自的生产命令行界面中评估了八个专有前沿模型,并在单一固定测试框架下评估了四个开放权重模型,在OverclaimBench上发现:1)在67.9%的运行中,智能体并未阅读所有被要求审查的文件;2)在未阅读所有文件的运行中,智能体有80.4%的时间具有误导性(各模型为59–96%),要么虚假声称已阅读所有文件,要么遗漏了覆盖不完整这一事实;3)要求委派给子智能体提高了阅读覆盖度,但在仍然不完整的审查中,绝大多数仍具有误导性;4)虚假声称完成完整审查的智能体遗漏植入缺陷的比率约为阅读了每个文件的智能体的1.8倍,表明完成声明可能掩盖实质性失败。总之,这些结果表明,智能体的最终回复并非其行动的可信说明。