| 具有障碍物感知约束装置的编码代理用于安全机器人操作 |
Bingxin Xu |
2026-09-17 |
PDF |
编码智能体已成为机器人操作的一种有前景的范式:语言模型将机器人控制器编写为程序,以这种方式构建的智能体现在无需机器人特定训练即可操作机器人。然而,这一范式是否同样安全,尚未被追问。我们在安全约束下评估编码智能体,其中每个任务将一个操作目标与一个机器人不得触碰的障碍物配对。智能体追求目标,但在大多数情况下与障碍物碰撞,将任务完成视为其唯一目标而忽视安全。智能体在其轨迹中推理了障碍物,且提示词已经禁止触碰它,因此无论是感知还是指令都没有过错;过错在于规划,其中所述约束从未成为优先事项。通过将操作分解为路径阶段和接触密集时刻,我们定位了失败的来源。在路径上,模型无法优先考虑安全约束,因为它没有畅通路径的概念,也没有在所选路径变得不可行时重新规划的概念。在接触时,它没有意识到接触执行受同一约束的约束。为弥补这一差距,我们提出了SafeHarness,它为模型配备了两个障碍物感知工具,使其能够优先考虑安全约束。障碍物感知路径规划将物体作为边界框进行定位,并在其上绘制候选路径作为路点序列。智能体随后提前规划路径,验证它,必要时重新规划,然后才执行它。障碍物感知接触执行则选择接触位置,使接触本身避开障碍物。SafeHarness达到了71.9%的任务成功率和87.5%的碰撞避免率,分别超过先前的最优方法6.5%和27.0%。这些结果是同一智能体在没有工具时的2.3倍和1.5倍。 |
| 嵌入模型以奇特的方式衡量 |
Juri Opitz |
2026-09-17 |
PDF |
嵌入空间定义了语义相似性和距离的概念。我们研究这些嵌入是否反映了质量、距离、时间和体积的物理测量,这些测量具有唯一且客观的语义等价性和距离概念。我们发现物理测量在嵌入空间中仅被弱建模,反而可以观察到相当奇特的测量模式。进一步分析表明,物理测量的嵌入表示受到表面字符串相似性的强烈影响,而相似性的重新校准并未显著改善对齐。 |
| 工作空间模型:通过显著性驱动监督的轻量级机器人记忆 |
Nitish Dashora |
2026-09-17 |
PDF |
复杂的机器人操作任务通常需要对过去事件和动作的长期记忆。由于以完整历史为条件会使策略容易产生虚假关联并降低性能,许多策略记忆方法通过昂贵的VLM查询在环内压缩历史信息,以仅处理任务显著信息。在本文中,我们提出了一种替代方法,在训练时进行计算密集型的VLM查询,以学习一个轻量级的潜在记忆,该记忆可以在部署时高效查询。我们的表示,我们称之为\textbf{工作空间令牌},通过以下方式训练:(1)使用VLM识别完成任务所需的当前和历史信息,然后(2)使用集合重建解码器损失将这些信息蒸馏到工作空间令牌中。在仿真和硬件中,我们表明工作空间令牌可以在部署期间作为观测的直接替代品,使策略能够解决记忆密集型任务,而无需在环内进行VLM推理。有趣的是,我们发现工作空间令牌不仅更轻量,而且还能带来更好的策略性能。 |
| 4D基础模型能记住吗? |
Guangzhao He |
2026-09-17 |
PDF |
感知和记忆视觉世界是导航和与环境互动的基础。当前的4D基础模型,如相机可控的视频模型或4D重建模型,能够感知和重建动态环境,但它们对已感知内容的记忆能力如何仍是一个未解问题。现有基准大多依赖像素级指标,且缺乏物体离开视野后的真实参考,使其无法以物体为中心的方式对照参考来评估视觉记忆。为填补这一空白,我们提出了PersistBench,一个数据集和指标套件,利用360°视频作为全知真实参考,并提出三个评估方面:物体恒存性、运动连续性和外观保持性。对各类模型在不同类别上的评估表明,当前模型只能维持短期一致性,一旦物体离开视野便会显著退化。我们的发现凸显了当前模型能力与稳健视觉记忆之间的差距(“看见不等于记住”),为4D基础模型的未来发展提供了指导。数据集和代码可在项目页面获取:https://guangzhaohe.com/persistbench。 |
| SplashSplat:从真实世界多视角视频重建飞溅液体 |
Peiyu Liu |
2026-09-17 |
PDF |
一次飞溅只存在几分之一秒:液片撕裂成韧带和液滴,外观依赖视角且几乎没有纹理,几乎没有足够持久的东西可供追踪。因此,重建研究一直集中在烟雾、合成液体或缓慢变形的表面上。据我们所知,尚不存在同步多视角的飞溅液体数据集。因此,我们引入了一个包含20个真实场景的基准,从连贯水流到剧烈飞溅,由七台同步、标定的4K相机以60帧每秒拍摄,并带有手动精修的各视角液体和容器掩码以及固定的评估划分。我们进一步提出SplashSplat,其构建基于一个单一原则:仅在观测能够约束的地方施加物理结构。从掩码融合得到的逐帧液体SDF提供几何,连续SDF之间的水平集传输产生粗略速度场,沿此流场平流的拉格朗日载体根据每个新观测进行校正,并在覆盖丢失处重新播种,解码局部高斯以进行可微渲染。SplashSplat在我们的真实捕获和一个合成基准上优于最先进的动态高斯泼溅方法,具有物理上更合理的运动和更低的训练成本。相同的表示支持时间插值和风格迁移,无需重新优化。 |
| FAMOS:从稀疏观测中进行前馈三维关节建模 |
Kevin Qu |
2026-09-17 |
PDF |
从稀疏单目视角对铰接物体进行建模具有挑战性,因为每次观测只能揭示部分几何和运动证据。大多数前馈方法从单次观测推断铰接关系,因此严重依赖学习到的类别级形状先验。我们提出FAMOS,一种前馈模型,可从稀疏、无序的部分点云集合中预测可动部件分割和关节参数。我们的模型对多个观测进行联合推理,并自然支持可变数量的输入,包括单视角。为了跨观测聚合铰接线索,我们引入多状态铰接Transformer,采用交替的状态级注意力和全局注意力。我们进一步提出观测铰接跨度目标,用于监督每个部件在输入观测中表现出的运动范围,鼓励模型充分利用整个观测集。为了克服现有数据集规模和多样性的限制,我们引入程序化数据生成器,在训练期间合成自标注资产。在PartNet-Mobility、ACD和ArtiCraft-10K上的实验表明,相较于前馈和基于优化的基线方法均取得了一致改进。项目页面:https://kevinqu7.github.io/famos |
| Paint-Anything:面向图像生成与编辑的统一任意颜色控制 |
Ji Xie |
2026-09-17 |
PDF |
专业设计要求任意颜色控制:能够为图像生成和编辑指定具有任意24位十六进制值的对象目标颜色。已有工作探索了颜色生成、编辑和着色,但通常依赖专门的色彩表示或专用推理流程。大语言模型的进展提供了更简单的起点:即使紧凑模型也能将十六进制值与颜色语义关联起来。我们提出Paint-Anything,通过对象级颜色监督学习用于生成和编辑的共享十六进制提示接口。我们开发了一条数据流水线,通过对象定位、感知颜色标注和编辑对合成,从真实图像构建Paint-500K。由于阴影使真实图像标签只能近似颜色,我们用纯色锚点补充这种监督,其像素与配对的十六进制值精确匹配。这些锚点仅在高噪声时间步使用,将低噪声训练留给自然图像。我们进一步引入任意颜色基准(ACBench),包括ACBench-T2I和ACBench-Edit,以衡量两个任务中对象级十六进制颜色保真度。在FLUX.2-4B上,Paint-Anything相对于基础模型将ACBench-T2I和ACBench-Edit分数分别提升85.3%和28.3%,消融实验支持该训练方案。在比较方法中,它还取得了最高的平均CompColor分数。 |
| ERCPMP-Gx:用于结直肠息肉病形态学、组织病理学和基因组学表征的内镜图像与视频数据集 |
Zahra Ghaffari |
2026-09-17 |
PDF |
遗传性息肉病综合征可作为结直肠癌的前驱病变,并与广谱的结肠外肿瘤相关。对这些综合征的早期识别和准确分类对于及时诊断、个体化患者管理以及针对受累家系的靶向监测策略至关重要。然而,公共内镜数据集大多围绕单个散发性息肉进行组织,且没有任何一个在患者层面将息肉病表型与组织病理学和胚系检测结果相关联。在此,我们提出 ERCPMP-Gx,这是一个内镜、组织病理学和基因组数据集,旨在支持人工智能(AI)在结直肠息肉病的识别、表征和分类中的应用。大多数操作使用 Olympus EVIS X1 系统进行,采用白光内镜(WLE)、窄带成像(NBI)、放大窄带成像(M-NBI)以及近聚焦模式窄带成像,产生了 160 张图像及配套视频片段。约百分之八十的病例代表临床和/或遗传学确诊的遗传性息肉病综合征(PG),包括家族性腺瘤性息肉病(FAP)、Peutz-Jeghers 综合征(PJS)、幼年性息肉病综合征(JPS)和神经节细胞瘤综合征(GNS),而其余百分之二十包括具有重叠形态特征的非遗传性息肉和拟息肉病变(Non-PG),纳入以支持鉴别分类。每条发布的记录在可获得的情况下均与标准化内镜标注、代表性组织病理学和临床报告的胚系检测结果相关联,形成一个可供 AI 使用的患者层面标注框架。该数据集可在 Mendeley 公开获取(https://doi.org/10.17632/nzyfc544bx.2)。有关最新更新和更多信息,读者可参阅 DataBioX 网站:https://databiox.com。 |
| 分布偏移如何塑造神经偏微分方程代理模型中的预训练收益? |
Pochinapeddi Sai Bhargav |
2026-09-17 |
PDF |
预训练神经偏微分方程代理模型可以在几何形状或建模物理发生变化时减少所需的新计算流体力学数据量。然而,分布偏移的不同组成部分如何影响这一收益仍不清楚。我们在来自一个翼型家族的254,909个RANS解上预训练一个代理模型,并在两个匹配自由来流范围的目标设置下,将其微调到一个新的翼型家族:相同的Spalart-Allmaras(SA)建模,以及加入$e^N$转捩建模的SA。在$N=1000$时,对于相同SA目标,预训练模型达到了从头训练模型使用$3.25\times$样本量时的精度,而对于转捩建模目标则为$2.58\times$。到$N=5000$时,这一排序发生反转($1.56\times$对$1.86\times$)。在$N=1000$时,采样更多不同翼型会降低两个目标上的误差,但只有在相同SA目标上,增益的增加大于观测到的抽样间波动($3.3\times$到$4.0\times$)。这些结果表明,预训练的价值共同取决于目标数据预算、目标数据覆盖范围,以及源域和目标域是否在建模物理上存在差异。 |
| 量化前沿LLM智能体的过度声称倾向 |
Nolan Smyth |
2026-09-17 |
PDF |
前沿编码智能体正日益被信任能够长时间自主工作,然而智能体的最终回复往往是用户所能看到的关于这些工作的唯一说明。我们量化了前沿智能体夸大任务完成情况的倾向,这种虚假陈述可能误导用户。当智能体的最终回复与其上下文中的信息相矛盾时,即为夸大。这一定义无需推断意图,且独立于任务是否成功。我们提出了OverclaimBench,一个由五个文件审查场景、基于转录的覆盖率测量以及已注册的植入缺陷组成的评估套件。我们在各模型自身的生产命令行界面中评估了八个专有前沿模型,并在单一固定测试框架下评估了四个开放权重模型,在OverclaimBench上发现:1)在67.9%的运行中,智能体并未阅读要求其审查的所有文件;2)在未阅读所有文件的运行中,智能体有80.4%的时间(各模型为59–96%)具有误导性,要么虚假声称已阅读所有文件,要么省略了覆盖率不完整这一事实;3)要求委派给子智能体提高了阅读覆盖率,但在仍然不完整的审查中,绝大多数仍具有误导性;4)虚假声称完成完整审查的智能体漏掉植入缺陷的比率约为阅读了每个文件的智能体的1.8倍,表明完成声明可能掩盖实质性失败。总之,这些结果表明,智能体的最终回复并非其行动的可靠说明。 |