跳转至

arXiv 2026-09-09

标题 作者 发布日期 PDF链接 摘要
TANGO:在杂乱环境中使用全身视觉-语言-动作模型的人形机器人导航 Anqi Li 2026-09-08 PDF 我们研究人形机器人在杂乱室内环境中的导航问题。与传统将导航建模为二维路径规划问题的方法不同,人形机器人在杂乱环境中的穿行需要连续的几何感知全身适应,包括协调手臂放置、躯干调整和步态调制,以在复杂三维空间中实现无碰撞运动。我们提出 TANGO,这是首个用于杂乱环境中语言条件人形穿行的全身视觉-语言导航框架。给定自然语言指令和以自我为中心的 RGB 观测,TANGO 直接预测 29 自由度关节空间动作,用于下游全身控制。我们完全在仿真中训练 TANGO,通过全局路径规划、运动学全身运动生成、障碍物感知运动编辑和基于 RL 的跟踪来合成多样化的无碰撞穿行行为。该流程为学习语言条件的全身策略提供了动态可行的动作监督。在大量仿真实验中,TANGO 在视觉-语言导航中展现出最先进的性能,同时在需要障碍协商的挑战性场景中优于强模块化基线。最后,我们将 TANGO 零样本部署到 Unitree G1 人形机器人上,并在未使用任何真实世界导航数据训练的情况下,观察到其在杂乱真实场景中稳健的语言引导穿行。
学习可长度外推的循环模型 Hanwen Jiang 2026-09-08 PDF 循环模型为长上下文建模提供了一条自然的路径,但通过时间反向传播(BPTT)训练的模型往往在超出其训练范围后失效。经典分析强调沿时间路径的梯度消失或爆炸。然而,密集的逐 token 损失即使在严重衰减的情况下仍能训练出共享的循环规则,这表明仅凭衰减并不能决定学习是否失败。我们转而研究状态信用:即未来损失在贡献于参数更新之前到达较早循环状态的信号。据此,我们直接对状态信用进行干预,并提出时间信用稳定化(CST)。在反向传播过程中,CST 局部地重新缩放状态信用信号以稳定其范数,而不旋转被校正的分量,同时保持前向计算不变。由于受控合成任务和真实数据表现出不同的信用动态,我们将 CST 分别专门化到每种情形。在两种设置中,CST 均提升了超出训练范围的性能,在高达训练长度 128 倍的情况下仍观察到增益。
ReCite:面向忠实引用的智能体推理 Yuyang Huang 2026-09-08 PDF 准确的引文是学术写作的基石,它追溯思想渊源并支撑核心论点。然而,面对不断增长的科学文献,人工检索日益困难,促使人们依赖自动引文推荐。尽管现代检索增强架构已在很大程度上缓解了虚构不存在论文的问题,但当前依赖语义相似度的系统仍难以应对错误归属,常常引用真实存在却无法在逻辑上支撑作者论点的论文。为应对这一挑战,我们认为准确的引文需要从基于相似度的搜索转向主动的、论点层面的推理。我们提出ReCite,一个解耦的智能体框架,它统筹位置感知、意图感知的查询规划与反思性验证。我们的智能体在合成的推理轨迹上训练,能够验证论点与证据的一致性,并在检索到的候选文献缺乏逻辑支撑时触发自我纠正循环。实验表明,我们的轻量级框架在严格引文准确率上优于最先进的大规模生成模型。通过将文献匹配建立在可验证的逻辑而非语义重叠之上,ReCite为自动化学术写作奠定了可靠的基础。
SyncWorld:视觉校准使世界模型成为零样本模拟器 Yuncong Yang 2026-09-08 PDF 世界模型越来越多地被用作策略在环的想象环境,其中可靠的展开需要对底层机器人动作进行细粒度可控性。在机器人领域扩展此类模型的一个关键障碍是,动作在像素空间中并非通用语言:视觉环境、相机视角、机器人位置或具身形态的变化会改变同一数值动作在视觉上的表现方式,导致混合训练下的监督冲突以及部署时的脆弱泛化。我们提出 SyncWorld,一种动作条件世界模型,无需任何额外训练即可作为跨未见环境的零样本模拟器。SyncWorld 利用视觉校准片段——展示所有可控自由度的配对帧和动作——在上下文中指定特定设置的动作–视觉映射。使用视觉校准上下文进行训练,教会模型通过视觉证据解释动作,并在显式校准不可用时利用交互历史。实验表明,SyncWorld 能够在先前未见过的设置中准确模拟动作结果,并且其模拟展开的能力使得无需训练即可在测试时改进策略。
程序图:面向LLM代理的自演化执行结构 Yuxing Lu 2026-09-08 PDF 大型语言模型正越来越多地被部署为能够在长时程上进行规划并通过外部工具采取行动的智能体。大多数智能体通过在不断累积的历史上进行无约束生成来选择动作,从而使关于做什么、以什么顺序做以及在什么条件下做的程序性知识保持隐式。随着轨迹变长,智能体会失去对其目标的追踪,以错误顺序调用工具,并重复无效动作。我们引入程序图:正如知识图谱将事实性知识组织为(实体,关系,实体)三元组以回答是什么的问题,程序图将程序性知识组织为(过程,关系,过程)三元组以回答该做什么的问题。在每个决策步骤,该框架定位智能体的活动节点,并由一个引导模型将周围子图转化为步骤级情境引导,在不强制规定的情况下偏置求解器的下一动作。该图是自演化的:一个LLM精炼器将失败轨迹与成功轨迹进行对比,并编辑图的拓扑和属性,提交能够保持或提升留出验证性能的编辑,同时保留被拒绝的编辑以抑制重复。从最小骨架开始,该循环构建出与手工设计图相当或超越手工设计图的图。它还可以修复有缺陷的专家先验。在多个数据集、任务类型和LLM上,程序图相较于基于记忆的基线带来了一致的增益,而自演化无需人工工程即可进一步提升性能。
梯度下降加速的Silver速率几乎是最优的 Yuhan Ye 2026-09-08 PDF 我们研究在光滑凸优化中,梯度下降(GD)通过预先确定的非负步长能够被加速到何种程度。记 (p_{\mathrm{sil}}=\log_2(1+\sqrt{2})),我们证明了一个 (Ω\left(n^{-p_{\mathrm{sil}}-O(\sqrt{\log\log n/\log n})}\right)) 的非 anytime 下界。在 anytime 设定下,每个无限非负步长序列都有无穷多个时间点,其误差为 (Ω\left(n^{-\frac{2p_{\mathrm{sil}}}{1+p_{\mathrm{sil}}}-O(\sqrt{\log\log n/\log n})}\right))。结合 silver-schedule 上界 [Altschuler and Parrilo, 2025] 和 anytime 上界 [Zhang et al., 2025],我们的结果确定了两种设定下的最优多项式收敛指数。
复制解释了AI智能体在野外的集体行为 Giordano De Marzo 2026-09-08 PDF 2026年6月,数千个AI代理发现,一个小的公共wiki会接受来自其沙箱内部的编辑,并开始利用它来帮助彼此通过一项限时测试。每个代理大约存活一小时,之后便什么都不记得了。没有人要求它们合作,这个wiki也不是为它们而建的。它们所写内容的完整记录是公开的,而且信息量异常丰富,因为它不仅保存了每个代理写了什么,还保存了该代理在写作之前能看到什么。我们用它来追踪一个代理在到达时必须做出的三个决定:在哪里写、给自己起什么名字,以及如何措辞其消息。一条规则支配着这三者。一个代理选择某个选项的概率接近该选项在它所能看到的内容中所占的份额,而真正重要的份额是它面前页面上的份额,其次是近期编辑流中的份额,至于更早的内容则只有微弱影响。三个最小复制模型,每个决定对应一个,且各只有一个自由参数,再现了有多少代理在同一页面相遇的重尾分布、代理用来构建其名字的片段的频率,以及那些内部一致又彼此不同的页面的拼凑格局。复制环境恰好展示给它的任何东西,就足以产生这一群体的大部分集体结构。这也正是使这样一个群体容易被引导的原因,因为谁先写,或者在其他人安静时写,谁就为后来者设定了惯例。
Point4D:长距离4D运动重建 Minsik Jeon 2026-09-08 PDF 我们提出了Point4D,一种用于长距离视频序列4D重建的前馈模型。Point4D能够可靠地推断数百帧视频中的稠密逐点3D轨迹,而现有的4D方法仅限于最多几十帧的短输入窗口。实现这一能力的关键创新是我们灵活的基于3D查询的运动解码器,它将轨迹预测与图像平面可见性解耦。预测的3D端点随后直接在下一个片段中重新查询,无需重投影或匹配。此外,我们表明,从点可见的任意帧中提取并复用视觉描述符,比仅依赖源图像块能带来更好的性能。总体而言,Point4D在跨越200帧以上的多种长视频跟踪基准上取得了最先进的性能,并大幅优于之前的前馈4D方法。项目页面:https://point-4d.github.io
将图像分词器作为统一多模态模型中的视觉语言进行研究 Siting Li 2026-09-08 PDF 图像分词器定义了统一多模态模型的“视觉语言”,但通常通过孤立指标或仅生成/仅理解的评估来研究。这些评估无法充分捕捉视觉 token 在与文本联合建模时的行为。我们构建了一个受控的纯自回归测试平台,并在跨文本、图像、文本到图像(T2I)和图像到文本(I2T)预测的多模态持续预训练过程中跟踪任务特定的验证损失。我们考察这些损失如何缩放以及与下游性能的关系,然后利用它们研究多模态可学习性——图像和文本 token 被联合建模的效果——以及分词器设计。我们发现:(1)损失应按任务分析,因为它们表现出不同的缩放行为,并对分词器给出不同排序。(2)损失—性能关系取决于所预测的 token 空间:对于固定分词器,T2I 和 I2T 损失与生成质量相关,但跨分词器时,T2I 损失—性能关系会随图像 token 空间而变化,而在共享文本词表上计算的 I2T 损失提供了更一致的信号。I2T 损失在监督微调后也与生成和视觉理解性能相关。以损失为视角,我们表明:(3)更好的重建不一定带来更低的任务特定损失或更强的下游性能;(4)图像分词器选择会影响联合优化下的文本建模。作为案例研究,我们重新审视三个分词器设计轴——判别器、语义监督和词表大小——以考察它们对联合建模和下游性能的影响。总之,我们的测试平台为图像分词器作为视觉语言提供了互补视角,突出其在与文本联合多模态训练中的相互作用。
NOAH:学习完整患者旅程。用于表示和预测的纵向多模态时间感知模型 Tobias Susetzky 2026-09-08 PDF 医疗健康的数字化产生了患者一生中大量、纵向和多模态的病历记录,然而充分利用这些数据来表征和预测患者状态轨迹仍然是一项关键挑战。当前的AI模型往往难以捕捉真实世界多模态患者数据中复杂的、不规则的时间动态以及固有的随机性。现有的用于建模纵向病历的AI方法主要是判别式的,局限于少数几种模态,受限于封闭的分类词汇表,将时间视为单调的归纳偏置,或者在预测患者未来状态方面能力有限。我们提出NOAH,一个时间感知、任务无关的生成式Transformer模型,用于表征和预测完整的多模态患者旅程。NOAH具有新颖的双向时间积分和变分潜在空间,以捕捉患者状态的连续演变和临床轨迹的随机性。NOAH基于MIMIC数据集家族中299,000名患者的431,000次住院就诊的超过5.59亿条临床事件构建,原生处理医学图像、时间序列和数值信号、分类事件以及结构化和非结构化临床记录。NOAH是该领域首个真正整体性的生成模型,支持带可选时间控制的自回归预测、零样本分类和反事实干预模拟。它生成信息量丰富且具有预测性的患者状态表征,在临床结局、15个ICD章节和29种合并症的探测以及时间到事件预测中展现出强劲性能。NOAH无缝处理多样化的模态和复杂的时间动态,为个性化临床护理和数字医学中的智能预测系统提供了一个通用、任务无关、可扩展的基础。