| AutoDex:一种用于灵巧抓取数据采集的自动化真实世界系统 |
Mingi Choi |
2026-06-22 |
PDF |
学习鲁棒的灵巧抓取需要记录抓取尝试物理结果的真实世界数据。这类数据难以大规模获取:遥操作能产生有效的物理结果,但速度慢且存在操作者偏差;基于仿真的生成方法成本低且可扩展,但无法验证接触有效性。一种自然的解决方案是生成候选抓取方案并在真实硬件上验证,但这只有在整个采集循环(感知、执行、标注和重置)无需人工干预时才能实现规模化。我们提出AutoDex,一个自动化的真实世界数据采集系统,实现了这一闭环:对于可替换生成器产生的每个候选方案,系统通过密集的20摄像头感知在严重手-物遮挡下定位物体,执行碰撞监控的机器人运动,标注提举保持的成功或失败,并在试验间主动重置物体以暴露稳定姿态下的更多候选方案。最终形成可复用的物理标注抓取试验数据库,下游系统可通过检索和可行性过滤进行查询。利用AutoDex,我们在Allegro和Inspire机械手上对100种不同物体采集了3,593次抓取试验,包含同步多视角观测和机器人状态日志。对于匹配的500次轨迹采集,AutoDex需要10.3小时,而遥操作需要49.4小时,吞吐量提升4.8倍;从AutoDex验证数据库中检索的抓取成功率为76%,而纯仿真验证仅为34%。代码和数据将公开发布。 |
| Lift4D:协调单视图3D估计以实现野外4D重建 |
Yehonathan Litman |
2026-06-22 |
PDF |
从单目视频重建动态非刚性物体需要整合直接观测的视觉线索与基于数据驱动的几何外观先验。现有方法要么直接从视觉输入学习预测4D表征,要么初始化3D表征后基于视频证据进行形变与优化。然而前者受限于4D训练数据稀缺,后者仅在初始重建阶段利用先验信息,后续完全依赖视频监督;两者均难以处理存在大形变与遮挡的复杂野外场景。我们提出Lift4D——一种测试时优化框架,同时解决上述两个局限。首先通过因果潜在条件约束,将现有单视图3D重建模型适配为生成时序一致逐帧预测,为可变形3D高斯泼溅表征提供连贯初始化。随后通过遮挡感知优化对该表征进行"雕刻",在忠实恢复可见表面细节的同时,利用视图条件扩散先验补全未观测区域。实验表明Lift4D显著优于现有4D重建方法,尤其在存在严重遮挡与非刚性运动的挑战性野外序列中表现突出。 |
| 随机YaRN提升了长上下文推理的长度泛化能力 |
Manas Mehta |
2026-06-22 |
PDF |
大型语言模型(LLMs)通常先在短序列上进行预训练,再通过额外训练扩展至长序列处理。然而,这类模型在进一步泛化至超长序列时仍存在困难。我们提出Randomized YaRN训练方法,通过结合基于YaRN的位置外推、随机位置编码与长度课程机制来提升长度泛化能力。在短上下文数据训练阶段,模型会从更大位置范围中采样获得YaRN位置编码,即使处理短上下文输入也能接触分布外位置表征。我们在BABILong与多轮共指消解(MRCR)两个具有挑战性的长上下文推理基准上评估了Randomized YaRN。当使用<8K上下文数据训练时,Randomized YaRN在16K至128K上下文长度范围内持续提升推理性能,并优于标准微调方法,其中在远距离分布外长度上提升最为显著。实验结果表明,渐进式暴露模型于分布外位置分布的策略,为实现可泛化的长上下文推理提供了有效方案。 |
| LIBERO-Safety:视觉-语言-动作模型中物理与语义安全的综合基准 |
Rongxu Cui |
2026-06-22 |
PDF |
尽管视觉-语言-动作(VLA)模型展现出令人瞩目的操控能力,但其在严格约束条件下的操作安全性仍未得到充分验证。为此,我们引入了一个参数化安全基准,通过程序化生成具有全面随机性的安全关键场景。为克服人工遥操作的可扩展性瓶颈,我们开发了一种新颖的关键帧驱动数据生成流水线。依托该基础设施,我们构建了包含19,664个严格无碰撞演示的大规模数据集,并进行了广泛的域随机化处理。随后,我们对八个VLA模型和两个具身基础模型开展了系统的跨范式评估。分析揭示了一个关键的泛化-安全矛盾:尽管高多样性训练能生成更安全的轨迹,但任务成功率仍从根本上受限于次优轨迹合成与语义对齐偏差。通过提供可扩展的流水线、稳健的数据集以及深刻的故障模式洞察,LIBERO-Safety为开发安全可靠的VLA模型奠定了关键基础。 |
| LaST-HD:从可扩展人类数据中学习潜在物理推理以用于机器人操作 |
Jiaming Liu |
2026-06-22 |
PDF |
人类手部演示为机器人学习提供了直接且可扩展的物理交互数据来源。虽然手动重定向对于建立不同形态间的运动学动作对应关系不可或缺,但鲁棒的迁移需要超越几何层面,解决人与机器人操作之间物理动力学的底层对齐问题。为此,我们提出LaST-HD这一全新的人到机器人动作学习范式,通过将人类手部与机器人演示对齐到共享的潜在推理空间,扩展了"先推理后行动"的视觉-语言-动作模型。LaST-HD并非模仿人类运动学,而是在未配对的人类手部与机器人轨迹上训练辅助的动作条件世界模型,以合成统一的潜在目标。在此共享前向动力学空间中完成跨形态表征对齐后,这些目标将监督LaST-HD的潜在推理过程,使其内化共享的物理动力学并驱动高效的人类手部动作学习。此外,我们开发了专为LaST-HD设计的低成本动作捕捉手套OOL Glove,用于采集人类手部数据。捕获的人类数据可提供精确的关键点,并作为夹爪与灵巧手的通用动作监督信号。借助对齐的潜在空间与高保真人类手部数据,我们提出渐进式混合到人类训练方案,包含混合人机协同训练与人类手部在线校正后训练。通过混合协同训练,LaST-HD仅使用人类手部演示即可提升对新物体、场景和位置的泛化能力。结合在线校正,LaST-HD能进一步适应新环境,仅需20分钟的OOL手套数据即可实现超过90%的准确率。 |
| 保留关键信息:通过令牌丢弃实现高效的参考条件生成 |
Rishubh Parihar |
2026-06-22 |
PDF |
基于参考图像的扩散模型通过利用输入图像中的元素来引导提示驱动的合成,从而实现了高度可控的图像生成。然而,这类模型在运行时计算成本高昂,且其开销会随着输入参考图像数量的增加而严重增长。尽管扩散模型在提示驱动生成场景下的效率问题已被广泛研究,但在基于参考图像的模型中,这一领域仍鲜有探索。该场景带来了仅关注生成过程的方法无法解决的独特挑战——尤其是参考图像被表示为密集的标记网格这一低效方式,为改进提供了重要空间。本文提出稀疏上下文方法,通过仅保留参考标记的缩减子集来构建稀疏参考表示。我们发现,即使不修改模型,在推理时丢弃大部分参考标记仍能基本保持其生成能力。为充分释放这一潜力,我们采用不同比例的随机标记丢弃策略对模型进行微调,增强其对部分参考表示的鲁棒性。关键在于,这种训练策略使模型不再依赖特定标记选择规则,从而在推理时实现灵活控制。在推理阶段,我们采用任务感知的标记选择策略替代随机丢弃,优先保留参考图像中最具信息量的区域,并根据输入和任务需求动态调整标记预算。大量实验表明,该方法在多参考生成中实现4倍推理加速,在单参考生成中实现2倍加速。重要的是,这种效率提升并未牺牲空间对齐编辑和主体驱动生成场景下的视觉质量。 |
| CoorDex:协调身体与手部先验以实现连续灵巧的人形移动操作 |
Sikai Li |
2026-06-22 |
PDF |
人形机器人全身操作常被简化为"走走停停"流程:行走到物体旁、停下操作、再恢复移动。这类操作通常依赖低自由度末端执行器,仅能实现开合抓取等基础动作。我们提出CoorDex学习框架,将高维身体与灵巧手控制转化为协调的隐式残差控制,使高自由度灵巧操作可在移动中完成。该方法从全身与手部示教数据出发,分别训练人形身体与灵巧手的特权运动跟踪教师模型,将其蒸馏为基于本体感知的隐式先验,并将冻结的先验作为下游残差强化学习的动作空间。协调隐式残差策略通过共享任务上下文与独立的身体-手部残差头组合这些先验,在保持自然全身运动的同时提升手指级接触可靠性。CoorDex使配备20自由度WUJI灵巧手的宇树G1人形机器人能在移动中执行灵巧操作,包括不停顿抓取搬运瓶子、行进中打开冰箱门、抓取翻转方块等。在行走-抓取-搬运任务的消融实验中,关节空间PPO、关节空间手部控制及整体隐式预测在相同奖励预算下均失败,而隐式先验接口与协调残差结构使高维接触丰富的全身操作变得可训练。项目页面:https://skevinci.github.io/coordex/ |
| 语义浏览:图像生成的可控多样性 |
Sara Dorfman |
2026-06-22 |
PDF |
现代文本到图像模型在视觉保真度和提示遵循方面表现出色。然而,这种严格遵循是以多样性为代价的:生成的样本往往坍缩为单一的视觉解释。现有提升多样性的方法产生的输出由偶然变化驱动,而非有意义的设计选择。这催生了多样性任务的新变体,要求对生成样本施加结构约束。我们提出了一种可控多样性的方法,实现语义浏览功能——用户可导航结构化图像画廊,通过系统遍历有意义、可解释的变化轴进行创意探索。实现这种语义控制需要对场景有深刻理解。我们利用近期文本到图像模型基于精细描述训练的特性,有效将语义决策与像素生成解耦。这带来了范式转变:不再依赖文本到图像模型内的随机变化,而是直接在文本层面诱导多样性。通过利用丰富的文本表征,我们使视觉语言模型能够处理完整场景上下文。为克服标准视觉语言模型输出同质化的问题,我们采用智能体工作流,明确施加与原始提示相协调的结构化变化。实验证明,我们的方法能生成多样且可导航的设计空间,其中每个变化都对应一个用户可理解的特定语义决策。 |
| AIR:多模态大语言模型中基于代码的自适应交错推理 |
Cong Han |
2026-06-22 |
PDF |
继OpenAI o3引发的范式转变后,将代码与推理交错结合以增强多模态大语言模型(MLLMs)已成为关键研究前沿。现有文献主要关注视觉感知任务中的工具使用,但这类方法通常依赖预定义的视觉操作启发式规则,且因仅聚焦视觉操作而无法处理数值计算问题。本文通过扩展强化学习训练,在代码增强的复杂数值计算任务中赋予MLLMs自适应交错推理能力。为此,我们提出包含三个组件的综合解决方案:两阶段冷启动数据构建流程、用于强化学习数据集筛选的数据过滤策略,以及基于分组约束奖励函数的自适应工具调用策略(用于生成交错推理轨迹)。大量实验表明,采用分组约束奖励函数进行强化学习训练后,评估基准性能平均提升6.1个百分点。其中交错推理样本的准确率提升9.9个百分点,工具使用整体成功率超过95%。数据和代码已开源:https://github.com/CongHan0808/AIR.git |
| 开放问题:AdamW 在重尾噪声下是否有效? |
Dingzhi Yu |
2026-06-22 |
PDF |
AdamW是训练大型语言模型(LLMs)的事实标准优化器,但其背后的理论仍主要局限于有限方差场景。这一现状日益令人不满,因为实证证据表明,LLM预训练中的随机梯度噪声通常呈现重尾分布。近期研究表明,Lion和Muon等基于符号的优化器能达到尖锐的重尾收敛速率,而AdaGrad也能在重尾噪声下收敛。然而,目前尚未建立AdamW在此场景下的严格收敛理论。AdamW能否在相同的重尾假设下收敛?其二阶矩累积器是否构成实质性障碍?我们将此问题表述为开放性问题,证明了一个正加权度量基准,并通过走廊下界机制揭示了分母记忆如何隐藏大梯度。 |