跳转至

arXiv 2026-10-08

标题 作者 发布日期 PDF链接 摘要
Dex-One2Many:从单个人类演示中学习灵巧操作 Jusuk Lee 2026-10-08 PDF 尽管从单个人类视频中学习灵巧操作提供了一种有望替代昂贵机器人演示的方案,但许多近期方法主要模仿演示动作。这种严格的运动匹配往往限制了对视频中未出现的初始物体位姿、目标位姿和抓取的泛化能力。另一方面,通过强化学习(RL)发现策略可以实现广泛的泛化,但在缺乏先验指导的情况下,它难以在复杂的多阶段任务中进行高维探索。为了解决这些相互关联的泛化与探索挑战,我们提出了 Dex-One2Many,一个从真实到仿真再到真实的框架,能够从单个人类视频中学习可泛化的灵巧操作策略。我们的核心洞见是将视频抽象为序列化场景图,用以指导强化学习,从而在保持广泛泛化能力的同时实现高效探索。这些图作为生成性约束,用于采样多样化的重置状态,并为每个阶段提供密集奖励。由于这些图约束的是关系而非精确位姿,这些重置状态涵盖了视频之外的物体位姿和抓取,同时从这些状态初始化每个阶段并配合密集奖励,使探索保持简短且受引导。Dex-One2Many 完全在仿真中训练,并零样本迁移到真实多指手。在五项工具使用和操作任务中,Dex-One2Many 在已见配置上超过基线 6.5%,而其稳健的泛化能力在未见场景中将这一差距扩大到 71%。
评分标准-CEPR:通过奖励验证的自蒸馏实现自进化图像编辑 Ritesh Thawkar 2026-10-08 PDF 指令引导的图像编辑器已变得非常强大,但进一步提升它们仍然依赖于人工编辑的训练对或外部奖励模型。此类监督的获取成本高昂,并且可能奖励看似合理的失败:一个逼真的输出可能并未完成所请求的修改,或者改变了本应保留的内容。在这项工作中,我们致力于仅使用预训练图像编辑器自身的生成结果来改进它,而不依赖人工编辑的目标或外部训练时奖励模型。为此,我们提出了一个自演化框架,名为 Rubric-CEPR,它通过一个评分标准增强的对比编辑-保留奖励(CEPR),利用编辑器自身的内部表示来验证其自身样本。一个规划器从未标注图像中提出结构化编辑指令,编辑器采样多个候选编辑,一个冻结的评判器使用编辑器已经暴露的特征,通过分解的评分标准检查对每个候选进行评分,检查包括编辑实现、旧状态的移除以及内容保留。非补偿性门控拒绝不可行的候选,最佳验证候选通过轻量级适配器训练蒸馏到编辑器中。在 Qwen-Image-Edit 上,Rubric-CEPR 将 ImgEdit 从 4.36 提升到 4.60(+5.5%),在物体隔离上获得 +24.9% 的提升,并可迁移到 GEdit-Bench 和 Complex-Edit。相同的过程也在 ImgEdit 上将 Step1X-Edit 提升了 +7.8%。我们希望我们的方法能够为从自身验证样本中自我改进的图像编辑器提供一个坚实的基线。我们的代码公开于 $\href{https://riteshthawkar.github.io/Rubric-CEPR/}{\text{this URL}}$
DreamTrue:具有反事实后训练的动作忠实机器人世界模型 Junyan Li 2026-10-08 PDF 我们提出DreamTrue,一个多视角、跨本体的机器人世界模型,用于动作忠实且物理合理的视频预测。在现有机器人数据集上训练此类模型面临两个障碍:不精确的标定可能损害动作跟随,而对失败交互的覆盖有限可能使预测偏向成功结果。为提升跨本体的动作跟随,我们将动作轨迹渲染为图像空间条件,并引入离线几何标定以使这些条件与目标视频对齐。为拓宽交互覆盖,我们引入反事实后训练,修改记录的动作轨迹并在更广泛的动作与接触配置下生成未来视频。为在没有配对真实未来视频的情况下对这些预测提供反馈,我们构建了一个人工标注的视频数据集,涵盖机器人、物体和交互缺陷,并用其训练具身视频奖励模型。其评分引导强化学习后训练朝向更物理合理的交互结果。在AgiBot上,DreamTrue实现了最先进的动作跟随,同时将人工评估的交互缺陷率从48.12%降至6.25%。值得注意的是,我们的模型在AgiBot World Challenge 2026世界模型赛道中排名第一。项目页面见https://brave-eai.github.io/DreamTrue。
CSF:面向运动生成器的上下文安全过滤 Lizhi Yang 2026-10-08 PDF 文本条件运动生成器能够生成可跟踪的全身运动,但它们没有场景相关安全性的概念:同一个动作可能针对一个物体或一个人。现有的防护措施要么检查提示词,要么需要标注的运动数据,要么施加几何约束;因此,它们无法直接考虑场景上下文如何改变运动的含义。我们引入了上下文安全过滤(CSF),这是一种无需训练即可使用的过滤器,它将自然语言安全规则建立在生成器产生的安全和不安全参考轨迹之上。对于每条激活规则,安全和不安全参考轨迹定义了一个仿射安全值,由安全参考跟踪CBF-QP强制执行。在四种具有不同架构的预训练生成器上,CSF在所有显式和场景触发的不安全情况下激活预期规则,并将危险事件率降低多达90%,同时保留88-100%的良性运动。我们在真实的Unitree G1上演示了完整系统,它成功地在各种场景中防止了不安全运动,包括与人类和物体的交互。
关于AI时间跨度的估计与有效性——对METR图表的统计学审视 Drew T. Nguyen 2026-10-08 PDF METR的50%时间视野衡量的是AI以50%概率解决的软件任务的人类完成时间,使AI能力能够以可解释的单位表达。在228个任务和26个AI上,我们使用样条和项目反应理论重新计算时间视野,以放宽任务对AI的难度线性依赖于人类时间对数的假设。我们拟合的样条可解释为一个将人类时间\emph{转换}为AI难度的函数;它在2至30分钟的区域几乎平坦,但在其他地方接近线性。因此,尽管倍数同为$10 \times$,从3分钟到30分钟的时间视野跃升比从30分钟到5小时容易得多。总体而言,我们贡献了时间视野的点估计,其在交叉验证的适当评分规则套件下表现更好,并提供了用于评估时间视野构念效度的诊断图。我们建议将时间视野与诊断图一起解读,尤其是在提出新的基于时间视野的基准或现有基准扩展到包含更长任务时。
平衡数据饮食:解决机器人控制中大规模强化学习的探索瓶颈 Octi Zhang 2026-10-08 PDF 通用机器人必须执行从敏捷运动到灵巧操作的各种任务。尽管仿真到现实的强化学习已被证明是实现这一目标的有用工具,但当前的强化学习流程依赖于工程量大、针对特定任务的结构化先验,例如塑形奖励和演示。近期工作表明,多样化的仿真器重置结合大规模并行仿真,可以减轻若干操作问题上的大量工程负担。然而,我们发现将这一范式简单地扩展到更精确或更动态的问题仍然并非易事。虽然仿真器重置有助于探索,但在该分布上均匀采样会将越来越大比例的学习经验浪费在策略已经掌握或尚无法尝试的任务配置上。这使得难以看到为强化学习扩展并行环境所带来的预期收益,因为批次中的大量学习信号在学习过程中被浪费。为缓解这一问题,我们引入了成功引导采样,一种简单的自适应采样器,它将强化学习训练集中在策略能力前沿附近的任务配置上。这样做使大规模仿真强化学习能够充分利用批次中的经验,从而更有效地扩展到大规模并行仿真。在使用多达$2^{20}$(超过一百万)个并行环境的实验中,成功引导采样使强化学习能够解决先前方法无法解决的具有挑战性的多地形四足运动和高接触装配任务。最后,我们将学到的操作策略蒸馏为基于RGB的策略,并展示了在真实硬件上对若干具有挑战性的装配任务的零样本迁移。项目网站:https://sgs-rl.github.io/。
从被动遏制到主动保障:来自OpenAI、Anthropic和Google智能体安全事件的教训 Abbas Raftari 2026-10-08 PDF 2026年,涉及OpenAI、Anthropic和Google智能体的网络安全评估触及了其授权测试范围之外的真实系统。路径各不相同。OpenAI的智能体利用了研究基础设施,跨运行进行协调,并侵入了Hugging Face生产环境的部分区域。Anthropic报告了多起案例,其中配置错误的第三方环境将真实系统暴露给了执行模拟网络任务的智能体。在另一项单独报告的评估中,Google的Gemini通过一条非预期的互联网路径访问了三家真实组织;Google表示该模型在三次实例中均自行停止。综合来看,这些案例表明评估为何不能依赖假定的边界。该边界必须在智能体运行期间得到验证。本比较性工具案例研究提出了主动式智能体安全保障周期(PASAC)和五层边界保障栈。该框架结合了风险分级任务设计、可执行范围契约、运行前验证、最小能力访问、独立出口管控、凭证限制、跨运行监控、自动停止条件以及基于证据的重新授权。一个先行指标模型、九项设计命题和七项可证伪假设将这些经验转化为可测试的研究计划。由于公开的Gemini记录仅限于归属声明和新闻报道,其详细因果机制仍属暂定。核心结论直截了当:主动式智能体安全需要对整个执行系统进行持续保障,而非对任何单一沙箱或防护措施的信心。
3万小时的自我中心视频无法教会什么 Jiahua Dong 2026-10-08 PDF 世界模型为基于物理的模拟器提供了一种有前景的替代方案,但距离实际部署仍很遥远。我们探究,以自我为中心的人类视频扩展到何种程度才能推动世界模型走向实用,为此使用了一个包含3万小时、涵盖1000多种场景类型和14000名贡献者的数据集。我们没有依赖不透明的下游指标,而是直接在一个具有挑战性的分布外基准上评估智能体和物体交互的保真度。将训练数据扩大100倍对两者都有改善,但程度不均:智能体被建模得很好,而物体保真度仍然低得多且改善缓慢。我们表明,智能体的提升未必来自数据,而一个精心的视觉条件设计能以一小部分数据使保真度饱和,这使我们能够单独测量物体保真度并发现其饱和点。随后我们引入一种监督方案,将容量从场景外观转向物体动态,改善了物体保真度,尽管仍存在相当大的差距。最后,我们的结论可迁移至下游的人形建模。总体而言,我们的结果表明,扩展以自我为中心的数据使智能体建模接近其极限,却让其对世界的影响远远落后,而弥合这一差距将取决于模型如何训练,而不仅仅是它们看到多少数据。
OuroWorld:将任意3D世界变为多样、无限循环的3D动态摄影 You-Zhe Xie 2026-10-08 PDF 近期的3D世界模型能够生成照片级真实、可探索的场景,但这些场景在时间上是静止的。OuroWorld是一个无需掩码的框架,可将任何静态3D高斯泼溅场景转化为3D动态影像:一种具有生动、多样运动且能从任意视角无缝循环的动态场景。一个视觉语言模型推断合理的动态并引导视频模型合成参考视频,我们将其提升并补全为多视角视频。为了从这种不完美的监督中学习,我们提出了不一致性鲁棒周期性4DGS:一个傅里叶级数变形场通过构造保证循环性,而一个锚定在参考视图的接地漂移场吸收跨视图不一致性。与先前仅限于类流体运动的欧拉方法不同,我们捕捉一般变形、物体运动和光照变化。我们引入了一种无需真值的评估,涵盖生动性、自然性、循环接缝连贯性和场景质量。在39个重建和生成的场景上,OuroWorld优于所有基线,并在70.8%-99.0%的用户研究比较中获胜。项目页面:https://ouroworld.userwei.com
WorldGuide:面向程序化任务执行的目标导向视频世界模型 Ankan Deria 2026-10-08 PDF 视频生成器和基于视频的世界模型能够合成看似合理的视觉轨迹,但长时程程序性任务要求生成过程能够适应实际产生的结果。模型必须根据其生成的状态确定下一步动作,执行该动作,并识别任务何时完成。开环生成无法适应执行结果,而现有的闭环系统通常依赖预训练执行器或间接验证。这在决定动作与成功实现动作之间留下了差距。我们将程序性视频生成形式化为视觉世界空间中的闭环任务执行,并引入WorldGuide。仅给定初始图像和任务目标,WorldGuide预测一个原子动作,生成其对应的视频片段,并利用生成结果选择下一个动作或终止。规划器和执行器在相同的步骤级程序性演示上训练:规划器学习从视觉进展中预测下一个原子动作或任务完成,而执行器则直接训练以实现预测的动作。分层视觉记忆在有界历史token成本下维持长时程执行中的状态。由于缺乏用于联合规划器-执行器训练的步骤级动作-视频监督,我们引入了WorldGuide Bench:涵盖245个任务和27个程序性类别的约59K步骤标注视频。WorldGuide在WorldGuide-Bench上达到33.33%的任务成功率,而近期强视频模型MiniMax-H3为29.90%,尽管MiniMax-H3接收了参考动作计划;在VideoCraft-Bench上达到47.69%,而MiniMax-H3在仅目标条件下为32.73%。这些结果证明了将规划与学习到的执行耦合对于目标导向程序性视频生成的重要性。