跳转至

arXiv 2026-07-07

标题 作者 发布日期 PDF链接 摘要
从固定到自由相机:无标定视角鲁棒的视觉-语言-动作模型 Wenhao Li 2026-07-06 PDF 真实世界中的机器人部署很少能保持训练阶段的相机设置,实际场景中相机常因环境需要而重新定位或安装。现有视角鲁棒的视觉-语言-动作(VLA)策略仅在明确提供相机外参时才能容忍此类相机变化,这使其在视角鲁棒性至关重要的场景中脆弱且难以使用。我们认为策略不应被告知相机位置,而应自行推断。为此,我们提出以相机为中心的VLA(CamVLA),这是一种新型VLA模型,通过预测(i)在局部相机坐标系中表达的以相机为中心末端执行器动作,以及(ii)连接相机与机器人基座的6自由度手眼矩阵,将操控控制与相机几何解耦。确定性几何变换将这两个预测组合为机器人基座坐标系动作。这实现了"我应如何移动"(姿态无关的以相机为中心动作生成)与"我从何处观察"(相机视角几何定位)的分离。所得策略无需标定、无需深度信息且仅需单目RGB图像作为视觉观测和任务指令即可部署。在仿真和真实机器人数据上的评估表明,CamVLA在多种未见视角下持续提升任务成功率。项目页面:https://alibaba-damo-academy.github.io/CamVLA/
通过直接在线策略蒸馏实现的弱到强泛化 Shiyuan Feng 2026-07-06 PDF 基于可验证奖励的强化学习(RLVR)是提升语言模型推理能力的有效方法,但每次在新强模型上重复该过程成本高昂,因为训练期间目标模型需要生成大量轨迹。随着模型规模扩大,后训练本身成为瓶颈。我们研究了一种弱到强的替代方案:在轨迹成本更低的较小模型上运行强化学习,然后将该强化学习过程学到的成果复用于改进更强的目标模型。直接蒸馏强化学习后的弱教师模型并不足够,因为教师模型的最终策略混合了强化学习的有效增益与小模型的局限性。我们提出直接在线蒸馏(Direct-OPD),该方法转移教师模型由强化学习引发的策略偏移。Direct-OPD将强化学习后的教师模型与其强化学习前的参考模型进行对比,将两者的对数比值作为学生模型的密集隐式奖励。简言之,检查点对告诉我们强化学习使弱模型更可能或更不可能采取哪些动作,而Direct-OPD将该信号应用于更强学生模型自身的在线状态。这直接复用了弱模型的强化学习监督信号,无需训练显式奖励模型或在目标模型上运行稀疏奖励强化学习。实验表明,Direct-OPD能持续利用弱教师模型改进更强目标模型;值得注意的是,在8块A100 GPU上仅用4小时,它将Qwen3-1.7B在AIME 2024上的成绩从48.3%提升至62.4%。该方法优于步数匹配的直接强化学习,并支持多个策略偏移的顺序组合。我们的结果表明,强化学习成果可作为隐式奖励信号跨模型规模复用,而不仅仅是作为待模仿的最终模型。
可解释的无人类标签深度学习用于带不确定性量化的真实-虚假分类 Raphaël Bonnet-Guerrini 2026-07-06 PDF 时域巡天会产生大量暂现源候选体,使得真实-虚假分类成为自动化发现流程中的关键步骤。可靠标签成本高昂,而社区标签可能存在噪声且依赖巡天项目。我们旨在开发一种无需人工标注数据即可训练的真实-虚假分类框架,该框架利用注入的暂现源和以虚假源为主的巡天数据,在强类别污染下保持鲁棒性,并提供校准的不确定性量化。我们结合模拟暂现源注入与受污染的巡天类别,采用非对称协同教学法训练双网络模型以应对不同标签噪声水平的类别。在基准子集上评估性能,并通过潜空间可视化工具分析学习到的表征。在不确定性量化方面,我们比较了MC Dropout和深度集成方法,并提出一种利用双网络设置改进校准的低成本混合策略。将评估扩展至光变曲线领域以检验光变曲线类别的恢复能力。该方法在标注子集上实现了优异的真实-虚假分类性能,并在严重类别污染下保持稳定。它能高保真度恢复暂现源光变曲线类别,但单源识别受限于光变曲线衍生标签的模糊性。我们的混合不确定性量化方法在竞争性校准方面与更昂贵的集成基线相当。潜空间分析表明不确定性沿决策边界分布,并揭示了虚假源群体内的子类别。研究结果表明,注入驱动的弱监督训练可在无需人工标注训练数据的情况下实现可扩展且一致的真实-虚假分类,同时提供校准的不确定性。该方法适用于通过重新运行基于注入的训练流程迁移至后续巡天项目。
SynCity 3000:场景级3D扩散的自举方法 Paul Engstler 2026-07-06 PDF 我们提出SynCity 3000框架,用于生成全局连贯且支持细粒度布局控制的3D场景。基于当前图像转3D生成器从单张图像生成复杂3D资产的能力,我们通过将生成器适配为可卷积算子,将这一能力扩展至整个场景规模。为此,我们使用新型合成数据引擎生成的场景类数据对模型进行微调——该引擎旨在解决训练所需3D场景数据稀缺的问题。随后,将卷积生成器应用于根据用户提示生成的整个场景的等轴测图像,即可生成任意尺寸与复杂度的3D场景。在多样化的提示与布局条件下,SynCity 3000能生成大规模、连贯且细节丰富的场景,有效弥补了现有3D场景生成方法的不足。
LLM作为验证器:一种通用验证框架 Jacky Kwok 2026-07-06 PDF 扩展预训练、后训练和测试时计算已成为提升大语言模型能力的核心范式。在本研究中,我们识别出验证能力——即判断解决方案正确性的能力——作为新的扩展维度。为释放这一潜力并证明其有效性,我们提出LLM-as-a-Verifier这一通用验证框架,无需额外训练即可为智能体任务提供细粒度反馈。与标准语言模型评判者不同——后者通过提示大语言模型为候选方案生成离散分数——LLM-as-a-Verifier通过计算评分令牌对数概率分布的期望值来生成连续分数。这种概率化公式使验证能在多个维度扩展:(1)评分粒度,(2)重复评估,(3)标准分解。具体而言,我们证明扩展评分粒度能更好地区分正负解决方案,从而实现更校准的比较。此外,通过方差和复杂度降低,扩展重复评估与标准分解能持续提升验证准确率。我们进一步提出一种成本高效的排序算法,利用验证器的连续分数从候选方案中选出最优解。LLM-as-a-Verifier在Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和MedAgentBench(73.3%)上均达到最优性能。除验证外,LLM-as-a-Verifier的细粒度信号还可作为任务进展的代理估计指标。我们为Claude Code构建扩展功能,使开发者能够监控并改进自身的智能体系统。最后,我们证明LLM-as-a-Verifier能为强化学习提供密集反馈,在机器人学和数学推理基准测试中提升SAC和GRPO的样本效率。
Deform360:面向可变形世界模型的大规模多视角视觉触觉数据集 Hongyu Li 2026-07-06 PDF 预测物体动力学(即世界建模)是机器人操作中的基础挑战,而可变形物体的建模因其高维状态空间和复杂材料特性尤为困难。当前世界模型通过两种不同范式解决这一问题:在二维像素空间或更明确的三维几何空间学习动力学。由于缺乏多样化的大规模真实世界数据,对这两种范式相对优势与局限的系统性认知仍不明确。为此,我们提出Deform360——一个大规模视觉触觉数据集,包含198个日常物体、1,980次交互序列,以及来自41台环绕相机和双手触觉夹爪的超过215小时观测数据,可同时捕捉全局运动与接触引发的局部形变。通过新型无标记视觉触觉三维追踪管线提取密集几何与运动信息,我们系统评估了当前最先进的世界模型,对比了二维视频模型与三维粒子模型。最后,我们通过执行可变形物体的机器人规划任务,初步验证了数据集在真实世界的适用性。分析揭示了结构先验与可扩展性之间的权衡关系,为未来可变形物体中心化世界模型的泛化研究提供了坚实基准。项目网站:https://deform360.lhy.xyz
InFlux++:用于估计动态相机内参的真实与合成数据 Erich Liang 2026-07-06 PDF 相机内参对于从2D视频恢复3D结构至关重要。然而,大多数3D算法假设整个视频中内参固定不变,这一假设在真实世界的野外视频中往往不成立。因此,从RGB图像估计逐帧内参对于使3D方法能够稳健处理动态内参视频至关重要。InFlux此前通过建立首个包含动态内参视频逐帧真实内参标注的真实世界基准,推动了这一研究方向。然而,现有方法仍因两大障碍而不够准确:(i)训练数据稀缺且缺乏内参多样性;(ii)包括InFlux在内的基准数据集场景和相机运动多样性有限,难以有效评估方法。为填补这两项空白,我们提出InFlux++,包含两个组成部分。InFlux++ Synth是一个大规模程序化生成的合成视频数据集,包含来自1841个高分辨率视频的44.1万+标注帧,为训练动态内参预测模型提供精确的逐帧真实内参;其中子集还包含逐帧姿态、深度和法线。这些视频通过相机变焦和对焦变化、动态物体以及镜头畸变和散焦模糊等逼真渲染效果,呈现出丰富的内参多样性。InFlux++ Real是一个大规模真实世界基准,在InFlux基础上扩展了33.4万+新采集帧,涵盖334个高分辨率视频,覆盖更广泛的场景和相机运动范围。在InFlux++ Synth上微调现有内参预测方法,可持续提升InFlux++ Real和InFlux上的焦距估计精度,表明合成监督对基于RGB的内参预测具有前景。数据集、基准、代码、视频、提交指南及实时排行榜请访问https://influx.cs.princeton.edu/。
超越可教授范畴的探索:演进智能体视觉生成中的知识边界 Haozhe Wang 2026-07-06 PDF 视觉生成器在渲染方面表现出色,但会自信地编造未知内容。用户需求无限、持续演变且呈深度长尾分布:新角色、热门实体、截止日期后的事件等层出不穷。这种世界知识瓶颈具有结构性:生成器基于固定语料库训练,而视觉世界却是开放式的。我们构建了SearchGen-20K和SearchGen-Bench,包含覆盖十二个失败类别和二十二个领域的20,839条提示词,并配套预执行的多模态SearchGen-Corpus-1M语料库,以支持离线可复现研究。在SearchGen-Bench上,前沿开源生成器得分仅为21至28分(满分100分),较现有基准出现40分的断崖式下跌。自然解决方案是采用搜索工具实现智能体式视觉生成。然而我们发现,简单搜索会失效:它不加区分地检索信息,向生成器已能处理的提示词中注入噪声。我们将根本原因追溯至生成器特有的动态知识边界——即生成器通过训练内化的知识与必须保留在外部上下文中的知识之间的分界。尽管该边界难以预先界定,但我们证明可通过"先教学后搜索"的协同训练框架发现它。即使该协同训练方法的最小化版本也能产生单调改进,为满足世界知识驱动需求的视觉生成递归式自我改进奠定基础。我们发布完整数据集、协同训练语料库和搜索语料库,作为支持工具增强型世界知识驱动视觉生成的可复现研究框架。
离散扩散模型学到了什么? Rodrigo Casado Noguerales 2026-07-06 PDF 离散扩散模型学习的是什么:去噪器、得分比率,还是桥接插件预测器?在跳变率层面,这些对象在不同坐标系下是同一实体,而用错误坐标系解读神经网络会改变训练和采样的过程。我们从任意加噪过程(含边界项)的连续时间马尔可夫链(CTMC)ELBO的严格推导出发,证明了“预言距离定理”:负ELBO精确等于数据熵加上从预言逆过程到学习过程的路径KL散度,而不仅仅是上界。因此其唯一优化器是给定当前噪声状态时真实逆跳变率的条件期望,其不可约代价是前向过程$Z_t$破坏干净数据$Z_0$信息的速度$-\tfrac{d}{dt}I(Z_0; Z_t)$,故所有加噪过程共享相同的最优负ELBO:数据熵。对于具有token因子化噪声的序列,预言投影给出了优化器的三个精确坐标:去噪器、空穴(桥接插件)和得分,三者间存在闭式转换。该框架识别了文献中各损失函数实际优化的定律,将MDM、UDM、SEDD和GIDD作为特例统一;解释了为何去噪器和空穴在掩码扩散中一致但在均匀扩散中不同;证明了去噪器参数化会使均匀ELBO在初始化时发散而桥接插件保持有限;并精确校准了初始化时的ELBO实现。所有恒等式均在可精确求解模型上通过数值验证,无需近似。
TabPack:面向表格深度学习的超参数高效集成方法 Yury Gorishniy 2026-07-06 PDF 在表格数据的深度学习中,高效的多层感知机(MLP)集成方法近期已成为实用且有效的架构。现有此类方法对所有底层MLP使用相同超参数,这需要超参数调优才能达到最佳性能。本文提出TabPack——一种高效MLP集成方法,具备开箱即用的强大性能,并降低了对传统调优的依赖。在单次运行中,TabPack并行采样并训练大量具有不同超参数的MLP,并在训练过程中动态选择集成成员。因此,TabPack仅需指定MLP超参数的采样范围而非精确值,自然降低了对精度的要求。在中等至大规模公开数据集上的实验中,采用默认设置的TabPack性能与经过充分调优的现有方法相当,从而显著减少了在表格任务中取得竞争性结果所需的工作量和计算资源。值得注意的是,在当代MacBook上运行默认TabPack配置所耗时间,甚至少于在工业级GPU上调优某些基线模型所需的时间。