| VLK:在重建场景中通过合成交互学习人形机器人的操作与移动 |
Yen-Jen Wang |
2026-06-29 |
PDF |
基于感知的人形机器人移动操作需要将自我中心观察与任务指令连接至全身运动。学习这种映射需要同步的自我中心图像、语言指令和机器人兼容的运动学轨迹,但现有数据源无法大规模提供完整的三元组。我们通过在重建场景中合成视觉-语言-运动学(VLK)监督来解决这一瓶颈。我们的流程利用3D高斯泼溅重建公制尺度室内环境,利用特权场景信息合成导航和物体交互轨迹,并在事后渲染配对的自我中心观察。我们无需人工干预即生成48,000条配对轨迹,并训练一个预测短时域全身运动学轨迹的VLK策略。全身跟踪器将这些预测转化为物理人形机器人的动作。我们在物理Unitree G1上执行导航和单物体运输任务进行评估,证明重建场景中的合成交互可为基于感知的人形机器人移动操作提供有效的仿真到现实监督。项目网站:https://vision-language-kinematics.github.io/ |
| LeVo 2:通过分层表示建模与渐进式后训练实现稳定悦耳的歌曲生成 |
Shun Lei |
2026-06-29 |
PDF |
全长歌曲生成必须保持连贯性和音乐性,呈现精细的人声与伴奏声学细节,并遵循歌词和提示。现有基于语言模型的系统面临结构性权衡:混合令牌建模能保持声乐与乐器的协调性,但模糊了轨道特定细节;而双轨预测虽能改善声学效果,却需要更长的序列并削弱全局规划能力。我们提出LeVo 2——一种用于可控全长歌曲生成的混合LLM-Diffusion框架。LeVo 2将这种权衡转化为分层建模:LeLM首先预测混合令牌进行语义规划,随后并行预测人声和伴奏令牌进行轨道特定细化,同时基于扩散的音乐编解码器重建全长波形。本扩展版本的核心贡献在于引入美学引导的对齐训练策略。预训练阶段,自动化音乐美学评估框架为大规模数据分配音乐性层级条件,在偏好对齐前提供音乐性先验。渐进式后训练依次应用SFT、大规模离线DPO和闭环半在线DPO,分别提升生成质量、可控性和音乐性。模块化扩展随后训练轨道特定语言模型进行声学细化,同时保留对齐后的语义规划器。该策略将音乐性学习、可控性对齐和声学细化分离,缓解了优化冲突和静态离线偏好对的局限性。专家听测与客观评估表明,LeVo 2在六个主观维度上超越开源基线,并在多项听感指标上接近领先商业系统。消融实验验证了训练策略、美学引导、规模扩展和分层架构的有效性。 |
| 面向LLM智能体规划的自演化世界模型 |
Xuan Zhang |
2026-06-29 |
PDF |
世界模型为长程LLM智能体提供了一种原则性的前瞻能力:在执行前预测行动后果。然而,不可靠的前瞻可能被忽略、误用,甚至损害下游决策。本文提出WorldEvolver,一种自我进化的世界模型框架,它在保持下游智能体和所有模型参数冻结的同时,修正部署时的上下文。WorldEvolver集成三个模块:(i) 情景记忆,通过基于检索的模拟利用真实行动转换;(ii) 语义记忆,从预测-观测不匹配中提取持久启发式规则;(iii) 选择性前瞻,在将低置信度预测整合到智能体推理上下文前进行过滤。我们在ALFWorld和ScienceWorld上评估WorldEvolver,在Word2World上测量世界模型预测准确率,在AgentBoard上测量下游智能体成功率。大量实验表明,WorldEvolver在三个骨干网络上取得最高预测准确率,并在下游智能体成功率上领先其他世界模型基线,证明测试时记忆修正能同时提升预测保真度和规划性能。 |
| 使用2D检测器实现3D高斯分布的开放词汇与指代分割 |
Jameel Hassan |
2026-06-29 |
PDF |
3D高斯泼溅(3DGS)已成为三维场景重建领域的领先技术。将3DGS与语言驱动的开放词汇理解相结合,在具身智能等实际应用中备受关注。现有方法通过学习实例特征属性,并通过将高维对比语言-图像预训练(CLIP)特征直接蒸馏到场景表征中来实现语义分配。然而,这些方法的实例分组机制要么需要预定义实例数量,要么在自底向上分组策略中受噪声干扰。此外,对CLIP的依赖将语义理解限制在简单名词短语层面,无法实现复杂空间推理和指代表达定位。我们提出GaussDet方法,通过利用具备指代表达能力的离散开放词汇二维目标检测器,规避了对密集CLIP特征的需求。我们为每个高斯体学习实例特征,将场景分解为三维实例组。通过渲染这些分组并聚合多视角二维检测的语义投票,为每个三维实例生成鲁棒的视图聚合语义标签分布(VASD)。这种视图聚合策略作为强正则化器,能有效抑制低质量实例分组导致的伪标签。该方法支持从简单语言查询到复杂指代定位的直接零样本扩展。在开放词汇分割(LeRF-OVS, ScanNet)和指代表达定位(Ref-LeRF)两项关键任务的广泛评估表明,GaussDet相比现有方法取得了一致性改进。最值得注意的是,在严格零样本设置下,我们在指代定位任务中实现了16.7% mIoU的显著提升。 |
| 一步梯度延迟并非大规模异步流水线并行大语言模型预训练的障碍 |
Philip Zmushko |
2026-06-29 |
PDF |
现代大规模LLM预训练得益于流水线并行技术,但同步实现方式会在流水线气泡期间导致GPU闲置,造成计算资源浪费。异步流水线并行消除了这些气泡,以梯度陈旧性为代价最大化吞吐量。在异步调度方案中,PipeDream-2BW尤为突出:与原始PipeDream调度不同,它确保无论流水线深度如何,梯度延迟始终恒定为一个步骤。然而,由于普遍认为在陈旧性条件下进行优化本质上不稳定,其应用仍十分有限。本研究挑战了这一假设,证明单步延迟下的性能退化主要取决于优化器选择,而非固有局限。我们首次提供全面实证分析,表明当PipeDream-2BW提出时占主导地位的AdamW优化器确实存在严重退化,而Muon等近期方法在单步延迟下展现出强鲁棒性。我们引入一种与优化器无关的误差反馈修正方法,进一步缓解延迟影响,并提供支持性理论分析证明Muon在有无该修正时的收敛性。在高达100亿参数的模型上进行的广泛评估证实,我们的策略弥合了与同步训练的性能差距,凸显了大规模异步流水线并行的实际潜力。 |
| GROW²:为机器人工具使用确定“哪个”和“哪里” |
Yuhong Deng |
2026-06-29 |
PDF |
如果没有刀,机器人能用盘子切蛋糕吗?工具使用极大地扩展了机器人的能力,但要创造性地使用工具超出其预期功能,机器人面临开放世界可供性定位的挑战:选择一个开放类别的物体作为工具,并定位其具体作用区域。为此,我们提出GROW$^2$(定位哪个物体及何处),利用物体部件作为自然抽象,将定位过程分层为语义和几何两个层面,从而避免了对数据密集型端到端训练的需求。在语义层面,GROW$^2$利用视觉语言模型的常识推理解析自然语言任务指令,选择合适的物体作为工具,并识别工具和目标物体上任务相关的部件。在几何层面,视觉基础模型随后从单张RGB-D图像中将所选部件定位到精确的三维区域。在已有基准上的实验表明,GROW$^2$在可供性预测基准上优于最先进的基线方法。此外,它在开放类别物体上实现了零样本泛化,并在模拟和真实世界的机器人工具使用实验中均优于基线方法。 |
| 悲观主义悖论:保守离线训练在推理模型在线适应过程中加剧奖励黑客行为 |
Subramanyam Sahoo |
2026-06-29 |
PDF |
保守离线训练被广泛视为后续在线适应的安全基础:其逻辑是,若策略与有充分依据的行为保持接近,则不太可能利用学习到的奖励模型中的缺陷。我们通过实证和机制分析挑战了这一直觉。我们使用三种保守程度(基于经验对数比率百分位数得到的β∈{β_lo, β_mid, β_hi})在直接偏好优化(DPO)下训练Qwen3-14B策略,随后针对学习到的奖励集成模型(3×Qwen3-1.7B)在线调整每个检查点,同时测量GSM8K精确答案准确率上的真实性能。我们发现,更高的离线保守性会单调增加奖励破解损害(通过Goodhart差距及其曲线下面积AUGC衡量),在所有三种条件下Spearman ρ=1.0。机制分析揭示了一个三环节因果链:(i)高β DPO压缩策略熵;(ii)低熵策略生成的响应多样性降低,集中在奖励模型训练分布的狭窄区域(更低的成对余弦距离);(iii)尽管存在这种接近性,集成模型的不一致性(认知不确定性)随β增加,并在在线优化过程中被更快利用。我们进一步对(β, AUGC)数据拟合幂律曲线,并确定了平衡对齐保真度与破解脆弱性的实用最优保守水平β*。我们的结果表明,该领域需要的是校准后的保守性,而非最大化的保守性。 |
| DOPD:双重在策略蒸馏 |
Xinlei Yu |
2026-06-29 |
PDF |
同策略蒸馏(OPD)通过密集的令牌级信号监督学生模型采样的轨迹,实现了更优的能力迁移。为提供高质量监督源并提升蒸馏性能上限,一个直观方向是将特权信息注入教师模型或学生模型本身。然而,这种额外输入会引发我们称之为"特权幻觉"的潜在失效模式:这种模式混淆了学生本应弥合的可迁移能力差距,与只能模仿而无法复现的信息不对称差距。令牌级监督固有的非均匀性进一步放大了该问题——仅少数令牌承载关键能力信号。为此,我们提出DOPD,一种优势感知的双重蒸馏范式,基于优势差距和相对概率在特权教师策略与特权学生策略之间动态路由令牌级监督。每个令牌从教师或学生自身获得不同强度、目标和策略的监督,在接收辅助信号的同时传递可信能力,以缓解特权幻觉。在大型语言模型(LLM)和视觉语言模型(VLM)场景中的大量实验表明,DOPD始终优于普通OPD及其他对比方法。稳定性、鲁棒性、持续学习和分布外任务的进一步结果验证了其优越性。 |
| 优化动态在对比嵌入范数中印刻语义特异性 |
Ziwei Su |
2026-06-29 |
PDF |
使用尺度不变损失训练的对比嵌入模型通常与余弦相似度等距离度量配对,从而有效忽略嵌入向量的模长。然而令人惊讶的是,实证研究表明,这些被"舍弃"的模长实际上与概念具体性、词元频率和人类不确定性等语义属性存在关联。本研究为该现象提供了形式化的理论框架。通过分析优化动态过程,我们推导出解析公式,证明嵌入长度作为训练过程的副产品自然编码了此类信息。同时揭示该机制如何产生信号,使其在特定模型和检索任务中充当"免费"校准工具,为先前基于经验观察的现象提供了理论依据。 |
| 遗传算法之所以能在高维搜索空间中有效工作,是因为它们通过种群搜索、交叉和变异等操作,能够并行探索多个区域,避免陷入局部最优,同时利用适应度函数引导搜索方向,从而在高维空间中高效地找到近似最优解。 |
Stephen Whitelam |
2026-06-29 |
PDF |
我们证明,在突变极小的极限下,精英主义$(1+M)$遗传算法的有效动力学相当于存在各向异性高斯白噪声时对损失函数的裁剪梯度下降。因此从期望值来看,简单的突变-选择遗传算法无需显式计算梯度,也无需对损失评估进行平均,即可沿损失函数的梯度方向演化。由于噪声在梯度正交方向上的作用,遗传算法比梯度下降更慢。然而这种减速并非由搜索空间的参数数量决定,而是受限于损失函数海森矩阵的有效秩。对于神经网络损失函数中常见的集中型海森谱,有效秩可能远小于参数数量,这或许解释了遗传算法为何能扩展至大规模搜索空间。 |