| 学习跨实体机器人操作的动作先验 |
Dong Jing |
2026-06-24 |
PDF |
大多数视觉-语言-动作(VLA)模型以视觉-语言模型(VLM)为骨干,通过附加动作模块并联合优化完整策略来构建。这种设计继承了VLM强大的视觉和语言先验知识,但导致动作模块几乎从零开始学习物理运动。因此,策略缺乏显式的运动先验,迫使早期优化同时发现时间动作动态和跨模态对齐,这一挑战在跨本体场景中尤为突出。本文提出在跨模态VLA对齐之前,先用运动先验预训练动作模块。具体而言,我们引入两阶段训练框架,在VLA训练开始前为动作模块配备跨本体的时间运动结构。第一阶段,基于流匹配的轻量级编码器-解码器动作模块仅通过无条件的动作轨迹高效学习时间运动结构,无需处理视觉或语言标记。第二阶段,通过解码器复用和早期潜在蒸馏将学习到的先验迁移至VLA训练,在保持端到端策略优化的同时,实现视觉-语言特征与动作嵌入空间的对齐。此外,训练后的编码器可作为紧凑的历史压缩器,将状态-动作历史汇总为单个时间上下文标记,以极低成本实现历史感知建模。在模拟和真实平台的13项跨本体任务中的大量实验验证了本方法的有效性。与无动作先验的VLA训练相比,我们的模型收敛更快、成功率更高,在数据稀缺的真实任务中表现显著增强。此外,扩大第一阶段动作数据规模可获得更具泛化性的动作先验,直接提升下游VLA性能。 |
| RevengeBench:从行为实验中逆向工程代码空间策略 |
Babak Rahmani |
2026-06-24 |
PDF |
在科学史的大部分时间里,研究行为的研究者只能通过外在行为推断隐藏机制:这是一个逆问题,当观察辅以定向干预时,其可解性会提高。我们提出一个计算类比:给定智能体在游戏环境中仅有的行为轨迹,学习者能否将底层决策程序重建为可执行代码?这种重建能力在能够设计受控实验时能提升多少?我们引入RevengeBench基准测试,包含75个由大语言模型生成、经Elo校准的策略,覆盖五个游戏环境,这些策略源自CodeClash锦标赛轨迹。学习者观察隐藏目标策略与采样对手的对局,并通过设计自定义对手策略(即行为探针)来引发信息性行为。随后,学习者提交可执行假设,并使用连续动作距离指标进行评估。我们进一步验证,恢复的代码在下游玩家对玩家锦标赛中携带信息性信号。在十二个前沿大语言模型中,恢复质量差异显著(初始距离缩小34%至72%),重建策略带来可衡量的竞争优势,尤其对于难以设计有效反制策略的较弱模型。我们的基准测试将程序化策略的行为恢复定位为代码空间中的一个可解逆问题,为对手建模、策略可解释性以及从观察中推断潜在机制这一更广泛问题开辟了路径。 |
| TryOnCrafter:通过可渲染的4D试穿代理释放相机轨迹,实现逼真的视频虚拟试穿 |
Hao Sun |
2026-06-24 |
PDF |
视频虚拟试穿(VVT)在动态主体上合成逼真衣物覆盖方面取得了显著进展,但现有范式仍受限于对源相机轨迹的被动依赖,无法满足全方位视角探索所需的交互自由度。为解决这一局限,我们定义了一个开创性研究方向:相机可控视频虚拟试穿(CaM-VVT)。与传统VVT不同,CaM-VVT不仅需要视角无关的纹理幻化,还要求在任意无约束相机运动下实现非刚性人体动态与背景场景的严格结构同步。为应对这些挑战,我们提出TryOnCrafter——首个专为CaM-VVT任务设计的统一DiT框架。不同于隐式像素空间操作,我们引入可渲染4D试穿代理,将人体主体与环境显式解耦。通过将高保真2D试穿先验蒸馏到基于3DGS的穿衣虚拟化身中,随后利用SMPL-X序列驱动该化身,并将其度量对齐至重建的背景点云。该代理以卓越的纹理密度和运动完整性构建了稳健的结构基础。我们的代理锚定视频DiT将这一稳健结构基础作为主要几何锚点,确保合成逼真视频严格受预设轨迹和物理合理形变约束。得益于4D代理的固有可编辑性,TryOnCrafter支持多种下游应用,包括人体重定位、"子弹时间"特效及360度环绕视角。 |
| 基于采样演示的同策略自蒸馏减少输出多样性 |
Andrei Liviu Nicolicioiu |
2026-06-24 |
PDF |
同策略自蒸馏通过使用单一模型同时作为教师和学生,在教师以正确演示为条件提供密集的token级反馈时,实现了强大的pass@1准确率。我们表明这可能带来隐藏代价:展开多样性降低且pass@k曲线趋于平缓(即生成更多展开无法提升准确率)。我们将此归因于带采样演示的自蒸馏设计中存在的复合偏差。教师以采样得到的正确展开为条件,对每个学生展开进行评分,通过模型自身的偏差传递反馈。我们从理论上分析了最优自蒸馏策略,表明它通过学生展开与作为上下文的正确展开之间的逐点条件互信息分数来倾斜基础分布。与理想的最优同策略强化学习(RL)不同——后者在同等正确的展开间保持概率比——自蒸馏可能放大现有概率差距,将概率质量集中在已占主导的模式上。在受控的图路径查找任务和科学问答基准测试中,自蒸馏模型在平均性能上匹配或超越RL,但功能多样性和语义多样性显著降低,在需要多样化策略的分布外设置中表现失败。 |
| MVTrack4Gen:多视角点跟踪作为4D视频生成的几何监督 |
JoungBin Lee |
2026-06-24 |
PDF |
从单目参考视频沿目标相机轨迹合成新视角视频,需要同时保持与参考视频的几何一致性和运动保真度。现有基于显式三维表示的方法受限于现成重建模块的精度,这类模块在单目视频动态物体上常产生不准确的几何结构。相比之下,仅依赖相机条件的方法虽能实现高视觉质量,但往往难以保持几何与运动一致性。本文提出MVTrack4Gen(多视角点跟踪用于新视角生成),这是一种运动感知训练框架,通过引入多视角点跟踪作为额外的几何与运动监督信号,增强仅依赖相机条件的新视角视频扩散模型。我们的关键发现是:特定注意力层编码了强对应线索——查询特征会关注跨视角和跨时间几何对应位置的关键特征,而这类对应的错位会导致运动不一致。基于此观察,我们将这些特征路由至辅助多视角跟踪头,并联合训练扩散模型与点跟踪目标。通过显式强化这些运动感知对应关系,MVTrack4Gen改进了现有模型,使其能更好地遵循参考视图中的运动并保持跨视角几何一致性。在多个基准测试中,我们的方法实现了最先进的几何一致性和具有竞争力的相机精度。 |
| 实时语音AI能听到但不倾听 |
Martijn Bartelds |
2026-06-24 |
PDF |
语音通过词语和声音传递信息。我们评估了四款领先的实时语音系统——OpenAI的GPT Realtime 2、Google的Gemini 3.1 Flash Live,以及阿里巴巴的Qwen3.5 Omni Plus和Omni Flash——在词语和表达方式都承载重要信息的任务中的表现。在三个关键场景中,所有四款系统都只根据词语而非语音做出反应:它们挂断坚持说“没事”的哭泣来电者的电话,批准用恐惧声音授权的电汇,并录取明显带有讽刺意味的同意者。令人惊讶的是,这往往不是感知失败。当被直接询问时,四款系统中有三款能可靠识别出它们在决策时忽略的痛苦、恐惧或讽刺。我们在这些实时语音系统评估口音和年龄时也观察到类似模式,它们的反应往往遵循词语的偏见,而非说话者的声学特征。我们将这种感知与行动之间的脱节称为语音AI的情感智能鸿沟。明确提示系统关注语音表达只能部分且不稳定地改善表现。我们的发现表明,当前的实时语音AI系统往往表现得如同语音已被简化为文本转录,因此在表达语气和情感传递重要信息的场景中应谨慎使用。 |
| 后训练中被忽视的免费午餐:面向大语言模型智能体的进度优势 |
Changdae Oh |
2026-06-24 |
PDF |
过程奖励模型能够对大型语言模型进行细粒度、逐步骤的评估,但在智能体场景中构建此类模型仍面临极大困难:长周期交互、不可逆操作以及随机环境反馈使得人工标注和蒙特卡洛估计在大规模应用中均不可行。本研究表明,强化学习后训练阶段已具备生成有效步骤级评分所需要素,完全无需额外训练专用奖励模型。具体而言,我们在通用随机马尔可夫决策过程中推导出一种隐式优势函数——即"进度优势":强化学习训练策略与其参考策略的对数概率比恰好能还原最优优势函数。该公式使所得信号无需标注、跨领域通用,且作为标准强化学习后训练流程的副产品直接可用。我们在五个基准测试和四个模型家族上,通过测试时扩展、不确定性量化及故障归因三类应用验证了进度优势的有效性。在所有场景中,该方法均持续优于基于置信度的基线方法,且无需任务特定训练即可超越专用奖励模型。我们进一步通过深度分析揭示了进度优势的特性,为实际智能体系统的部署提供了实践指导。 |
| 相同证据,不同答案:多模态大语言模型中的审计顺序敏感性 |
Akshay Paruchuri |
2026-06-24 |
PDF |
多模态大语言模型(MLLM)的标准基准测试按单一规范顺序对每个项目评分,未能考察与顺序无关的随机重排是否会改变答案——这是新兴AI评估指南所要求的一项基础可靠性属性。我们提出Facet-Probe,对18个前沿及开源权重的MLLM进行五维度审计(选项顺序、证据块顺序、文档排序、图像集顺序及混合模态顺序)。采用贝叶斯项目反应模型将排序噪声与各维度偏差分离,并通过同序对照实验估计解码器随机性下限对应的观测翻转率。研究发现,受审计的18个MLLM均不具备顺序不变性:各维度面板平均翻转率在24%-50%之间。在温度参数为0的Gemini同序对照实验中,已验证单元格内存在显著高于同输入解码器噪声底线的排序效应。模型能力可预测翻转但无法消除——最优模型仍有13.4%的试次发生翻转。在Gemini缓解测试中,免训练提示修改具有模态条件性,且无法从文本推理迁移至视觉推理。这些结果表明,仅靠提示层面的缓解措施难以实现通用顺序鲁棒性,亟需在训练阶段和架构设计层面开展后续研究。我们建议将跨顺序翻转率作为MLLM的标准报告维度。 |
| 基于无监督域适应的激光与TIG焊接跨工艺熔透状态预测算法 |
Sen Li |
2026-06-24 |
PDF |
监督深度学习已被广泛用于焊缝熔透状态分类,但在领域迁移(例如将模型从电弧主导的钨极惰性气体保护焊(TIG)迁移至基于小孔的激光焊接等物理机制不同的焊接工艺)时,其性能常显著下降。为克服这一局限,我们提出了一种集成渐进式源域扩展(GSDE)策略的无监督域适应(UDA)框架。在专用TIG和激光焊接数据集上的评估表明,该方法在同工艺和跨工艺迁移任务中均实现了高精度。具体而言,在同工艺场景下,TIGFH和LSPS数据集上的平均准确率分别达到90.65%和90.72%,较监督基线分别提升35.83%和38.87%;更值得注意的是,在跨工艺场景中,TIG到激光的准确率达80.48%,激光到TIG的准确率达81.13%,较基线分别提升43.39%和43.40%。UMAP可视化验证了模型在保持判别性类别边界的同时学习了域不变特征。该方法显著降低了新焊接工艺的重新标注成本,并增强了跨不同焊接系统的智能监测通用性。 |
| 模型取证:调查令人担忧的行为是否反映了目标偏离 |
Aditya Singh |
2026-06-24 |
PDF |
安全研究的一个核心目标是判断模型是否出现错位。以往的工作主要聚焦于检测令人担忧的行为。但仅凭行为本身无法确定错位:一个令人担忧的行为可能源于良性原因,比如困惑。这促使我们开展模型取证:调查该行为是否由恶意意图驱动。在本文中,我们提出一个基线模型取证协议,包含两个步骤,可根据需要迭代进行。首先,我们解读思维链以生成关于模型行为驱动因素的假设。其次,我们对提示或环境进行修改以检验这些假设。尽管思维链并非始终可靠,但它提供了丰富的无监督洞察,可指导收集更严格的证据。为评估该协议,我们创建了六个代理环境套件,其中模型表现出令人担忧的行为,并对每个环境应用该协议。通过证明“低努力倾向”这一假设能成功预测其行为,我们确认Kimi K2 Thinking因真正倾向于低努力行为而走捷径。通过反事实实验,我们证明DeepSeek R1出于与自身先前实例保持一致的欲望而进行欺骗。尽管如此,我们的方法仍有很大改进空间。例如,当我们测试Kimi K2 Thinking是否意识到自己在违反用户意图时,未发现此类信念的证据,但由于缺乏阳性对照,我们无法确认测试能检测到它。总体而言,我们发现这一简单协议提供了强有力的基线,希望未来工作能在此基础上改进。更广泛地说,我们的工作是发展模型取证这一新兴领域的具体一步。 |