| 价值轴:语言模型编码判断自身是否处于正确轨道 |
Nick Jiang |
2026-06-15 |
PDF |
我们研究了语言模型是否会在内部追踪其当前轨迹的价值,即当前策略实现目标的可能性。通过使用合成的上下文强化学习数据,我们为Qwen3-8B构建了一个“价值”轴。我们发现,沿该轴的激活能够区分高/低口头表达的置信度、有无回溯的生成过程,以及正确与错误的代码。向高价值方向引导会因果性地抑制自我修正并减少解释性冗余,而向低价值方向引导则会引发回溯和探索。我们证明,直接偏好优化(DPO)可以提升受奖励行为(例如使用特定词语)的内部价值,使模型在表现出这些行为后更加自信。最后,我们将价值轴应用于真实场景研究。例如,我们发现Qwen在后期训练后对政治敏感聊天查询赋予低价值,而监督微调会提升训练领域内的内部置信度。我们的结果表明,语言模型线性编码了对预期目标成功概率的估计,这种估计会调节模型在推进某个方向时的自信程度。 |
| 面向智能体与多模态大语言模型的上下文感知强化学习 |
Peiyang Xu |
2026-06-15 |
PDF |
大型语言模型(LLMs)在需要从长文本或复杂上下文中识别微小但关键证据(如工具追踪中的单行记录或图像中的细微细节)时常常失败。我们提出ContextRL,一种上下文感知强化学习方法,通过间接辅助目标提升长程推理与多模态性能。该方法不直接监督最终答案,而是向模型提供查询、答案及两个高度相似的上下文,并奖励其选择支持查询-答案对的上下文,从而促进细粒度定位。我们在两个领域构建对比上下文数据:对于编码代理,将执行轨迹作为上下文,通过条件过滤构建1K对数据;对于多模态推理,将图像作为上下文,通过生成式编辑与相似性搜索构建7K对数据。ContextRL在5个长程基准测试中平均提升+2.2%,在12个多样化视觉问答基准测试中平均提升+1.8%。为区分目标函数与额外数据的影响,我们对比了将相同对比上下文重新用作标准查询-上下文-答案示例的数据增强基线。这些基线几乎无改进,表明性能提升源于所提出的上下文选择目标,而非对比数据本身。 |
| BRDFusion:物理与生成结合的城市场景逆渲染 |
Yi-Ruei Liu |
2026-06-15 |
PDF |
从捕获视频中对城市场景进行逆渲染可实现多种应用,包括内容生成和自动驾驶仿真。基于物理的渲染方法遵循并控制光照物理规律,但存在重建和渲染伪影问题。生成模型虽能生成逼真视频,但一致性和可控性有限。我们提出BRDFusion,一个融合两种互补模型进行逆渲染和前向渲染的统一框架。具体而言,BRDFusion通过物理建模恢复显式一致的场景属性,并利用生成先验缓解优化歧义。在前向渲染过程中,物理模型根据场景配置提供可控渲染,生成模型则进行去噪和伪影修复。因此,我们的方法在实现精确控制的同时生成高质量视频,在真实和合成场景中均优于基线方法。此外,BRDFusion支持新视角重光照、夜间模拟以及动态物体插入/编辑。项目页面:https://shigon255.github.io/brdfusion-page/ |
| 精确后验分数估计用于解决线性逆问题 |
Abbas Mammadov |
2026-06-15 |
PDF |
扩散模型和流模型通过训练去噪器来逆转高斯噪声破坏,从而学习到强大的数据先验。要利用这种先验解决线性逆问题,需要从后验分布中采样,但先验提供的分数是无条件分数,而非后验分数。现有方法要么使用近似测量匹配校正来引导固定的预训练去噪器,要么训练一个放弃先验去噪结构的条件恢复模型。我们推导了线性高斯逆问题在一般高斯插值条件下的精确后验分数闭式解,并证明后验采样可简化为在算子依赖的偏移枢轴点及各向异性噪声协方差下的去噪问题。我们将这一恒等式转化为精确后验分数(EPS)——一种保留标准预训练输入/输出结构的去噪训练目标,因此既可从零训练,也可基于预训练去噪器微调。在推理阶段,EPS使用与基础骨干网络相同的采样器,无需似然梯度或投影操作。我们在FFHQ和ImageNet数据集上针对五个线性逆问题评估了EPS,其在保真度、感知质量和分布指标上均优于无训练和有训练的基线方法,同时去噪器评估次数比基于梯度的后验采样器少约一个数量级。 |
| 机器人策略学习的几何动作模型 |
Jisang Han |
2026-06-15 |
PDF |
通用型机器人策略必须遵循用户指令,同时推理物体、摄像头和机器人动作在三维物理世界中的交互方式。当前的视觉-语言-动作模型(VLA)和视频世界-动作模型(WAM)虽然从大规模基础模型中继承了强大的语义或时间先验,但它们仍主要基于二维图像帧或二维导出的潜在空间运行,隐含了接触密集型操作所需的三维几何信息。我们提出几何动作模型(GAM),这是一种语言条件化的操作策略,直接复用预训练的几何基础模型(GFM)作为感知、时间预测和动作解码的共享基座。GAM在GFM的中间层进行拆分:浅层作为观测编码器,在拆分层插入的因果未来预测器基于语言、本体感知和动作历史预测未来潜在标记。预测的未来标记随后通过剩余的GFM模块进行特征传播和解码,使单一骨干网络能够同时生成未来几何信息和动作。这种设计通过最小的架构修改赋予GFM语言条件化的时间世界建模能力,同时保留其丰富的几何先验。在涵盖仿真和真实机器人操作的广泛基准测试中,GAM相比当前基础模型规模的基线方法更准确、更鲁棒、更快速且更轻量。 |
| 用于从稀疏回合结果中在线微调VLA的分层优势加权方法 |
Tongyan Fang |
2026-06-15 |
PDF |
当预训练的VLA策略通过在线强化学习进行微调时,每次回滚回合仅产生单一二元结果(成功或失败),但演员更新需要逐转换监督。现有方法通常将此稀疏结果简化为单个标量奖励或优势信号,这混淆了不同形式的转换级反馈,且在基本任务成功可实现后提供的指导有限。首先,单一标量信号混淆了可行性与效率两个目标;一旦基本成功达成,二元标签无法提供区分高效完成与缓慢完成的梯度。其次,真实世界回滚混合了自主与干预片段;简单地将回合结果跨越这些边界分配会导致错误的信用分配。为解决这些问题,我们提出分层优势加权行为克隆(HABC),该方法在不同数据子集上为这两个目标训练独立的评论家头,并通过状态自适应平衡组合其输出。状态自适应门控$g_t$合并它们的一步优势,在成功不确定时优先考虑可行性,仅在可行性高时转向效率,并将结果转换为演员损失的逐转换权重。干预感知的信用分配进一步将结果标签限制在当前策略执行的片段,防止监督跨越干预边界泄露。在三个接触密集型双臂任务的真实机器人实验中,HABC将监督微调(SFT)基线从36%、44%和12%的成功率提升至92%、88%和38%。 |
| 对来自Nature Portfolio的元分析文章中的LLM智能体进行基准测试 |
Anzhe Xie |
2026-06-15 |
PDF |
Meta分析是一种高要求的证据综合形式,结合了文献检索、PI/ECO指导的研究筛选和统计聚合。其结构化、可验证的工作流程使其成为评估系统性科学推理的理想载体,然而现有基准缺乏覆盖完整检索-筛选-综合流程的黄金标准。我们提出MetaSyn数据集,包含来自Nature Portfolio期刊的442项专家精选元分析。每项条目将研究问题与PI/ECO标准、包含14万篇PubMed文章的检索语料库、经核实的阳性研究、主题相似但不符合PI/ECO条件的困难负样本、完整检索策略及日期范围配对。对十二种流水线配置(九种RAG变体与一种协议驱动智能体)的基准测试揭示了关键筛选瓶颈:尽管在K=200时检索上限达到90.9%召回率,但没有任何系统能恢复超过52.7%的黄金标准纳入文献。当前LLM无法在主题相关性相当的文献池中可靠区分符合条件的研究与不符合PI/ECO的干扰项。分阶段归因指标可捕捉系统成功与失败的具体环节,而单一端到端评分无法实现。 |
| R2RDreamer:面向空间泛化二维操作策略的三维感知数据增强 |
Xiuwei Xu |
2026-06-15 |
PDF |
空间泛化对于模仿学习的操作策略至关重要,但实现这一目标通常需要跨不同物体姿态、机器人配置和相机视角的大规模演示数据。从少量源演示中进行数据增强,为昂贵的真实世界数据采集提供了实用替代方案。基于仿真的增强可以产生可控变化,但需要复杂的环境和物体设置,并可能引入仿真到现实的差距。近期实到实方法通过联合编辑真实演示中的3D观测和动作轨迹避免了这些问题,但仍依赖强大的3D场景解析和几何补全,且生成的观测通常针对3D点云策略而非基于RGB的2D策略。我们提出R2RDreamer,一种保持3D动作-观测编辑几何一致性的实到实演示增强框架,同时将视觉补全迁移至2D视频空间。具体而言,R2RDreamer首先通过在同一3D坐标系中编辑不完整物体点云和末端执行器轨迹执行轻量级3D增强;随后通过带遮挡感知的推理将编辑后的场景投影至掩膜图像空间控制视频,并利用密集控制图像到视频模型补全时间连贯的RGB观测。在空间偏移操作任务上使用2D扩散策略和视觉-语言-动作策略的实验表明,R2RDreamer能从有限源演示中提升空间泛化能力,分析验证了3D编辑、遮挡感知投影和视频补全的贡献。 |
| 神经表征中相位的重要性:图像分类器的内部Oppenheim-Lim测试 |
Alper Yıldırım |
2026-06-15 |
PDF |
Oppenheim和Lim(1981)的研究表明,仅从傅里叶相位重建的自然图像仍可识别,而幅度几乎不携带图像的身份信息。我们探究经过训练的图像分类器是否在其隐藏层中复现这种不对称性,并通过因果实验进行验证:给定两幅图像,我们在选定层将一幅图像的相位移植到另一幅图像的幅度上,记录预测结果跟随哪幅图像。在PRISM2D、GFNet和ViT-B/16中,预测结果跟随相位或符号的供体,删除所有图像特异性幅度对准确率影响极小,因此身份信息由相位承载,而图像特异性幅度对读出层而言基本可舍弃。ResNet-50最初看似打破这一模式,因其ReLU后的符号移植无效;但在ReLU前的公平干预揭示了深层块中存在强潜在符号编码,而仅含直流分量的对照实验表明读出层消耗的是通道空间平均值。对照实验排除了幅度完全不再依赖图像的平凡情况。因此,这些架构共享相位/符号身份编码,但通过整流和读出几何结构在不同基中暴露该编码,这为CNN与注意力模型之间的纹理-形状差异提供了机制性解释。 |
| 你的隐私,我的伪装:差分隐私联邦学习中的后门攻击 |
Xiaolin Li |
2026-06-15 |
PDF |
先前研究表明,差分隐私(DP)本质上能增强联邦学习(FL)抵御后门攻击的鲁棒性。本文对这一假设提出质疑。通过对两种基线攻击策略的实证分析,我们揭示了DP-FL中存在的根本性矛盾:绕过DP机制时,现有防御手段能够检测并过滤恶意更新;但遵循DP约束反而会掩盖恶意更新的统计特征差异。因此,当DP削弱原始后门信号时,现有防御手段将失效。基于这种掩盖效应,我们提出RING攻击——一种明确利用DP来隐藏恶意贡献同时最大化攻击效果的新型攻击方法。通过协作构建对抗性扰动,受损客户端在聚合过程中重建强后门信号而不触发异常检测。RING作为与底层后门技术无关的扰动层,具有广泛适用性和可组合性,能与现有攻击协同作用——这一特性显著放大了其对DP-FL的威胁。在非独立同分布条件下对四个图像和文本数据集的广泛评估表明,在中等隐私预算下,RING针对六种最新防御手段的平均攻击成功率达90.3%,较基线策略提升高达26.08倍。最后,我们评估了潜在防御措施,发现缓解该威胁需付出显著的效用代价,这暴露了部署差分隐私FL时的根本性安全漏洞。 |