| 回读:预训练多模态大语言模型是文本到图像生成的零样本奖励模型 |
Runhui Huang |
2026-07-13 |
PDF |
本文提出SpectraReward,一种无需训练的奖励函数,可将预训练多模态大语言模型直接转化为图像生成强化学习的现成奖励模型。不同于要求MLLM评判生成图像或回答分解验证问题的方法,SpectraReward通过单次图像条件教师强制前向传播,衡量原始提示从生成图像中的恢复程度。我们以平均图像条件提示对数似然作为奖励,直接复用MLLM预训练的图像-文本对齐能力,无需偏好标签或奖励模型微调。进一步提出Self-SpectraReward这一统一多模态模型的特殊案例,其中策略自身的理解分支作为其生成分支的奖励模型,形成无需外部奖励模型或外部知识的闭环自改进框架。通过覆盖两种扩散模型、三种强化学习算法、来自四个MLLM家族(参数规模4B至235B)的九个奖励MLLM骨干网络,以及五个分布外文本到图像基准的广泛图像生成强化学习研究,实验验证了SpectraReward的有效性。结果表明,SpectraReward与Self-SpectraReward均能显著且一致地提升生成性能,并优于先前基于MLLM的奖励训练方法。进一步分析揭示,更大的奖励MLLM并非总是更优,而Self-SpectraReward可匹配甚至超越规模更大的外部奖励模型,表明奖励-策略对齐是有效图像生成强化学习的关键因素。项目页面:https://huangrh99.github.io/SpectraReward/ |
| 文本到图像个性化模型中的潜在身份调优 |
Daniel Garibi |
2026-07-13 |
PDF |
生成和编辑人脸需要极高的精度,因为即使微小的改动也可能显著改变被识别对象的身份特征。然而,当前基于通用文本到图像模型的个性化与编辑方法,往往缺乏进行精细面部编辑所需的精度。我们提出了一种在文本到图像个性化模型中进行细粒度身份调优的方法。与标准图像编辑(针对给定图像操作)不同,身份调优会修改特定身份特征的潜在表征,从而生成持续呈现同一编辑后身份特征的多样化图像。为实现细粒度潜在身份调优,我们探索了预训练冻结编码器在文本到图像个性化中的潜在空间。该方法无需额外训练,而是利用冻结编码器的现有架构来揭示潜在语义方向。该空间由一组潜在标记构成,这些标记在捕捉身份特征的不同维度中扮演独特角色,且通常对应特定的空间或语义面部区域。我们证明,在该空间及由选定标记定义的子空间中,可以识别出有意义的语义方向,从而实现局部化、细粒度且语义连贯的编辑。通过定性与定量实验验证,该方法在保持跨图像身份一致性的同时,实现了多样化的局部面部编辑。项目页面:https://garibida.github.io/IdentityTuning/ |
| 混合帧策略:面向双臂移动操作的多帧动作去噪 |
Dian Wang |
2026-07-13 |
PDF |
机器人操作本质上是多帧的:局部动作在末端执行器坐标系中可能很简单,而运输、直立物体操作和全身协调则更适合在基座对齐坐标系中表示。然而,现代基于扩散的视觉运动策略通常采用单一预定义的动作坐标系,迫使单个去噪器建模在该坐标系中往往过于复杂的动作分布。我们提出混合帧策略(MoF),这是一种跨多个坐标坐标系执行同步动作去噪的扩散策略。MoF维护单一规范扩散状态,将其重新表达为多个任务相关坐标系,应用帧专用去噪器,并将它们的噪声预测融合回规范坐标系。为实现中间噪声扩散状态下的这一过程,我们在SE(3)动作参数化中引入基于列的6D旋转表示,支持精确可微的坐标系变换,无需噪声旋转位于SO(3)流形上。在九个模拟双臂操作任务中,我们证明最佳动作坐标系取决于具体任务,且MoF优于最优坐标系选择和标准混合专家(MoE)基线。我们进一步在两项真实世界双臂移动操作任务上评估MoF,证明其优于所有组成单帧基线。项目主页:https://mofpo.github.io |
| 序列编码:利用自生成训练数据突破模型压缩极限 |
Shikai Qiu |
2026-07-13 |
PDF |
压缩是智能的基础。一个能够将训练数据表示为短代码的模型,已经发现了能够实现泛化的规律性。大型神经网络可能学习到远比其参数数量所暗示的更简单的函数,但构建能体现这种简单性的代码极具挑战性。基于参数的方法(如量化)产生的代码长度与模型规模成正比,且对参数存储的信息量不敏感。前置编码通过压缩训练轨迹绕过了这一问题,但无论模型学到多少,它都会对精确的数据序列进行编码,当数据具有高熵时会产生庞大的代码。我们提出重编码方法,其中教师模型从学生自身的分布中抽取训练样本。学生的代码仅记录这些选择,仅在教师与学生意见不一致时消耗比特。由此产生的代码长度与参数数量和数据熵无关,通常比前置编码短数个数量级,且优势随规模扩大而增长。这种压缩揭示了先前压缩器无法触及的现象。在保持损失不变的情况下,更大规模的模型和集成尽管参数更多,却能压缩到更小的尺寸。将重编码代码代入PAC-Bayes边界后,可为拥有十亿参数的大语言模型提供最先进的泛化保证,甚至优于基于激进后训练量化(即使假设零误差)的边界。在计算最优的规模下,边界随规模扩大而收紧,因为模型相对于数据集规模变得更具可压缩性。同一代码预测模型在多个训练周期后会逐渐过拟合。它还能将数据集中的可学习信息与不可预测的随机内容分离,揭示出低熵文本比高熵图像数据蕴含更多可学习结构。 |
| LLM中的元认知:基础、进展与机遇 |
Gabrielle Kaili-May Liu |
2026-07-13 |
PDF |
元认知是智力的基础组成部分,对有效学习、问题解决、决策制定、沟通等至关重要。近年来,它逐渐被视为构建强大、透明AI系统的基石。然而,尽管大语言模型在各类现实任务中取得了显著进展,目前尚不清楚它们何时、如何或在何种程度上能够展现或具备有效的元认知能力,也不清楚如何利用这些能力来提升AI系统的基础能力、可靠性和智能水平。本文通过首次全面综述大语言模型元认知研究现状来弥合这一空白。我们分析并分类了这一新兴领域的格局,总结了最新技术进展,包括测量和评估大语言模型元认知能力的方法与基准、激发、改进和应用大语言模型元认知的技术,以及当前研究的发现与启示。我们还讨论了应用场景、开放问题与挑战,以及未来工作的有前景方向。我们的目标是提供该主题的详细且最新综述,并激发有意义的研究与讨论。相关论文的整理列表可参见https://github.com/yale-nlp/LLM-Metacognition。 |
| Transformer在归纳推理任务中的不变学习动态 |
Tiberiu Musat |
2026-07-13 |
PDF |
我们提出一个理论框架,用于解释Transformer语言模型中归纳推理能力的涌现机制。尽管此前关于Transformer学习动态的研究大多局限于特定任务,但我们研究了一类广义的归纳任务,这类任务统一了文献中已知的若干合成任务,包括上下文n元语法和多跳推理。在此类任务中,我们从理论上证明注意力模型的训练动态可被限制在一个高度可解释的低维不变流形上。在该流形上,学习动态由少数可解释坐标而非数百万参数所刻画,这使得理论与实证分析都更易处理。利用这一框架,我们刻画了数据统计如何调控上下文学习与权重学习之间的竞争,研究了随机初始化在存在多种可能解时如何决定"胜出"电路,并展示了与该流形关联的坐标框架可用于自动检测训练模型中已习得的电路。通过将电路形成视为低维动态现象,我们向建立Transformer学习机制的可预测理论迈出了一步。 |
| 一种极简的基于重定向引导的强化学习方案用于灵巧操作 |
Yunhai Feng |
2026-07-13 |
PDF |
近期,人形全身控制领域的研究通过一个简单方法取得了成功:将人类运动重定向至机器人运动学参考轨迹,再通过强化学习训练策略进行跟踪。但这一方法能否迁移至灵巧操作领域?答案并不明确,因为灵巧操作涉及复杂的接触动力学,需要精细调控接触模式与力。我们提出REGRIND——一种极简的重定向引导强化学习流水线,仅需单次人类演示即可学习灵巧操作策略。REGRIND将人类手-物运动重定向至保留手-物空间与接触关系的机器人参考轨迹,在仿真中训练残差强化学习策略以跟踪该参考轨迹中的物体关键点,并通过系统辨识实现零样本策略迁移至真实硬件。最终策略能在两种多指机械手上产生流畅类人行为,完成包含剪刀操作与螺丝刀旋转等接触密集型工具使用任务。通过系统性硬件实验,我们识别并分析了影响灵巧操作仿真到现实迁移的关键因素,为接触密集型场景下的重定向学习提供实践指导。视频与代码详见https://yunhaifeng.com/REGRIND。 |
| 一个经过验证的教学反馈分类协议的持久性与跨语言迁移基准 |
Esteban U. Vega Barajas |
2026-07-13 |
PDF |
机构收集的开放式教学评价反馈远多于实际阅读量。此前一项研究引入了一种经过验证的分类协议,通过记录注释指南、注释者间信度测量、分层交叉验证以及在西班牙语机构语料库上采用冻结编码器设计的保留评估,对这些评论按主题类别和情感进行分类。两个问题限制了其复用性:一是该协议固定使用2019年时期的冻结嵌入,在表征方法不断进步时是否仍具竞争力;二是该协议能否迁移至第二语言。我们在原始西班牙语数据上跨三个表征世代(稀疏词汇特征、冻结Transformer嵌入、提示式大语言模型)重新运行该协议,并将其情感任务迁移至英语,使用一个包含45,000条评论的平衡语料库,并与一个标注了方面的教育数据集进行交叉验证。将配对比较视为描述性分析后,我们发现该协议具有持久性:2026年的前沿模型在难度最高的西班牙语任务上取得了最高的主题F1值,但在情感任务上相较于廉价模型并无优势,且在英语任务上与廉价模型无描述性差异,因此模型选择属于部署决策,而非方法本身的属性。 |
| 不公平法官内部:大语言模型作为法官偏见的机制可解释性分析 |
Zixiang Xu |
2026-07-13 |
PDF |
现有关于大模型作为裁判的评分偏差研究主要停留在输入-输出层面:扰动输入、测量评分差值、提出提示词层面的缓解方法。我们认为相同偏差在裁判模型的隐藏状态中具有表征层面的解释,与输入-输出视角互补,并能提供后者无法实现的实用价值。我们报告三项发现,涵盖七个裁判模型、七种偏差类型和九个基准测试。几何结构:基准评判输入占据紧凑的激活流形,而带偏输入沿低维、类型特定的子空间偏移,该子空间随层数加深而锐化,并被三类估计方法一致恢复。因果控制:沿该子空间操控隐藏状态可双向驱动评分,正向偏移在干净输入上复现带偏评分,反向偏移在带偏输入上恢复基准评分,而匹配范数的随机方向产生的偏移量小一个数量级。操作性:将简单线性投影应用于相同偏差方向特征,可在三个完全未见过的基准测试上预测裁判失败,显著优于基于文本的替代方法。将偏差解读为激活几何结构而非输入-输出噪声,可在单一框架内统一几何结构、因果控制和操作性预测。项目页面见https://xzx34.github.io/unfair-judge/ |
| 基于证据的视频问答 |
Shijie Wang |
2026-07-13 |
PDF |
当前视频大语言模型(Video LLMs)在问答任务中表现优异,但大多以黑箱方式运行,仅输出文本答案而缺乏可验证的视觉定位。现有可解释性研究依赖文本解释或稀疏边界框,难以应对遮挡、非刚性形变等复杂视频动态。我们提出证据支持视频问答(E-VQA)这一新任务,要求模型同时输出语义答案与精确的时空证据:时间片段及密集追踪的目标分割掩码序列。为此,我们构建了首个经人工验证的像素级定位基准数据集ST-Evidence,涵盖判别式与生成式任务。对当前最优模型的评估揭示,问答准确率与真实视觉感知之间存在关键性脱节,且单纯扩大模型规模无法弥合这一差距。针对该问题,我们开发了可扩展的自动化生成流程,构建包含16万样本的ST-Evidence-Instruct数据集,将高层推理与细粒度定位相衔接。基于该数据微调具备定位能力的视频大语言模型,在同等规模UniPixel基线模型上取得显著提升(7B模型t-mean提升27.2%,J&F提升13.8%),为可解释、证据驱动的视频理解建立了稳健基线。代码与数据已开源:https://github.com/SalesforceAIResearch/EVQA |