跳转至

arXiv 2026-06-18

标题 作者 发布日期 PDF链接 摘要
原生主动感知作为全模态理解的推理基础 Zhenghao Xing 2026-06-17 PDF 长视频理解的被动模型通常依赖"全量观看"范式,无论查询难度如何都统一处理所有帧,导致计算成本随视频时长线性增长。尽管交互式框架已经出现,但它们往往依赖全局预扫描,其上下文成本仍与视频长度成正比。我们提出OmniAgent——首个原生全模态智能体,将视频理解建模为基于POMDP的迭代式"观察-思考-行动"循环。OmniAgent通过按需执行动作,选择性地将视听线索提炼为持久化文本记忆,有效解耦推理复杂度与原始视频时长。为实现这一机制,我们引入:(1) 智能体监督微调,通过最佳N轨迹合成与双阶段质量控制引导原生主动感知能力;(2) 基于TAURA(轮次感知自适应不确定性重缩放优势)的智能体强化学习,利用轮次级熵值将信用分配导向关键发现轮次。关键的是,OmniAgent展现出正向测试时扩展特性——随着推理轮次增加性能持续提升,验证了主动感知的有效性。在十个基准测试(如VideoMME、LVBench)上的实验结果表明,OmniAgent在开源模型中达到最优性能。值得注意的是,在LVBench上,我们的7B智能体以50.5%的准确率超越10倍参数量的Qwen2.5-VL-72B(47.3%)。
超越当前观察:评估多模态大语言模型在可控非马尔可夫博弈中的表现 Shengyuan Ding 2026-06-17 PDF 将多模态基础模型部署为闭环策略时,越来越需要根据不再可见的观测结果来调节动作。然而,现有基准要么暴露完整状态,将隐藏状态重建与其他智能体技能混为一谈,要么仅在回合结束后测试记忆能力。我们提出RNG-Bench(重建性非马尔可夫博弈),这是一个基准套件,旨在隔离基础模型在多次交互过程中重建过往观测并据此行动的能力。RNG-Bench包含两个互补博弈:配对记忆,需要回忆特定位置短暂展示的卡片身份;以及3D迷宫,需要将自我中心视角整合为空间地图。两个博弈均在统一框架下评估,包含三个受控难度维度:网格尺寸、视觉模式和观测模态。该基准进一步引入头对头对决协议以控制实例级方差,以及记忆缺口指标,该指标将遗忘与不良动作选择区分开来。最困难的配置要求每回合约128K令牌上下文和350张图像输入,前沿多模态大语言模型仍远未达到饱和。记忆缺口分析表明,大多数残余错误源于对早期观测的遗忘,而非次优决策。最后,在最优策略轨迹和过滤后的模型演示上微调Qwen3.5-9B,可提升RNG-Bench性能,并迁移至现有基准,同时不降低通用多模态能力。
使用图灵奖励学习用户模拟器 Yingshan Susan Wang 2026-06-17 PDF 在交互式环境中学习模拟人类用户,可以推动智能助手训练、个性化系统评估、社会科学研究等领域的发展。现有方法通常通过训练大语言模型(LLM)匹配单一真实用户回复来实现,具体方式包括最大化对数概率或使用相似度奖励。我们提出{Turing-RL}:一种基于图灵测试的强化学习方法,用于训练用户模拟器模型。{Turing-RL}采用判别式图灵奖励机制,通过LLM裁判评估生成回复与真实用户回复在用户历史背景下的不可区分性得分,用户模拟器LLM据此学习生成与真实用户可能表述无法区分的回复。在对话聊天和Reddit论坛讨论两个不同领域的实验中,我们发现{Turing-RL}在LLM评估和人工评估指标上均持续优于基线方法。研究表明,优化不可区分性而非回复匹配度,是训练用户模拟器的有效策略。
用LOCUS解放法律:美国地方条例语料库 Denis Peskoff 2026-06-17 PDF 法律人工智能的进步越来越依赖于大规模获取权威法律文本。然而,美国法律体系中最重要的层级之一——地方法规——在现有的机器可读语料库中仍然基本缺失。地方法规涵盖分区、住房、商业许可、公共卫生、噪音、动物管控以及日常管理的诸多领域,但它们分散在专为人工浏览而非批量研究访问设计的供应商平台上。我们推出LOCUS——美国地方法规语料库——这是一个全面的语料库和县级统一访问层,涵盖美国市和县的地方法规。原始语料库(可向研究人员发布)包含了几乎所有公开可用的市和县地方法规。最终原始语料库包含来自9,239个城市和县的法规。一个较小的县级统一LOCUS访问层覆盖了美国3,144个县中最大的2,309个县,覆盖了大部分人口。我们使用OCR技术处理了众多文档格式,这些格式此前阻碍了法律成为公共资源。我们随语料库发布覆盖元数据,以支持可重复性、下游法律AI研究以及逐步扩展地方法规的机器可读访问。我们训练了一系列基于ModernBERT的分类器和评分器,以便从多个维度(如不透明性和家长主义)分析美国地方法规,这些维度此前从未在如此规模下被研究。LOCUS-v1及其衍生模型可在以下网址获取:https://huggingface.co/datasets/LocalLaws/LOCUS-v1
《Do as I Do:从日常人类视频中获取的灵巧操作数据》 Bhawna Paliwal 2026-06-17 PDF 我们如何能够规模化地生成机器人操作数据,尤其是在类人平台(如灵巧多指手)上?从人类视频中学习近期成为这一问题的潜在答案。然而,手-物体交互估计的困难以及跨越人-机器人具身鸿沟的挑战,阻碍了将丰富的单目RGB人类视频作为机器人操作数据主要来源的广泛应用。在本研究中,我们提出“DO AS I DO”算法,用于将单目RGB人类视频重建并重定向至多指灵巧机器人手。该算法从各种第一人称和第三人称的真实世界视频源中重建手-物体交互,随后将这些交互估计重定向为可在真实世界中执行的动作序列,从而从不同的人类视频中生成机器人可用的完整操作数据。总体而言,DO AS I DO在手-物体交互估计和从RGB视频中提取灵巧操作轨迹方面优于先前的最优方法——我们在包含真实标注的数据集以及在线收集的视频片段数据集上的实验验证了这一点。基于这些实验,我们为从业者收集人类操作数据提出了一套效能指南。
钱德拉-盖娅对应源目录:利用机器学习解决钱德拉源目录中X射线源与盖娅源的不明确匹配问题 V. Samuel Pérez-Díaz 2026-06-17 PDF 我们提出一个框架,用于将钱德拉源目录(CSC v2.1)中的X射线源与盖亚数据发布3中的光学源进行交叉匹配。与纯空间方法不同,我们利用星等、颜色和距离等源属性来识别真实对应体、检测偶然重合,并在存在多个合理候选源时解决歧义。我们使用NWAY(一种考虑位置误差和源密度的贝叶斯交叉匹配框架)定义高置信度匹配的训练集,并在两个目录的多种特征上训练梯度提升分类器(LightGBM)。在约25.4万个独立X射线源中,我们为约11.3万个源找到了对应体,其中约7000个源存在多个合理对应体。约2万个源未找到对应体(而基于分离度的交叉匹配能找到匹配),其中一半归因于偶然重合。我们在钱德拉猎户座超深项目(COUP)上验证了该流程,机器学习匹配在不使用任何位置信息的情况下复现了NWAY交叉匹配结果的95%。我们发布了包含约11.3万个钱德拉-盖亚对应体的星表,以及约7000个替代匹配和约2万个NWAY歧义关联,为钱德拉和盖亚均可探测的源群体研究提供支持。我们讨论了局限性,并提供了适用于其他交叉匹配场景的框架泛化方案。
UBP2:面向高效基于偏好的强化学习的不确定性平衡偏好规划 Mohamed Nabail 2026-06-17 PDF 基于偏好的强化学习提供了一种从行为的两两比较中学习奖励模型的方法,无需显式设计奖励函数。然而,现有方法通常依赖被动数据收集,在样本效率上表现不佳,尤其是在学习初期。我们提出了一种基于模型的方法,通过联合推理奖励、动力学和值函数中的不确定性来主动引导探索。我们的方法——不确定性平衡偏好规划(UBP2)——使用奖励、动力学和值函数模型的集成,根据结合期望奖励、终端值和认知不确定性的统一评分来评估候选轨迹。在此目标下进行规划,能够在利用与信息获取之间实现显式权衡,无需依赖启发式探索策略。在标准正则性假设下,我们为有限时域和无限时域场景建立了次线性遗憾保证。实验表明,在Meta-World基准测试中,UBP2的样本效率显著高于无模型偏好方法和非乐观的基于模型的基线方法。
重新思考奖励监督:基于评分标准的自我蒸馏 Siyi Gu 2026-06-17 PDF 推理语言模型的后训练通常依赖于监督式蒸馏和基于可验证奖励的强化学习。蒸馏方法往往需要链式思维标注,这类标注获取成本高昂,且本身可能存在噪声、不完整或部分错误——即使最终答案正确,不完善的推理过程仍会干扰学习效果。而基于可验证奖励的强化学习则通常将评估反馈压缩为标量信号,掩盖了回答中需要改进的具体方面。我们提出基于评分准则的条件式自蒸馏框架,该框架将评分准则作为结构化细粒度反馈,用于在策略自蒸馏过程。该方法使教师模型基于准则层级进行条件化建模,并为学生模型自身采样的轨迹提供词元级指导。这一设计避免了将单一参考推理过程作为唯一监督目标,而是通过评分准则明确优质回答应满足的条件,从而在推理过程中实现比标量奖励优化更精细的信用分配。我们通过两阶段流水线实现该框架:首先学习生成任务特定评分准则,随后训练准则引导的推理模型。在多个科学推理基准上的评估表明,基于评分准则的条件式自蒸馏能有效将准则层级标准转化为推理过程中的词元级指导,平均性能超过GRPO 1.0个百分点、超过OPSD 0.9个百分点。
基于野外先验的参考驱动多说话人音频场景生成 Michael Finkelson 2026-06-17 PDF 现有的多说话人对话系统通过结构化监督将说话人与话语绑定:每轮标签、多流转录或可学习说话人嵌入。这些系统仅在纯语音流水线中运行,生成无环境纹理的干净语音序列。我们采用不同方法。我们的方法ScenA,基于大规模野外数据预训练的文本到音频流匹配基础模型,直接以多个参考语音和描述整个多说话人音频场景的自由形式自然语言提示为条件。利用此类基础模型使我们能够继承其生成自然非录音室音频的能力:背景噪声、房间声学、重叠对话和自发副语言事件,同时无需任何每轮结构即可添加多说话人控制。具体而言,参考潜变量被拼接至模型令牌序列,并通过轻量级身份感知位置编码进行区分。然而,我们识别出该方法的关键障碍:\textit{参考捷径}。在标准噪声调度训练过程中,模型可通过声学相似性识别与含噪目标匹配的参考,完全绕过文本提示。我们通过高噪声偏置时间步分布解决此问题,迫使模型依赖文本提示进行说话人分配。我们在CoVoMix2-Dialogue基准上评估ScenA,结果表明其在说话人绑定指标上优于现有多说话人系统,同时生成包含重叠语音、情感发声和环境音效的丰富对话音频。我们的结果证明了使用以自由形式场景描述为条件的通用音频模型,而非通过纯语音流水线传递结构化对话脚本的优势。
数据智能代理:通过自主编码代理解释、建模和查询企业数据 Anoushka Vyas 2026-06-17 PDF 生产数据集成面临瓶颈,根源在于数据所有者、工程师和分析师之间反复出现的、有损的交接环节——他们必须协作完成企业数据的发现、结构化与查询。我们提出数据智能代理(DIA)系统,该系统由三个代理(数据解释器、模式创建器和查询生成器)组成,通过将自主编码代理(ACA)作为一级抽象来压缩这一工作流程:代理不再生成文本,而是生成、执行、验证并修复具体工件,利用共享内存实现经验复用,并将每个工件提交给领域专家审查。DIA已部署于企业客户的生产环境。我们深入研究了查询生成器,并在完全自主模式下,针对涵盖四个任务类别和四种SQL方言的七个SQL基准进行了评估。在所有七个基准上,它均达到或超越了已发表的最佳结果,证明这种基于执行、构建于ACA和共享内存之上的架构,能够泛化至数据智能工作负载,且仅需通过自然语言指令进行适配。