| VBVR-Pro:面向原生视觉推理的可扩展且可验证的套件 |
Junxiang Xu |
2026-08-26 |
PDF |
原生视觉推理将视觉生成本身视为推理的媒介:视觉状态(即图像和视频)不仅是待理解的输入或待渲染的输出,而是超越语言的问题解决的一等基底。然而,进展仍受限于缺乏可扩展的训练任务、可靠的反馈,以及跨生成基底的受控比较。在本工作中,我们引入VBVR-Pro,一个闭环测试平台,使通过生成进行的原生视觉推理变得可训练、可验证、可优化,且实验可控。1)任务扩展。VBVR-Pro将视觉推理转化为一个包含300个程序化生成任务的受控任务空间。在VBVR-Pro上训练的模型在七个外部视觉推理基准(如RISE-Video、MME-CoF-Pro和BabyVision)上展现出超越所提套件的强迁移能力。2)可验证奖励。VBVR-Pro为任务基础评估提供可验证的奖励评分器。通过对领先多模态大语言模型作为评判者的系统研究,我们识别出流行的VLM作为评判者范式的常见失败模式。相比之下,所提评分器基于确定性、任务特定规则,与人类判断实现细粒度对齐。重要的是,它们为大规模多任务强化学习提供可靠的奖励信号,并在视觉推理任务中展现出更强的强化学习后性能。3)机制研究。VBVR-Pro支持跨超过30种图像、视频和交错生成器的受控模态研究。我们的分析表明,视频生成在需要持续时空状态跟踪的任务中仍最强,而交错生成提供了一种计算高效的替代方案。关键的是,消融和探测表明存在对视觉推理至关重要的视觉原生轨迹。我们发布所有数据、模型、评分器和代码。 |
| Zero-WAM:基于人类视频的上下文世界-动作建模,用于开放式任务泛化 |
Jiaming Zhou |
2026-08-26 |
PDF |
零样本跨任务泛化,即策略必须执行训练中从未见过的操作任务,仍然是机器人学习中的核心挑战。在大语言模型中,新任务只需在上下文中指定即可执行,无需任何参数更新。这种上下文学习(ICL)形式将泛化转化为任务规范问题。为实现跨任务泛化,我们将这一范式引入机器人操作,并认为操作的自然任务规范是人类视频:与语言不同,它提供了关于预期任务演变的丰富视觉线索。我们提出Zero-WAM,一种因果视频-动作模型,通过遵循上下文中的视频引导来执行未见任务。为解决任务丰富的配对人类-机器人数据稀缺问题,我们提出一种自动流水线,将任务采样的机器人轨迹转换为语义匹配的人类视频,生成HumanGen数据集,包含8.6K任务中的74.2K个人类-机器人ICL对。对于模型训练,我们进一步引入上下文未来块预测(IFP)目标,抑制从已见任务中学到的捷径,并迫使策略从视频提示中提取任务信息。在RoboTwin 2.0模拟中的七个未见任务上,Zero-WAM实现了47.0%的平均成功率,比最强的视频-动作基线绝对提高了29.5个百分点。在真实世界评估中,它遵循人类视频引导,泛化到涉及多物体场景、长时程操作和精细插入的未见任务配置。 |
| RefVideo-6M:一个用于教学视频编辑的可靠参考数据集 |
Bojia Zi |
2026-08-26 |
PDF |
视频编辑领域的最新进展主要得益于大规模基于指令的数据集。然而,现有数据集仍存在两个关键局限。首先,目标视频通常由自动编辑模型生成,这可能引入可见伪影和不可靠的监督信号。其次,大多数公开数据集主要依赖文本指令,而缺乏对精确、保持身份和可控编辑至关重要的视觉参考。为解决这些问题,我们引入了RefVideo-6M,这是一个大规模参考引导编辑数据集,包含500万个视频编辑样本和100万个图像编辑样本。为确保可靠的监督,我们的数据集采用构建流程,将无伪影的真实视频作为编辑目标,并通过多个编辑专家生成经过质量过滤的输入条件。此外,它提供了约600万个视觉参考,涵盖多种参考类型和编辑场景,从而使模型能够学习超越纯文本指令的细粒度视觉对应关系。基于RefVideo-6M,我们进一步训练了一个参考引导视频编辑模型Ref-MoT,以评估所提出数据集的有效性和可扩展性。大量实验表明,RefVideo-6M比现有数据集提供了更可靠的监督,并支持训练具有更优视觉质量、可控性和参考一致性的强大编辑模型。开源数据集可在https://huggingface.co/datasets/RefVideo6M/RefVideo6M获取。 |
| 一种面向多模态无监督持续后训练的视觉依赖感知框架 |
Kaichen Li |
2026-08-26 |
PDF |
本文探讨了一个新任务——多模态无监督持续后训练(MU-CPT),使已部署的多模态大语言模型(MLLMs)能够从流式未标注数据中持续进化。现有的MLLMs无监督后训练方法通常统一优化目标令牌,忽视了它们异质的视觉依赖(VD)。然而,我们揭示令牌级VD对MU-CPT至关重要。具体而言,其结构扭曲可作为跨模态灾难性遗忘的指标,而其固有异质性则充当引导新任务学习的指南针。利用这一特性,我们提出了一种视觉依赖感知(VDA)框架,包含两个主要组件。首先,视觉约束最优传输(VC-OT)将新任务学习过程中旧任务VD的结构扭曲形式化为最优传输问题,以缓解跨模态遗忘。通过设计区域感知地面代价和依赖分层传输惩罚,它防止视觉焦点的全局偏移,同时严格禁止视觉依赖退化为语言偏见。其次,视觉调制适应(VMA)利用VD异质性强调视觉基础的新任务学习,促进新任务可塑性。综合起来,我们的方法在具有挑战性的MU-CPT中同时维持旧任务稳定性和新任务可塑性。在我们MU-CPT设置下的广泛实验验证了VDA的有效性。 |
| MyoMechanix:基于生物力学基础的组合式技能活动理解与指导 |
Hao Yin |
2026-08-26 |
PDF |
现有动作质量评估(AQA)数据集和方法主要依赖视觉输入,如RGB和姿态,忽视了肌肉力学等生理动态,且常将动作建模为单一模式。这些局限阻碍了细粒度、基于生物力学的反馈。我们提出MyoMechanix,一个针对负重动作的多模态生态系统,将运动与肌肉活动对齐。该系统经专家标注,包含来自38名受试者的20种动作的7500多个样本,配有同步多视角RGB视频、3D姿态、表面肌电信号(sEMG)及其他生理信号,构成迄今最大的多模态AQA基准。我们进一步构建了健身知识图谱(FKG),将专家标注组织为动作、阶段、关键步骤、错误及纠正反馈之间的结构化关系,实现组合评分和可解释评估。基于这些表示,我们开发了CUBIST(组合本体推理引擎),通过分解-分析-重组实现细粒度错误归因和反馈生成。我们还建立了MyoMechanix-AQA、MyoMechanix-VideoQA以及新颖的MyoMechanix-Video2EMG任务。实验表明,多模态感知和结构化表示提升了性能、可解释性和错误归因,其中CUBIST达到最先进水平;VideoQA增强了基于语言的行动理解;Video2EMG则提出了基于视频的替代方案,以降低昂贵的EMG传感成本。MyoMechanix将技能活动理解推向基于生物力学、多模态和组合推理,适用于健身、康复、医疗保健及机器学习中的物理AI应用。项目页面:https://haoyin116.github.io/MyoMechanix/ |
| 面向蜂窝边缘功率控制的智能体自主研究:彻底重新定义研究者的角色 |
Ahmad Khan |
2026-08-26 |
PDF |
设计用于无线资源管理的机器学习算法是劳动密集型的:架构、损失函数和训练方案均需手工指定。我们证明,这一设计层可以完全交由自主代理处理。我们采用自动研究协议,其中AI编码代理编辑训练脚本,运行固定预算的实验,并根据单一不可变指标保留或丢弃更改。我们授予代理对架构族、输入表示、输出参数化、损失函数和任务采样法则的权限,并为其设定一个因难度而选的目标:多小区网络中的和最小百分位速率功率控制。该公式针对小区边缘吞吐量,且非凸、非光滑,在其最大最小顶点之外是强NP难的。保障措施使结果可信:哈希固定的评估器、强制的推理契约以及每次实验预先注册的证伪器。在二十六小时内的八十一次无人值守实验中,代理在一次固定成本推理中达到了收敛的极小化-最大化参考值的$99.5\%$,推理成本约为其$600$倍更低,从其首个可行架构起弥合了$94\%$的差距,且一组参数适用于所有网络规模和百分位目标。它恢复了可证明的结构而非调优常数:其发现的输出参数化在最小百分位处精确复现了最大最小最优分配,对训练权重的每个值均成立。 |
| PlanSightRAG:一种面向土木标准图自动问答与合规检查的视觉优先多模态RAG方法 |
Nabaraj Subedi |
2026-08-26 |
PDF |
长期以来,土木基础设施合规性检查依赖工程师人工阅读传统二维图纸;然而,基于OCR的自动化剥离了解读这些图纸所必需的几何与布局信息。我们提出了一种名为PlanSightRAG的视觉优先多模态检索增强生成(RAG)框架。它直接对图纸图像进行索引和推理,集成了ColNomic-3B多向量检索、代理式Planner-Retriever-Auditor-Synthesizer,以及作为证据链的MaxSim热力图。我们引入了来自五个州交通部(DOT)标准图纸(共1,898页)的4,056对基准数据集。PlanSightRAG在零样本检索中实现了91.47%的Recall@5,在留出的密歇根州DOT语料库上达到91.40%。在合成、参数化生成的合规图纸上,我们的Qwen2.5-VL-72B流水线仅在提供预解析规则阈值时达到100%的判定准确率,而一个非VLM的OCR基线已能达到76.4%的控制上限。最后,我们通过直接从规范语料库中提取数值限制,无需任何人工提供的规则,展示了自主视觉规则接地能力。 |
| 利用稀疏自编码器在中微子基础模型中寻找并使用可解释的潜在特征 |
Raphaël Bonnet-Guerrini |
2026-08-26 |
PDF |
我们首次将基于稀疏自编码器的机制可解释性应用于粒子物理。研究一个在IceCube数据上预训练并针对方向重建进行微调的中微子基础模型,我们在模型表示中识别出一个经过验证的物理概念图谱,采用严格验证协议,包括留出测试、匹配的干扰对照以及跨独立字典训练的重现。因果干预表明,方向头几乎不利用这一图谱。受此未充分利用信息的启发,我们在同一事件级表示上训练一个不确定性头,以预测模型的角重建误差。与方向头不同,它因果依赖于图谱中的质量和亮度特征。在20%选择效率下,这一可解释估计器将中位角分辨率从20.2°提升至3.2°。这些结果表明,机制可解释性能够揭示模型内部表示中编码的潜在物理知识,并有助于设计利用这些知识的下游任务。 |
| 从产出到验证:AI如何让自由职业者技能贬值 |
Nakul Rajpal |
2026-08-26 |
PDF |
生成式人工智能被宣传为提升知识工作的一种方式,然而其益处与弊端在劳动力中的分布并不均衡。自由职业者和零工工人通常缺乏传统雇员可获得的技能提升途径,随着人工智能采用的推进,他们在技能发展和职业安全方面面临更高风险。我们回顾了关于人工智能对知识工作者工作流程及技能提升影响的实证证据,然后预测了在自由职业经济中,客户和工人采用人工智能的主要及下游效应。我们将此锚定于同一转变的两个案例:机器翻译后期编辑和软件开发。我们认为,自由职业者是这一变革的先锋,这一变革也波及受薪的人机交互从业者,最后我们以针对调解此类工作的平台和客户以及人机交互研究者的提问作结。 |
| 行星预测引擎:通过智能数据选择与基础模型嵌入实现自主地理空间预测 |
Evelyn Ma |
2026-08-26 |
PDF |
应对从粮食安全、灾害风险到疾病暴发和社会经济脆弱性等关键全球挑战,需要高保真地理空间建模。然而,构建预测性行星模型仍受制于碎片化的数据生态系统,需要手动数据检索、多模态数据整理与融合,以及迭代模型选择。我们提出了行星预测引擎(PPE),一个自主AI系统,可直接从自然语言查询执行这一端到端工作流。PPE即时合成多模态数据集,跨开放网络和地球观测平台(Data Commons、Google Earth Engine)检索时空相关协变量,并将其与地理空间基础模型嵌入(PDFM、AlphaEarth)融合。同时,它通过自动化过拟合防护搜索任务定制的模型架构族。在多样化任务、地理区域和科学领域中,PPE持续优于最先进或手动调优的专家基线。对于美国空间回归,PPE在21个CDC健康指标(76.8%对60.0%)、FEMA国家风险指数(64.9%对60.0%)和社会脆弱性指数(66.2%对58.6%)上平均提高了$R^2$。对于数据稀缺环境中的空间降尺度,PPE整合局部代理变量,将尼日利亚粮食安全指标的基线精度翻倍($R^2$为66.1%对31.5%)。对于2026年刚果民主共和国本迪布焦埃博拉疫情的流行病学即时预测,PPE实现了83.3%的Recall@10(在五次周预测中识别出18个新侵入卫生区中的15个),比公开最先进建模(约73%)提高了10.3个百分点。通过将自主多模态行星数据发现与目标模型优化相结合,PPE降低了行星尺度分析的技术门槛,实现快速、定制化、专家级部署。 |