跳转至

arXiv 2026-07-21

标题 作者 发布日期 PDF链接 摘要
视觉相似性的多重感知:一种文本提示的图像感知度量 Sheng-Yu Wang 2026-07-20 PDF 人类视觉相似性判断具有上下文依赖性。例如,两张图像可能在形状上相似但颜色不同。然而,现有的感知相似性度量将这些细微差异压缩为单一标量值,无法针对特定方面进行条件化处理。为弥补这一不足,我们引入了一个大规模人类相似性判断数据集,该数据集基于图像三元组构建,每个三元组在多个自由形式的语义相似性维度上进行了标注。对前沿视觉语言模型(VLM)的基准测试显示,这些模型与人类标注者的共识之间存在显著性能差距。利用我们的数据,我们微调了一个VLM,生成了文本提示图像感知相似性(TPIPS)度量,该度量能根据指定的文本提示捕捉视觉相似性的多重含义。实验证明,TPIPS与人类感知的一致性更高,且能可靠地泛化到训练分布之外。最后,我们展示了TPIPS在文本引导检索、组合搜索以及生成模型细粒度评估中的新能力。我们的代码、数据和训练模型已开源在 https://peterwang512.github.io/TPIPS。
补丁策略:通过密集视觉表征实现高效具身控制 Gaoyue Zhou 2026-07-20 PDF 来自Vision Transformers(ViTs)的预训练密集视觉特征虽然强大,但在机器人学习中尚未得到充分利用。现代机器人策略要么将每次观测压缩为单个全局标记,要么依赖从头训练的视觉骨干网络,这既牺牲了细粒度空间细节,也失去了大规模视觉预训练的优势。虽然存在像大型视觉-语言-动作模型(VLAs)那样处理密集补丁特征的策略,但它们往往笨重且缓慢,继承了十亿参数视觉-语言模型(VLM)骨干的全部计算成本。我们通过Patch Policy填补了这一空白——这是一种极简架构扩展,使基于Transformer的策略能够直接消耗预训练的密集补丁标记,而无需完整VLM的计算开销。其核心是块因果注意力掩码,它在保持标准策略时间因果性的同时,让模型能够关注每次观测中的多个补丁标记及其他状态信息。Patch Policy轻量、快速且高效。在四个模拟环境和三个真实世界环境套件中,我们的方法相比使用最先进全局池化表征的策略实现了40%的相对改进。此外,它在仅使用约0.7%参数量的情况下,超越了微调后的OpenVLA-OFT达18%。我们相信Patch Policy为机器人社区提供了一条便捷利用视觉表征学习持续进步的管道,同时不会牺牲高频反应控制所需的训练效率或推理速度。视频可访问https://patch-policy.github.io查看。
自动发现没有普遍优越的约束装置 Akshat Gupta 2026-07-20 PDF 诸如OpenEvolve和TTT-Discover等自主发现系统常被用作通用型搜索框架。然而在实践中,这些复合系统将档案管理、父代选择、探索策略和预算分配等多个设计选择整合为单一方案。由于发现过程成本高昂且具有内在随机性,现有框架常因独立试验次数过少而难以区分关键方法改进与运行间方差。我们系统解构了OpenEvolve式进化搜索和TTT-Discover搜索框架的组成模块,通过超过310万次大语言模型调用和重复试验统计分析,在12个模型-问题组合上系统评估了30个预算匹配的搜索框架。结果表明发现框架存在泛化问题:没有固定框架能在所有评估的模型-问题组合中稳定胜出,且OpenEvolve变体普遍逊于更简单的替代方案。因此,框架选择更应被视为超参数而非通用方案,需针对具体问题和底层模型进行定制。我们还发现早期发现进展可预测最终性能,并据此提出预算匹配的自适应分配实验:启动多个框架,剪枝表现较弱的局部运行,将算力重新分配给更强的幸存者,其表现优于随机采样固定框架和非自适应框架集成。这些结果共同推动从固定框架选择转向由早期性能引导的在线自适应策略。我们发布所有运行池(包括每个模型-问题组合的基线零分布)作为可复用的统计基础设施,供未来框架提案使用。
重要的不是你说什么,而是你怎么说:评估大语言模型对信念表达的反应 Kevin Du 2026-07-20 PDF 用户经常向大型语言模型(LLMs)表达其信念。在某些情况下,LLM应将这类语境信念视为真实信息;而在其他情况下,则应坚持其先验知识。值得注意的是,用户的信念表达(EoBs)可采用多种语言形式——通过预设、证据标记、确定性标记或不同语气——每种形式对LLM的说服力可能不同。我们提出了一种类型学框架,系统评估不同EoBs如何影响模型在遵循语境与坚持先验知识之间的选择。该类型学基于四个语言学维度:形式、证据性、认知立场和语气,涵盖17种细分类别。通过将这些EoBs与世界知识事实配对,我们生成了受控的EoB-查询对,以隔离语言变异的影响。利用该基准,我们评估了16个在架构(Llama3、Qwen3、Gemma3)、规模(1B-30B参数)和训练阶段(基础模型vs指令模型)上存在差异的LLMs。我们识别出这些维度上响应行为的显著差异,例如,较大模型和指令模型比小模型和基础模型更不倾向于遵循语境。此外,我们发现某些特定EoBs在统计上显著地比其他EoBs更一致地影响语言模型。我们的研究揭示了语言框架如何系统性地影响LLM语境整合的模式,对提示工程和模型鲁棒性具有启示意义。
现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化方法 Yi Tang 2026-07-20 PDF 现代视觉语言模型(VLMs)显著提升了图像生成与编辑能力,使得跨模型和分布外场景下的像素级图像篡改检测日益重要且充满挑战。本研究针对ChatGPT、Gemini、Qwen-Image等现代VLM的像素级图像篡改检测开展域泛化研究,旨在学习能适应多样化VLM生成篡改分布的鲁棒定位模型。我们提出一个简洁高效的域泛化训练框架,基于两项实用策略构建。首先,引入平衡小批量采样方案,在每个小批量中策略性地采样篡改图像与真实图像,防止优化过程偏向篡改伪影或干净图像先验,避免训练崩溃,确保每次优化步骤获得恰当的采样梯度信号。其次,采用简单的后期注入策略:检测器先在大型基础数据上训练至稳定收敛,再引入少量来自新兴VLM分布的新增支撑数据,在避免过拟合有限新域的同时提升适应性。这些组件共同为提升现代VLM的像素级篡改定位与OOD鲁棒性提供了简洁而强大的方案。尽管概念简单,我们的框架在GPT-Images-2.0、Gemini-3.1、FLUX.2和Seedream 4.5等OOD VLM上,平均gIoU和cIoU分别相对提升26.1%和26.8%,大幅超越此前最优方法PIXAR。代码已开源:https://github.com/VILA-Lab/PIXAR-DG
压力下的逻辑判断:利用学习软前缀诊断三段论稳定性 Brian K Chen 2026-07-20 PDF 为测试正确逻辑判断如何响应习得语境,我们在一个精确标注的三段论推理基准测试前添加软前缀,同时保持模型固定。软前缀是不透明的连续向量,因此我们通过它们在逻辑形式和接口的受控变化中诱导的行为来表征它们。通过研究哪些前缀成功及其效果如何泛化,我们描述了习得语境压力如何覆盖正确判断并暴露模型逻辑稳定性的局限。在Qwen3.6-35B-A3B MoE、Qwen3-8B和Gemma 4 31B上,习得前缀重定向了许多正确答案,并在未见形式和接口变化中保持有效。在Qwen3.6 MoE和Gemma的重复测试中,它们在所有16个模型-方向-分割比较中优于配对随机控制,差距为37到99个百分点。Qwen3.6 MoE在措辞和提示变化中的翻转率保持在72%到90%之间,而Gemma有效性前缀的翻转率保持在54%到56%,匹配随机前缀则低于1%。诊断测试表明,主要效应是对一种答案含义的广泛偏好,而非固定符号强制或可在任务间可靠转移的逻辑操作。这种偏好的形式因模型而异。在两个Qwen模型中,简单得分模型通常能预测哪些判断会翻转,但无法预测其边际移动幅度,而Gemma的整体响应则更接近这些模型的近似。这些结果表明,成功软前缀的主要行为效应是广泛的答案偏好,而剩余响应则揭示了逻辑稳定性中显著的模型特异性差异。
FlowMimic:基于像素对扭曲流场的无遮罩视觉编辑与生成,用于在线视频编辑数据生成及模态模仿 Dingyun Zhang 2026-07-20 PDF 遵循视觉研究的主流方向,我们探索在单一模型中整合视频与图像模态的生成与编辑能力。当前收集视频编辑数据的方法通常依赖耗时费力的人工流程——涉及对象掩码标注、通过I2V模型和ControlNet类引导引入误差的配对合成、以及基于VLM的质量过滤或优化——且任务扩展性有限。因此,编辑任务的多样性仍远低于图像编辑模型。我们开发了一种像素对时间扭曲流场,可直接从图像编辑样本实时生成对应的视频编辑样本,并在多个层级的视频编辑任务中证明模型仅需此类数据即可学习视频编辑。我们将图像模态视为视频模态的特殊形式,据此设计模态模仿生成损失与模态模仿编辑损失,通过相互模仿使两种模态的能力及输出分布相对对齐。此外,基于语言的视觉编辑需要理解编辑指令与参考视觉内容、定位参考视觉内容中对应指令的区域、并仅修改该区域。现有方法主要依赖外部辅助,如微调额外MLLM或在推理时显式提供掩码序列作为辅助输入。我们则期望模型内化这一能力,为此引入感知相关任务(如指代分割)及对应的编辑区域感知隐层损失与注意力损失。
不规则时间序列上的因果发现 Martim Penim 2026-07-20 PDF 因果发现方法在时序系统中表现出色,但通常依赖规则且离散的滞后结构,这限制了其对规则采样数据的适用性。然而,许多实际任务需要处理不规则采样的事件流,例如传感器数据流、医疗健康数据和金融交易。本研究提出对PCMCI+(一种处理规则多变量时间序列因果发现的先进方法)进行扩展,使其能够处理不规则时间序列。我们的方法不再通过固定滞后依赖关系建模因果关系,而是通过预定义时间窗口聚合因果影响。我们在不同信噪比条件下,基于已知因果结构的合成不规则事件流上评估该方法,结果表明该方法能持续恢复潜在因果图,并在不规则采样数据上显著优于标准PCMCI+。
向量搜索作为最近邻匹配:基于RAG的因果推断策略学习 Masahiro Kato 2026-07-20 PDF 我们提出基于检索增强生成(RAG)策略学习的一步法与两步法。在潜在结果框架下构建基于RAG的行动选择机制。两步法中,向量检索在嵌入空间中提取行动相关的邻近证据,生成器估计条件期望结果或其对比值,再通过插件规则选择行动。该框架将行动特定向量检索与因果推断中的最近邻匹配建立关联。我们将两步法的遗憾值分解为候选生成遗憾与候选内选择遗憾,并利用最近邻估计器与Transformer的预测误差保证对后者进行约束。由于一步法的中间计算过程不可观测,我们直接将其作为策略进行评估。
GigaPath-Flash与GigaTIME-Flash:面向全切片及肿瘤微环境分析的高效病理学基础模型 Naoto Usuyama 2026-07-20 PDF 基础模型已成为计算病理学领域的核心驱动力,通过从大规模组织病理学数据中学习可迁移表征,有望革新癌症诊断、预后判断及治疗方案选择。当前病理学基础模型的发展格局已涵盖多样化的数据来源、架构体系及下游应用场景。然而,现有预训练模型大多仅支持图像切片级操作,采用限制性许可协议,且计算成本高昂,这严重制约了其在全切片临床与科研场景中的大规模应用。为此,我们推出GigaPath-Flash与GigaTIME-Flash——面向全切片病理AI与空间蛋白质组学预测的高效模型。GigaPath-Flash采用2200万参数的ViT-S切片编码器与2100万参数的LongNet全切片编码器组合架构,两者均基于大规模真实世界组织病理学数据预训练。其轻量化切片编码器通过知识蒸馏技术从十亿参数级GigaPath(ViT-g)教师模型获得,并作为两个模型的共享组件。GigaPath-Flash在保持GigaPath平均全切片性能97%的同时,计算量降低50倍。GigaTIME-Flash在此基础上扩展,可直接从常规H&E染色图像预测肿瘤免疫微环境,其预测质量超越原始基于CNN的GigaTIME模型,运行速度提升6倍,GPU内存占用减少8倍。与GigaPath和GigaTIME共同构成采用Apache-2.0开源协议、基于大规模真实临床数据预训练的开放权重模型家族。通过完整发布所有模型与权重,我们为计算病理学、免疫肿瘤学及精准医疗领域提供可便捷获取的基础工具组件。