跳转至

arXiv 2026-07-28

标题 作者 发布日期 PDF链接 摘要
具身操作的数据金字塔 Yifan Ye 2026-07-27 PDF 多模态基础模型通过消耗整个互联网学会了看和说。具身智能体则没有这样的捷径,因为它们需要将观测与物理状态和动作耦合的数据。这些信号可以由多种数据源以不同程度提供。在这项工作中,我们将具身数据生态系统组织为一个"金字塔",涵盖五个互补来源:真实机器人数据、UMI风格数据、自我中心和外中心数据、仿真数据以及通用视觉语言数据。我们围绕可扩展性与机器人对齐之间的张力组织这个金字塔,并进一步从数据质量、多样性、可重用性和物理保真度方面描述每个来源。然后,我们通过数据配方的视角分析近期具身基础模型,考察预训练过程中如何选择、对齐和混合不同来源。对于具身大脑模型、视觉-语言-动作模型和世界-动作模型,我们将数据组成与感知、推理、规划、动作生成和世界预测能力联系起来。最后,我们讨论六个开放挑战:构建大规模触觉数据集、收集失败与恢复数据、开发可扩展的数据收集流程、对齐不同具身形态的动作、利用自我中心数据进行灵巧操作,以及设计机器人学习的原理性数据配方。我们希望这项工作能为下一代具身系统的设计奠定基础。
ClinFusion:一种以视觉为中心的多模态大语言模型系统,用于全面医学理解 Hangjie Yuan 2026-07-27 PDF 多模态大语言模型(MLLMs)在革新临床实践方面潜力巨大,但将其部署到医疗领域本质上是一个以视觉为核心的挑战:模型必须从异质的2D和3D医学图像中吸收知识,评估协议需与放射科医生的临床实践对齐,并提供准确、细粒度且基于事实性的评估。本文提出ClinFusion——一种以视觉为中心的MLLM,专为整体性医学理解设计,系统性地解决了上述局限。我们提出一种组合式级联视觉编码器架构,其中包含级联空间感知局部融合算子,可在融合编码器内统一处理多样化的2D和原生3D医学图像理解。进一步引入基于视觉的评估框架,包括用于指令跟随评估的MedIF-Bench,以及基于感兴趣区域的临床对齐且事实性驱动的报告生成评估方法。实验表明,ClinFusion在涵盖视觉问答、报告生成、指令跟随的2D和3D多模态医学基准测试集以及文本医学任务中均达到新最优水平,在24项基准测试中20项超越领先的开源医学MLLM(如Hulu-Med、Lingshu),在16项基准测试中13项展现出优于GPT-5.2和Gemini-3-Flash等强大专有模型的多模态能力,并可进一步通过智能体工具使用增强检索增强和工具辅助的临床工作流。经委员会认证放射科医生的盲评证实,ClinFusion生成的报告质量最高,且我们提出的基于RoI的评估指标在所有自动评估指标中与专家判断的相关性最强。
认证的并行时间Sinkhorn用于动态熵最优传输 Xinyang Wen 2026-07-27 PDF 动态应用(包括最优传输流匹配)需反复求解相关的熵最优传输问题,但传统分布式Sinkhorn过程采用顺序执行且每次迭代后同步。我们提出TemporalSinkhorn——一种时间并行执行器,它批量处理未来候选解及其修正,且不牺牲输出精度。基于中心化行分片的验证器仅接受确定性安全前缀。剩余候选解共享打包的Sinkhorn更新;在线投影遗忘率设置审计里程碑,后验残差检查可从任何深度低估中恢复。因此预测可改变工作分配,但无法授权不精确输出。在4块A100 GPU上,针对n=2048的60次运行、五种子网格实验表明:在五个统计显著的区域单元中,遗忘引导的里程碑相比每次打包迭代均审计的方案,将实际运行时间降低1.15倍至1.47倍。相较于顺序软c变换热启动,时间并行执行在六个合成数据流上实现1.42倍至3.55倍加速,且零边际容差违规。在流匹配小批量数据流上,n=2048时时间并行执行比顺序携带方案快3.054倍至3.632倍,无容差违规。在RTX 4060笔记本GPU上的独立固定核测试给出4.315倍几何平均加速。这些是互补性部署研究,而非受控硬件对比。端到端流匹配集成、优化求解器对比及多节点验证仍有待探索。
从多个数据提供者学习分布 Jon Kleinberg 2026-07-27 PDF 受从异构且重叠的数据提供者中学习的启发,我们研究了一个基于受限条件样本进行分布学习的简化模型。目标是学习有限域$[n]$上的未知分布$p$。学习者拥有一个固定的可查询集合族$\mathscr{S} \subseteq 2^{[n]}$,每次对$S \in \mathscr{S}$的查询会返回一个来自条件分布$p(\cdot \mid S)$的独立样本。可学习性由与$\mathscr{S}$关联的共现图决定:若两个域元素同时出现在某个可查询集合中,则它们在图中相邻。当该图在目标支撑集上连通时,可实现逐点一致性。PAC学习要求更高:当共现图完全时才有可能。PAC学习的最优样本复杂度范围从近线性到二次。每个具有完全共现图的查询族都满足样本复杂度$\widetilde O(n^2/ε^2)$,且在最坏情况下该界是紧的。另一方面,若$[n]$本身可查询,则普通抽样可将界改进至$Θ(n/ε^2)$,即使所有集合都可查询也无法进一步改进。更一般地,我们识别出层次可比性是$\mathscr S$的一个充分结构条件,在此条件下最优复杂度为近线性$\widetilde Θ(n/ε^2)$,其中成对查询族是典型例子。最后,线性到二次之间的所有多项式速率均可实现:对于每个$α\in (1,2)$,存在一个查询族,其最优PAC速率为$\widetilde Θ(n^α/ε^2)$。
在策略扩散蒸馏中重新思考无分类器引导 Bingnan Li 2026-07-27 PDF 在策略蒸馏(OPD)通过沿当前学生生成的轨迹查询教师模型来适配扩散模型,但其在无分类器引导(CFG)这一现代扩散系统默认组件下的行为机制尚不明确。现有OPD方法自然地将速度匹配扩展到CFG组合预测中,直接匹配教师与学生的引导速度。我们发现该目标在分支层面存在欠辨识问题:正负分支误差可在引导预测中相互补偿。通过两个对比案例,我们发现当共享负条件时,朴素匹配仍有效,此时两个分支误差同步下降。但当模型原生CFG模式在教师负分支中保留学生无法获取的特权信息时,这种联合下降机制被破坏,组合目标会引发对抗性分支误差动态——在降低正分支误差的同时增大负分支误差。我们将这种失效模式称为负分支不对称性(NBA)。为解决NBA问题,我们提出正方向匹配(PDM),这是一种分支感知的OPD目标,分别约束正预测和CFG条件方向。我们将PDM应用于稠密到稀疏视频控制任务,其中朴素引导匹配对推理引导尺度高度敏感,而分支感知监督能实现更鲁棒有效的知识迁移。
KANEx:将Kolmogorov-Arnold网络的可解释性转化为医学可解释性 Krithi Shailya 2026-07-27 PDF 计算机视觉模型在医疗应用中已展现出高效性,但其黑箱特性持续削弱临床医生的信任。在临床工作流中,胸部X光分类器正越来越多地与视觉语言模型(VLM)结合,以生成自然语言解释。然而,这些系统仅增加了语言流畅性,并未解决视觉模型底层的不透明性。随着Kolmogorov-Arnold网络(KAN)的出现——其基于样条函数的组件提供了天然可解释的功能单元——我们探究了这种架构透明度能否用于生成更可信的文本解释。我们提出KANEx,这是首个利用KAN符号透明度来支撑VLM推理的框架。这种可解释性还使得设计KAN-Map成为可能——一种直接源自KAN模型而非梯度近似的创新热力图生成方法。我们将这些基于可解释性上下文的特征输入下游VLM以增强可解释性。在MIMIC-CXR数据集上的基准测试表明,基于ResNet/ViT基线的KAN架构在提升语义相似度的同时,生成了显著更可靠的显著性图。KAN架构将视觉定位与下游推理质量提升了10%。我们的研究结果表明,将语言解释与视觉归因锚定在数学可解释单元上,是迈向可信医疗AI的必要步骤。
MicroZoom:极端尺度下的结构保持细节合成 Huy Huynh 2026-07-27 PDF 我们提出MicroZoom,一种在微观尺度下生成十亿像素图像的框架。给定一张标准照片和一组稀疏的消费级显微镜特写图像,MicroZoom能合成一张无缝的十亿像素分辨率图像,该图像基于真实参考材料的特性,支持在物体整个空间范围内探索微观纹理的可视化。我们的目标是实现合理的合成,而非精确重建。我们专注于基于参考的全图像极端尺度超分辨率,放大倍数高达350倍,这一设定带来了两大挑战:(1)在高度有损输入中,于模糊的材料边界附近恢复纹理细节;(2)在数百万个局部预测中,保持正确的大尺度图案结构,例如织物编织的重复几何形状。我们采用两阶段级联设计来解决这些问题:第一阶段恢复全局图案一致性,第二阶段细化局部纹理细节,并辅以分割掩码来指导模糊边界处的合成。我们在自拍日常物品集合上验证了该方法,展示了全局一致且基于材料的十亿像素图像。
人工智能赋能红外成像在儿科骨骼分诊中的应用:叙述性综述与未来展望 Sajad Amiri 2026-07-27 PDF 背景。儿童肌肉骨骼创伤占儿科急诊就诊量的18%,但诊断仍依赖电离辐射成像。生命早期累积的低剂量辐射会增加终身白血病和脑恶性肿瘤风险,这推动了无辐射分诊替代方案的研究。目的。综合证据构建混合框架,将宽谱红外成像与深度学习跨模态翻译相结合,从非电离数据生成临床可解释的合成X光片重建图像。方法。我们回顾了覆盖650纳米至1毫米的五个红外光谱窗口——近红外一区、近红外二区、短波红外、中波/长波红外和太赫兹——并探讨双几何(透射/反射)采集如何利用波长特异性组织深度和生化敏感性。总结了用于将红外数据对齐融合为X光等效重建的图像到图像翻译网络(Pix2Pix、CycleGAN、Swin-Unet)和特征匹配算法(SuperPoint、SuperGlue、ALIKED、LightGlue)。意义。儿童解剖结构——更小的横截面、更薄的皮质骨——有利于红外穿透,可实现紧凑便携的无辐射分诊硬件。可行性基于功能性近红外光谱和经颅光生物调节证据:近红外光可穿透皮肤、颅骨和皮层,且信号足以进行血流动力学监测——这比穿透儿童前臂或远端腿部的路径更长、衰减更强。关键障碍:配对红外/X光数据集构建、人工智能医疗器械监管路径、跨体型和肤色的泛化能力、采集协议标准化。结论。集成多光谱红外+人工智能成像是有望替代儿童骨骼X光检查的无辐射方案。进展需要多中心配对数据集、外部验证模型以及符合IEC 60825-1标准的红外源安全认证。
求解非线性PDE的DGM和PINN算法的全局收敛性 Justin Sirignano 2026-07-27 PDF 深度伽辽金方法(DGM)和物理信息神经网络(PINNs)已成为科学机器学习这一快速发展的领域中求解偏微分方程(PDEs)的常用方法。在这些方法中,通过使用(随机)梯度下降法最小化神经网络的PDE残差,训练神经网络以逼近PDE解。由于PDE残差目标函数的非凸性,训练后的神经网络原则上可能仅收敛到目标函数的局部极小值(这并非PDE的解)。因此,关于这些算法的数学基础长期存在疑问,而证明训练后的神经网络将收敛到PDE解具有重要价值。针对一类半线性PDE(解及其一阶导数呈非线性),我们证明了通过梯度下降法训练以最小化PDE残差目标函数的神经网络将收敛到PDE解。
DreamStyle3D:基于双注意力解耦的高效3D风格化资产生成 Kai Wang 2026-07-27 PDF 随着游戏、动画和虚拟现实产业的发展,对高效生成风格化3D资产的需求迅速增长。然而,现有方法在同时保持风格保真度、几何一致性和生成效率方面仍面临挑战,因为大多数方法仍依赖间接的2D到3D风格化流程。这促使我们开发一种原生3D风格化框架,能够在保持高效的同时显式解耦风格与几何特征。为此,我们提出DreamStyle3D,一种基于解耦双交叉注意力机制的高效风格化3D资产生成框架。该方法显式分离几何与风格特征,在保持结构一致性的同时实现高效风格注入,并进一步采用轻量级训练策略增强风格一致性与模型泛化能力。此外,我们构建了自动化数据流水线,并创建了包含约1.5万组内容-风格-风格化三元组的数据集用于训练与评估。大量实验表明,DreamStyle3D可在10秒内生成高保真、几何一致的风格化3D资产,在保持卓越风格质量的同时显著提升效率,为3D内容创作提供了新方案。代码与数据已开源至https://github.com/HVision-NKU/DreamStyle3D。