跳转至

arXiv 2026-08-06

标题 作者 发布日期 PDF链接 摘要
基于强化学习的持久图空间随机动力学 Farzana Nasrin 2026-08-06 PDF 持续图(PDs)提供了多尺度拓扑结构的稳定且可解释的摘要。尽管在PDs的统计分析方面已取得显著进展,但现有文献通常将图视为静态对象,并为PD空间上的概率建模和随机演化提供有限的框架。我们引入了一个用于PD空间上随机动力学的强化学习框架,其中图通过拓扑感知的局部编辑操作进行演化。该动力学在具有可变基数的有限PD空间上定义了受控马尔可夫过程。我们建立了诱导马尔可夫链不可约、非周期且几何遍历的条件,这意味着PD空间上存在唯一的平稳概率律。为了引导动力学朝向科学相关的拓扑目标,我们制定了涵盖分布匹配、任务特定拓扑统计和结构保持压缩的目标。由此产生的奖励平衡了任务特定分布目标、图保真度和复杂度降低,并提供了一个用于自适应拓扑简化和概率建模的框架。在合成和神经影像PDs上的实验表明,所提出的框架能够在降低图复杂度的同时保留主要拓扑结构。
TLNM:使用Mask R-CNN从智能手机照片中进行外部验证的牙齿检测、编号和分割 Arash Nedaei 2026-08-06 PDF 口腔健康问题影响全球数十亿人,但专业牙科护理的成本和获取途径有限,阻碍了预防性口腔保健的开展。相关研究依赖临床级X光片或口腔内摄像头图像,这些资源对公众自我筛查不可用。本研究提出了一种用于智能手机照片的牙齿定位和编号模型。我们开发了一个定制的基于掩膜的区域卷积神经网络(Mask R-CNN)流程,并在1,272张标注的智能手机图像上进行了训练。为应对患者生成健康数据的变异性,该流程整合了两种基于领域知识的机制:一种掩膜灰度世界白平衡算法以减轻人工色偏,以及一种解剖约束检测层以强制结构有效性并抑制假阳性。评估包括四个阶段:内部留出测试、独立外部测试、描述性消融研究以及使用相同内部测试集的基于折的训练稳定性分析。在内部测试集上,模型实现了实例掩膜AP@50为0.818,类别感知PQ为0.780,操作F1为0.884。训练稳定性显示模型间变异有限:在十次运行中,实例掩膜AP@50的标准差为0.009。在外部数据集上,尽管人群、传感器和采集协议存在差异,模型仍实现了实例掩膜AP@50为0.901,类别感知PQ为0.832,操作F1为0.928。推理流程作为开源、容器化的API提供。这些结果表明,消费级智能手机图像能够支持自动化的牙齿级解剖映射,为资源受限环境中的远程筛查和远程牙科提供可扩展、潜在低成本的基礎。
视觉工具使用的幻象:图像思维的一种因果审计 Zhiheng Wang 2026-08-06 PDF “以图思考”范式赋予多模态大语言模型主动视觉操作能力,如裁剪与缩放。然而,使用这些操作的模型往往相比直接推理仅获得边际或负面的增益,同时产生显著更高的令牌成本。它们还可能反复裁剪无关区域,并在直接推理能正确回答的问题上失败。我们探究返回的视觉证据是否对答案产生因果影响。为回答此问题,我们将视觉工具使用形式化为一个因果图,区分观察介导路径与行动引发的捷径。随后,我们通过三个层面的干预进行审计:策略层(比较工具使用与直接推理)、轨迹层(在展开过程中破坏所有观察)和步骤层(在固定前缀下反事实替换单个观察)。我们的步骤层估计量——视觉证据增益——隔离了每个返回观察的贡献。在六个代表性模型和五个细粒度感知基准上,我们揭示了策略校准不足及其两种失败模式。在“不看而呼”中,返回的观察对答案无因果效应。在“不规划而看”中,观察具有信息性但调用计划不连贯。轨迹层诊断分解了策略层准确率增益,并显示该增益集中于校准良好的少数情况。我们将此差异称为视觉工具使用的幻觉:尽管总体准确率有所提升,视觉工具使用在广泛的展开中并非因果有效。代码可在 https://github.com/OpenCausaLab/CauAudit 获取。
在效用约束下提升合成临床基准的真实性 Omid Bazgir 2026-08-06 PDF 面向企业AI代理的合成临床基准能够通过现有实用性检查,但仍可能在结构上不切实际,尤其是在隐私敏感的医疗环境中,操作数据难以获取。我们研究如何在不破坏实践中已使用的下游实用性检查的前提下改进此类基准。我们将基准修订定义为受实用性约束的真实感提升:数据集变更应增加真实感,同时保持在操作实用性下限之上。我们在一个基于Synthea生成患者、通过演示电子健康记录工作流执行并由与操作数据相同的下游管道处理的护理缺口基准上实例化了这一想法。真实感通过缺失结构、简洁性、结构合理性和人群对齐来衡量。基线基准极为薄弱:采样对缺失率为79.44%,仅12.75%的行可操作,38.94%的患者无可操作度量,前三令牌集中度达到100.0%。两种确定性修订在保持当前实用性下限的同时改善了这些面板,而一种朴素的密集化控制则保留了不切实际的模板化。我们进一步表明,内部基准真实感和对聚合操作参考的源保真度是相关但不同的目标。这些结果表明,合成基准质量应被显式优化,实用性应被视为一个约束条件,而非真实感的充分证据。
OTLesMix:用于生成多样形状和位置合成病灶的Wasserstein重心与最优传输映射 Robin Trombetta 2026-08-06 PDF 过去十年间,深度学习的发展彻底革新了医学影像分割领域,使得从大量数据中提取精确描述符以表征病理成为可能。数据增强被广泛视为改善模型训练的一种技术,它包含简单变换如空间操作或强度调整,以及更高级的合成技术。其目标是从现有数据集中生成新的逼真样本,以丰富训练期间使用的图像多样性。其中,若干方法提出了不同的混合策略来组合真实样本。然而,它们的一个主要缺点是生成的病变形状和位置变异性有限。在本工作中,我们引入了一种新颖的图像合成方法,名为OTLesMix,该方法利用Wasserstein重心和最优传输计划来生成逼真且多样的样本。我们在三个脑病变分割任务上评估了该方法,与未使用合成数据训练的模型相比,Dice分数提升了2.9至6.6个百分点,并超越了最先进的基于混合的方法。
基于条件查询的假设检验:可学习性与交互的价值 Zonghuan Xu 2026-08-06 PDF 模型评估可以在观察任何响应之前固定所有测试,或利用早期响应选择后续测试。我们在有限结果空间$\mathcal{X}$(其中$|\mathcal{X}|=N$)的条件查询模型中研究这一选择。首先,我们询问哪些分布类对能够被可靠区分。然后,我们询问当所有查询事件必须预先固定时,需要多少额外查询才能匹配自适应测试器。我们证明,当且仅当两个类在其成对条件概率上具有正分离时,可学习性成立。当此分离为零时,最优最坏情况误差恰好为$1/2$,且在任何有限查询预算下均如此。对于任何$T$查询自适应策略和任何$\rho\in (0,1)$,我们构造一个随机非自适应程序,使用$O(N^2(T + \log(1/\rho)))$对查询,这些查询在任何响应被观察之前选择。其模拟转录在总变差距离上,相对于自适应转录,在模型中的所有分布上均匀地保持在$\rho$以内。我们还构造了一个匹配族,具有恒定的自适应查询复杂度和$\Omega_\varepsilon(N^2)$的非自适应查询复杂度。因此,最坏情况固定误差自适应差距为$\Theta_\varepsilon(N^2)$。这表明交互可以将所需测试数量减少二次因子,但交互式评估的明显指数分支并不会产生指数查询优势。
RxnCLF:面向改进反应性预测的对比变换感知反应基础模型 Yiting Zheng 2026-08-06 PDF 反应产率预测仍具挑战性,因为标记数据稀缺,且反应空间既组合庞大又分布稀疏,限制了现有反应表示的泛化能力。基于字符串、指纹和图谱的反应编码仅部分捕捉化学转化,使得对复杂底物反应的准确预测变得困难。我们提出反应对比学习基础模型(RxnCLF),一种用于反应表示学习的自监督对比框架。RxnCLF构建于凝聚反应图(CRG)之上,该图将反应物和产物信息统一为单一图,使模型能够学习明确且丰富的转化结构,而非不连通的图。在170万条Pistachio反应上预训练后,RxnCLF学习到一个紧凑且连续的潜在空间,同时捕捉反应中心特征和更广泛的侧链上下文,使其具有转化感知性和化学可解释性。在多个产率预测基准上微调,包括Buchwald-Hartwig、Pd催化的BH偶联,以及专有的HTE C-N偶联和酰胺形成数据集,RxnCLF始终优于基于图和序列的基线,提升了R2并实现了整体最佳性能。我们的结果凸显了基于CRG的RxnCLF作为可扩展反应基础模型的潜力,有望在更广泛的反应空间中泛化,并支持多样化的下游反应信息学任务,包括区域选择性预测、对映选择性预测和反应条件优化。
MASS:具有权威共享状态的多玩家世界模型 Ziqi Cai 2026-08-06 PDF 当前视频世界模型在多玩家环境中表现不佳,因为它们将世界状态与视角相关的视觉潜在变量纠缠在一起,导致计算冗余、视角不一致和可扩展性差。我们提出MAS(具有权威共享状态的多玩家世界模型)来解决这一限制。受多玩家游戏架构启发,MAS将世界动态与视角渲染分离。一个学习到的逻辑引擎从联合动作中推进全局、权威的类型化状态,无需任何手写转换函数,作为唯一的循环记忆和同步参考。基于这一共享状态,一个学习到的渲染引擎按需为任何请求的视角生成独立且一致的视图。这种显式分离使MAS在匹配的多玩家贪吃蛇基准测试中,相比最先进的多视角基线,实现了更高的状态准确性和更低的跨视角不一致性。它推进了包含1,024个并发玩家的预测世界,持续10,000个循环步骤。我们的结果表明,显式的权威状态建模为可扩展且一致的多智能体世界模拟提供了实用基础。
MetaboLLM:一种面向代谢组学的专用大语言模型,用于生化知识整合与预测性代谢物图谱构建 Dohyun Ku 2026-08-06 PDF 代谢组学知识分散在多种异构资源中,难以转化为预测性表示。我们开发了MetaboLLM,一种通过持续预训练、监督微调和结构化检索适配的代谢组学专用大语言模型,以及MetaboLLM-GIN,后者利用图同构网络将生成的生化描述转换为代谢物图,用于患者水平预测。在四个骨干家族中,MetaboLLM在代谢组学知识、关系和描述任务上均优于相应的基础模型和医学适配模型,并成功迁移至外部公共基准。MetaboLLM-GIN在冠状动脉旁路移植术后应激性高血糖预测(AUC 0.8616)和绝经后激素方案分类(AUC 0.8123)中取得了最高AUC,优于传统模型、替代图构建方法以及由未适配或非检索LLM配置生成的图。模型解释进一步在两个应用中产生了具有生物学意义的发现。这些结果表明,领域专用语言模型能够将异构生化知识组织为可预测且可解释的代谢物图表示。
面向可部署的孟加拉手语识别:基于专家验证数据与轻量级注意力模型 Saad Ahmed 2026-08-06 PDF 孟加拉国的聋人和听力障碍人士主要通过孟加拉手语(BdSL)进行交流。在个人设备上实现自动BdSL识别,可以拓宽教育和服务的获取渠道。现有系统使用受控环境数据集,缺乏专家验证,且采用重量级预训练骨干网络,不适合设备端使用。我们引入了RSBdSL38,包含10,874张经专家验证的图像,覆盖所有38种BdSL手语手势,代表孟加拉字母表的51个字母,数据来自孟加拉国三所特殊需求学校的真实手语者。我们提出了一种轻量级基于注意力的卷积网络,参数量为298,470,由分组瓶颈残差块、通道和空间注意力、多尺度深度手部特征块、双池化和Swish激活函数构建。该网络从零训练,达到96.37%的准确率(五个随机种子下95.72% ± 0.54%),在相同协议下,与九种ImageNet预训练高效架构中最佳者相比,仅差1.08个百分点,而参数量减少了8.5至68倍,MACs减少了1.3至21.7倍。重新训练后,在六个公开BdSL基准上达到92.95%至98.33%的准确率,在合并语料库上达到97.04%,在BdSL-38上零样本准确率为76.25%。移除任何架构阶段会导致7.61至89.30个百分点的性能下降,而训练方案调整最多影响3.17个百分点。Grad-CAM结合删除-插入和权重随机化检查确认预测遵循手语手部动作。一个排除6名手语者(共36名)的独立手语者分割测试达到85.18%的准确率。量化至0.48 MB后,在商用智能手机上以15.5 MB的内存占用,每张图像处理时间为3.98毫秒。综上,RSBdSL38和我们的从零训练模型将基准准确率转化为可部署的无障碍应用,成本仅为预训练骨干网络的一小部分;数据集、代码和模型均已发布。