跳转至

medRxiv 2026-06-24

标题 作者 发布日期 PDF链接 摘要
ALEX:通过多智能体自动生成语言解释以解读治疗效果 Lu, M. 2026-06-24 PDF 精准医学需要理解如何将随机临床试验中的总体治疗效果应用于个体患者。机器学习方法在估计患者层面的治疗效果方面展现出一定潜力,但其临床实用性仍有限,因为这些方法往往无法解释为何不同个体对同一治疗的反应存在差异。本文提出ALEX——一种基于可解释人工智能(XAI)的多智能体框架,通过将驱动精准预测的变量转化为基于数据的自然语言临床解释,填补了这一可解释性缺口。ALEX首先独立识别随机临床试验中存在的重要亚组治疗效果,随后将这些信息传递给大语言模型(LLM)智能体,生成情境化且经过审慎分析的临床见解。在五项里程碑式随机对照试验中,ALEX在治疗解释质量指标上优于现有智能体方法,这些指标与生物医学文献一致,并经过美国及台湾地区专科医师的盲审验证。在实证案例研究中,ALEX提供了关键的可解释性见解,例如识别出基线血糖水平可解释ACCORD-BP与SPRINT试验之间的分歧结果,并提出年龄是创伤后院前氨甲环酸疗效的新颖关键效应修饰因子。这些发现表明,ALEX能够将治疗效果异质性转化为基于临床的解释,从而推动精准医学的发展。
针对报告抑郁症状的成人进行频闪光刺激:一项分阶段早期研究中的安全性、耐受性、可行性及主动对照开发 Nacker, D. 2026-06-24 PDF 频闪光刺激(SLS)是一种候选的非药物干预手段,可诱发短暂的视觉和情感体验,在抑郁症治疗中具有潜在应用价值。在疗效验证前,临床开发需获取安全性、耐受性和可行性数据。我们报告了一项针对自述抑郁症状成年人的分阶段单中心研究。工作包1(WP1)测试了11组SLS参数的安全性和耐受性。一项过渡性桥接研究评估了低现象学SLS对照组能否在保留实验情境的同时减少主观视觉效应。WP2将84名参与者随机分配至每周四次、每次31分钟监督干预组或低现象学对照组。WP1中分析了31名参与者:未发生严重不良反应,平均不适感评分为0.49/10,单次干预最高80%置信上限为1.13/10,远低于预设阈值。桥接研究证实干预组与对照组存在体验差异。WP2中70/84名参与者(83.3%)获得终点数据:干预组39/42人,对照组31/42人。总体保留率达标,但对照组保留率较低仍是设计问题;方案依从性高,不适感持续低水平,未发生SLS相关的严重不良事件。探索性抑郁症状变化提示BDI-II可能存在信号,但未确立疗效。监督式SLS满足关键安全性、耐受性和可行性标准,低视觉现象学主动对照组可继续使用,但盲法和对照组可信度仍需验证。下一步将开展由临床试验中心(CTU)管理的诊断明确型2a期可行性试验,预先注册锁定方案并测试盲法、可信度、保留率和终点精确度。
腰椎矢状位T2加权MRI中中央椎管狭窄深度学习分类器的不确定性量化 Brenzikofer, A. 2026-06-24 PDF 背景:腰椎MRI上中央椎管狭窄(CCS)严重程度的准确评估对临床决策至关重要。我们评估了基于矢状位T2加权MRI的深度学习模型用于自动CCS分级,重点关注不确定性量化以提升临床可靠性。方法:利用LumbarDISC数据集(1974例患者)的回顾性队列,我们比较了多种深度学习架构用于三级CCS分类(正常/轻度、中度、重度)。为评估模型置信度,应用了蒙特卡洛(MC)dropout和测试时增强(TTA)技术来量化预测不确定性。结果:微调的脊柱分级网络(SGN)实现了79.4%的平衡准确率和68.8%的宏F1分数,其中中度狭窄的每类准确率为71.3%,重度狭窄为78.5%。MC dropout显示不确定性主要在中度和重度病例中增加,而TTA不确定性在轻度狭窄中更高。结论:基于深度学习的CCS分级通过提供快速、标准化的评估展现出辅助放射科医师的潜力。纳入不确定性量化可为标记模棱两可的病例提供保障,从而支持临床信任并促进AI工具更安全地整合到脊柱MRI解读中。
Empatica E4腕带在自主神经与体温调节睡眠监测中与同步多导睡眠图对比的有效性与局限性:一项基于Wearanize+数据集的研究 Parry, Y. D. 2026-06-24 PDF Empatica E4腕带可提供连续的多模态生理监测,包括血容量脉搏(BVP)、皮肤电活动(EDA)和皮肤温度(TEMP),但其在睡眠阶段特异性自主神经与体温调节监测中的有效性尚未与同步多导睡眠监测(PSG)进行系统评估。本研究利用Wearanize+数据集(包含100名居家受试者的同步PSG、Empatica E4和Zmax脑电图记录),对Empatica E4生理信号在五个睡眠阶段中与PSG金标准进行了系统验证。100名受试者中,92人拥有Empatica数据;69人满足Zmax脑电图信号质量标准并构成分析样本。Empatica预计算心率通道的心率(HR)显示出有效的阶段特异性模式(清醒期:70.9 bpm,N3期:61.2 bpm),且与PSG心电图的平均NN间期存在中等程度的跨设备一致性(各阶段Spearman r=0.35-0.42)。皮肤温度呈现预期的体温调节模式(清醒期:33.92°C,N3期:35.48°C),建议用于下游分析。紧张性EDA在深睡眠期因腕部汗液积聚出现倒置阶段模式,这是腕戴式EDA在睡眠中的已知混杂因素。相位性EDA呈现合理模式,可谨慎使用。这些发现为Empatica E4睡眠研究建立了经过验证的特征集,并直接为使用Wearanize+数据集的多模态精神科生物标志物研究提供参考。
SenseCheQ:基于自主定量感觉测试的家庭神经功能自我评估 Gausden, J. 2026-06-24 PDF 化疗引起的神经病变是癌症治疗中常见且令人衰弱的副作用。约30%的患者会出现慢性神经病变,由于缺乏有效治疗手段,早期发现神经病变以调整化疗方案仍是目前最佳的预防策略。然而早期检测面临挑战,因为目前尚无兼具足够精准度和可及性的诊断工具供患者或临床使用。为解决这一问题,我们开发了SenseCheQ系统,使患者能够在家中进行自主感觉测试。本文介绍了应对该挑战的工程方法,包括创新的热触觉集成技术,可实现皮肤温度钳制与精准触觉刺激校准,从而提高测试可重复性。在环境和用户相关变量影响下,该系统仍展现出稳健性能。此外,我们分享了接受癌症化疗患者的预期案例研究,这些患者通过SenseCheQ定期进行感觉测试以监测居家神经功能。这些原理验证研究表明,SenseCheQ能够检测神经功能变化,并与患者报告结局相匹配。这证明了SenseCheQ作为社区神经病变检测可扩展平台的潜力。
体内分子反应对微碎片脂肪组织和透明质酸的分化揭示MFAT在炎性膝骨关节炎中的疾病修饰活性 Primorac, D. 2026-06-24 PDF 膝骨关节炎(KOA)影响全球约3.74亿人,目前尚无获批的疾病修饰疗法。我们近期开展的双盲随机试验(ISRCTN88966184)显示,关节内注射微碎片化脂肪组织(MFAT)在患者报告结局指标上优于透明质酸(HA),但两种疗法疗效差异的分子基础尚不明确,且此前从未在人类KOA体内分子应答层面进行过比较。本研究基于非负矩阵三因子分解法构建可解释人工智能数据融合框架,对纵向采集的该队列血浆样本进行分析,整合蛋白质组学、N-糖组学、miRNA转录组学、患者遗传学数据,并结合基线期、1个月和6个月时的先验蛋白质-蛋白质及miRNA-基因调控网络。该框架将各时间点的所有数据模态联合分解为共享的可解释因子,据此推导出基因与miRNA的数据驱动通路,并发现新的患者-基因及患者-miRNA关联。这些通路具有生物学一致性,在基因本体论生物学过程和Reactome通路注释中呈现显著富集。至6个月时,两种治疗留下截然不同的分子特征:HA仍以经典KOA致病过程为主导,包括MMP13和LIMK2等软骨降解效应因子及滑膜炎症标志物;而MFAT则将全身分子景观转向软骨保护、抗炎信号传导及骨-软骨稳态,关键效应因子包括SIRT7和NDUFC1。据我们所知,这是首个直接比较人类KOA中两种疗法体内应答的系统级分子数据,初步证实MFAT具有疾病修饰干预作用,并展示了可解释数据融合在小型转化队列中揭示治疗机制的实用价值。
老龄化中的多维动机:一个涵盖目标导向行为、社会奖赏与愉悦感的验证框架 Warren, S. L. 2026-06-24 PDF 动机变化是健康老龄化、社会参与和功能独立性的决定因素,并可能预示早期神经退行性风险。现有老龄化评估方法通常将动机视为单一结构。在此,我们引入MotDem——一种与痴呆症患者、照护者及临床医生共同设计的年龄适配动机测量工具。在涵盖18-80岁的广泛成年寿命样本中,MotDem揭示了包含目标导向行为、社会奖赏和愉悦感三个稳健动机维度的架构,并保留第四个饱足感因子作为探索性指标。该结构在来自不同国家背景的独立老年队列(45-80岁)中得到验证。MotDem与现有冷漠症和快感缺失量表高度趋同,与抑郁症状学关联较弱。综合来看,这些发现表明动机性老龄化具有多面性,传统单一评估难以充分捕捉。MotDem为测量异质性老龄化轨迹的不同动机驱动因素提供了多维框架,对韧性、福祉及神经退行性风险研究具有启示意义。
一项利用大型语言模型在观察性研究中实现自动化筛选和变量提取的试点项目 Pradhan, M. 2026-06-24 PDF 背景:观察性研究的系统综述是慢性病流行病学因果推断的核心,但日益受到文献规模庞大和混杂因素控制异质性的限制。亟需透明、开放的方法来减少筛选负担,并使不同研究中的暴露因素、结局变量和协变量具有可比性。目的:开发并评估基于模块化大语言模型的流水线LitScreen和VarEx,用于自动化观察性系统综述中的研究筛选和变量提取,涵盖多个应用场景,包括以高血压为主要暴露因素、阿尔茨海默病及相关痴呆症为结局变量,以及以创伤后应激障碍为暴露因素、自伤、自残和自杀倾向为结局变量。方法与材料:我们构建了端到端工作流,通过Ovid平台的可重复MEDLINE查询生成RIS语料库,经LitScreen处理——该三阶段筛选流水线结合了摘要级证据提取、高召回率门控的逐条纳入判定,以及全文检索增强验证。筛选纳入的文章进入VarEx——一种检索增强的提取流水线,可识别角色特定段落,对暴露因素、结局变量和协变量进行基于证据的提取和语义分类,并归入与Metaconfoundr对齐的预定义类别。性能评估基于六个标注的SYNERGY数据集以及专家标注的高血压-ADRD和教育-痴呆语料库,采用精确率、召回率、F1分数、要求变量身份和类别均正确的严格评分,以及每篇参考文献的处理时间。结果:在主要的高血压-ADRD参考集中,VarEx的协变量级精确率为0.80,召回率为0.79,F1为0.76,分类准确率为0.97,在教育-痴呆和SYNERGY验证数据集上表现相似。LitScreen在排除大部分不合格记录的同时保持了高召回率,并通过仅将不确定或边缘性引文路由至全文验证,将筛选和提取总时间相对于人工审查基线减少了约80-90%。结论:检索增强的大语言模型框架可自动化观察性系统综述中筛选和变量提取的主要环节,生成可复用的结构化协变量清单,与因果混杂因素评估工具整合,显著提升证据合成的效率和可重复性,同时仍作为人工审查的辅助工具而非替代品。
局部新鲜蒲公英湿敷辅助头孢曲松治疗局限性皮肤软组织感染:一项单中心评估者盲法随机对照试验 Wang, Y. 2026-06-24 PDF 背景:局限性皮肤软组织感染可能需要全身性抗菌药物治疗,但局部炎症会延缓症状恢复。本研究评估了在头孢曲松基础上加用新鲜蒲公英湿敷对特定临床稳定成年患者的短期疗效。方法:在这项单中心、评估者盲法、三臂随机试验中,180名18-74岁成年患者按1:1:1比例随机分组,分别接受蒲公英湿敷联合静脉头孢曲松、单用蒲公英湿敷或单用头孢曲松治疗7天。主要结局为第7天临床应答率,由盲法独立评估者根据预设的总体临床改善标准进行判定。分析遵循意向性治疗原则,并通过敏感性分析评估结果的稳健性。结果:联合治疗组、蒲公英组和头孢曲松组的第7天临床应答率分别为91.67%(55/60)、76.67%(46/60)和68.33%(41/60)(总体P=0.006)。与单用头孢曲松相比,联合治疗组应答率更高(风险差23.3个百分点,95% CI 9.6-37.0;风险比1.34,95% CI 1.11-1.62)。敏感性分析结果方向一致。次要结局和细菌清除率均显示联合治疗组更优。未报告严重不良事件。结论:在特定临床稳定的局限性皮肤软组织感染成年患者中,与单用头孢曲松相比,辅助性新鲜蒲公英湿敷联合头孢曲松可改善短期结局。由于本研究为单中心、部分盲法试验且未设置安慰剂敷料对照,需谨慎解读结果。该敷料不应替代抗生素、引流或必要时的紧急处理。试验注册:国际传统医学临床试验注册中心,ITMCTR2026000549。
信任作为流行病动态的隐性驱动因素:分区疾病传播模型中缺失的参数 Zapf, A. J. 2026-06-24 PDF 传染病传播的房室模型对人类行为做出假设。具体而言,这些模型通过按年龄、性别或社会经济地位等人口变量分层的接触矩阵,参数化不同人群间的互动,并假定这些人群具有独特的流行病学相关行为模式。尽管此类人口特征易于测量,但它们可能无法充分反映支配保护性行为的社会和心理因素。基于美国新冠疫情期间开展的20轮全国性调查数据,我们发现制度信任——尤其是对公共卫生机构、医生和医院的信任——是保护性行为采纳的主要预测因子。例如,在疫情最活跃时期佩戴口罩的行为中,制度信任对不同人群行为差异的解释力超过了年龄、收入、教育程度和党派归属的总和。在未经调整的分析中,对疾控中心信任度最高与最低的个体在保护性行为采纳上的差异,比年龄、收入或教育程度对应的差异大4至6倍,且超过民主党与共和党受访者之间的差异。这种关联具有制度特异性(例如,对银行的信任与保护性行为的关联减弱)和行为特异性(例如,对疾控中心的信任与保护性行为相关,但与就医行为无关)。后者表明,信任改变的是对公共卫生建议的自愿遵从,而非医疗服务的可及性或使用。我们得出结论:将制度信任作为分层变量纳入传染病传播的房室模型将显著提升模型效能。此外,我们提出一个整合信任的数学建模框架,并给出实施该框架所需的数据基础设施建议。