| 验证机器学习模型使用视频尿动力学数据对脊柱裂患者膀胱功能障碍分类和肾积水风险的预测 |
Weaver, J. K. |
2026-10-03 |
PDF |
目的:视频尿动力学(VUDS)用于评估脊柱裂(SB)患者的膀胱功能障碍及上尿路恶化风险,但其判读存在评估者间差异。机器学习模型此前已利用VUDS数据对膀胱功能障碍严重程度进行分类并预测新发肾积水。本研究在独立外部队列中评估了这些模型适配版本的性能。材料与方法:收集2016年至2025年间在单一机构接受VUDS的SB患者的VUDS数据。将此前开发的机器学习框架适配用于独立数据集。使用了三种模型:使用压力-容积数据的深度学习卷积神经网络模型、使用透视成像数据的深度学习影像模型,以及对压力-容积和透视数据风险取平均的集成模型。将这些模型与专家小儿泌尿外科审阅者相比,评估其对新发肾积水的预测和膀胱功能障碍严重程度的分类。结果:肾积水队列纳入70例患者,其中13例(18%)发生新发肾积水。集成模型优于单一模态,一致性指数为0.77(仅压力-容积:0.70,仅影像:0.72),总体AUROC为0.75(压力-容积:0.67,影像:0.74)。对于95项VUDS研究中的膀胱功能障碍分类,集成模型达到71%的准确率,而仅压力-容积数据为60%,仅影像为66%,且与专家审阅者无实质性分歧。结论:为利用VUDS数据预测新发肾积水和分类膀胱功能障碍严重程度而开发的机器学习模型,能够适配至外部独立数据集,并表现出与既往报道相似的区分度和准确率。 |
| 多组学数字食物即药物项目成员中肠易激综合征症状严重程度的变化:一项对均值回归进行校正估计的回顾性单臂队列研究 |
Pedroso, I. |
2026-10-03 |
PDF |
背景:关于食物即药物项目用于肠易激综合征(IBS)的真实世界证据稀缺,而单臂评估因均值回归(RTM)而高估改善程度。我们在一个多组学个性化数字健康食物即药物项目中估计了IBS症状严重程度量表(IBS-SSS,0-500)的变化,包括未校正和RTM校正后的结果。方法:回顾性单臂队列。在15,933名具有有效基线的成员中,2,254名有随访读数,1,683名在基线后至少14天有一次读数。通过基线严重程度分层,在4、12(主要)和26周估计变化,采用未校正和通过协方差分析进行RTM校正。应答者定义为下降至少50分(最小临床重要差异基准)。敏感性分析涵盖公平性、逆概率加权和临界点分析,针对每个标志窗口内无读数的成员、阴性对照分层和药物。在成员内和成员间评估体重减轻和膳食营养密度与症状变化的关联。结果:在12周时(n = 430),IBS-SSS未校正下降43.88分(95%置信区间[CI] -52.44至-35.32;p < 0.001),RTM校正后下降47.73分(-55.48至-39.98;p < 0.001);1,339名有症状成员中有720名(53.8%;95% CI 51.1至56.4)下降至少50分。更严重成员的更大改善在RTM校正后持续存在(严重分层,n = 37:未校正-127.43,RTM校正-60.71,95% CI -97.75至-23.68,p = 0.001)。较高的膳食营养密度与成员自身轨迹内较低的IBS-SSS相关(p = 0.018),而体重变化则不相关(p = 0.361)。尽管基线因年龄和性别存在差异,各组间改善相似:RTM校正的12周变化不因年龄(p = 0.458)、体重指数(p = 0.328)、性别(p = 0.749)、收入(p = 0.486)或族裔(p = 0.170)而异。估计值对标志窗口内无读数成员的加权具有稳健性(RTM校正估计值变动小于2分),且这些成员的变化必须比观察到的差39至73分,均值变化才会达到零。基线药物使用和开始使用GLP-1受体激动剂不能解释症状变化。结论:项目参与者的IBS-SSS显著下降,更严重组的改善更陡峭,即使在RTM校正后也是如此。改善在社会经济特征、年龄和性别方面相当,并且对所评估的混杂因素和缺失数据假设具有稳健性。这些来自自选单臂队列的关联值得在独立研究中重复验证。 |
| 使用基于人群的MRI在大小样本中预测ADHD的认知功能 |
Lal Khakpoor, F. |
2026-10-03 |
PDF |
机器学习为将神经影像转化为精神表型的预测工具提供了一个有前景的框架。然而,一个主要的转化挑战是,在大型、异质性人群队列上训练的模型能否在没有数据集特异性调优的情况下泛化到临床人群。在此,我们测试了基于神经影像的认知预测模型对注意缺陷/多动障碍(ADHD)儿童的泛化性。利用青少年大脑认知发展(ABCD)研究的基线数据(n = 11,747),我们在81个由MRI衍生的特征集上训练了预测模型,这些特征集涵盖基于任务的fMRI对比、功能连接、结构MRI和弥散测量及其多模态堆叠组合。我们分别在非ADHD参与者和日益严格的ADHD分层中测试了性能,并进一步在一个独立的ADHD队列(Lytle et al., 2020; n=79)中评估了外部泛化性,且未进行再训练。在内部,整合所有特征集的堆叠模型达到了最高的预测准确度(r=.57),并再现了观察到的组水平认知差异,同时在ADHD和非ADHD组之间保持了相当的性能。在外部,堆叠的工作记忆任务模型泛化到了独立的ADHD队列(r=.44)。总之,这些发现提供了证据,表明基于人群训练的多模态神经影像模型能够捕捉ADHD和非ADHD组中与认知相关的神经变异,而外部验证则为跨队列和测量情境的可迁移性提供了初步证据。 |
| 评估人工智能与神经科医生诊断推理在神经病理学金标准下的表现 |
Leng, Y. |
2026-10-03 |
PDF |
背景 由于临床表现重叠和疾病表现异质性,复杂神经系统疾病的准确鉴别诊断仍具挑战性。尽管大语言模型在临床推理中展现出前景,但既往研究多以临床医生共识而非生物学金标准来评估其性能。神经系统诊断人工智能的评估需要以神经病理学发现为基础的基准。方法 我们提出 NeuroBench,一个以神经病理学确诊为参考标准的复杂神经系统病例精选基准,以及 DIAGNO,一个基于大语言模型且具有置信度感知的神经系统诊断系统。NeuroBench 包含来自三个独立医疗系统的 791 份回顾性病例摘要及相应的尸检确诊诊断:500 例来自麻省总医院脑切片会议;200 例来自西奈山医疗系统;91 例来自德克萨斯大学圣安东尼奥健康科学中心。在所有病例中,DIAGNO 生成前 3 位鉴别诊断,并对低置信度病例采用检索增强生成。在 203 例复杂麻省总医院病例的子集中,由三名独立盲法评审员将 DIAGNO 与神经科医生分别对照神经病理学金标准进行评估。结果 NeuroBench 涵盖 59 种独特的神经病理学诊断,涉及脑血管病、脑肿瘤、神经系统感染以及多种神经退行性和炎症性疾病。DIAGNO 在 500 例麻省总医院病例中达到 83.8% 的前 3 位准确率,在 200 例西奈山病例中达到 76.5% 的准确率,在 91 例德克萨斯大学圣安东尼奥健康科学中心病例中达到 92.3% 的准确率。在 203 例麻省总医院病例子集中,DIAGNO 的前 3 位准确率高于神经科医生(0.67 对 0.63),分类学层面准确率也更高(0.74 对 0.67)。在意见不一致的病例中,DIAGNO 正确的情况多于神经科医生(29 例对 19 例)。DIAGNO 与神经科医生之间的诊断一致性较高(前 3 位预测一致率为 90%)。在对麻省总医院布莱根医疗系统 8 例病例的真实世界评估中,神经科医生对 DIAGNO 的推理在多个维度上给予良好评价(平均 4.03/5)。结论 NeuroBench 确立了神经病理学确诊作为评估神经系统诊断人工智能的参考标准,超越了基于临床医生的基准评估,重新定义了诊断准确率的上限。依据该标准评估,DIAGNO 达到了与神经科医生相当的诊断性能,并在真实世界应用中获得了临床医生的良好评价,支持其作为神经系统临床决策支持工具的潜力。 |
| 成人肠易激综合征患者疼痛的音乐干预临床和机制反应:单臂初步研究方案 |
Wu, W. |
2026-10-03 |
PDF |
肠易激综合征(IBS)是一种常见的脑-肠互动障碍,以反复发作的腹痛和排便习惯改变为特征。尽管基于音乐的干预(MBI)已显示出对疼痛和压力的益处,但与MBI相关的IBS疼痛变化机制仍知之甚少,且在日常生活中使用多模态可穿戴监测捕捉这些反应的可行性尚未确立。本方案描述了一项单臂试点机制性试验,旨在考察IBS成人患者对MBI的临床和多模态机制反应,以及将生理监测从实验室扩展到家庭环境的可行性。将招募36名年龄在18-50岁、经医疗服务提供者确诊为IBS的成人,预计约30名将完成干预后实验室访视。参与者将接受由委员会认证的音乐治疗师指导的实验室课程,并使用标准化的20分钟MBI方案完成为期四周的自我管理家庭练习,每周至少五天。在脑-肠机制框架指导下,评估将包括患者报告的疼痛、压力和IBS症状;定量感觉测试;使用16S rRNA基因测序的肠道微生物组分析;以及神经、自主神经和肌肉活动的多模态生理记录。分析将描述临床和机制指标在单次会话内及纵向的变化特征,并评估招募、保留、MBI依从性、可穿戴数据完整性和参与者可接受性。研究结果将为未来一项具有足够把握度的随机对照试验中候选机制和可穿戴监测方法的评估选择提供依据。 |
| 终身测序:关于终身基因组医学价值与可行性的专业观点 |
Lewis, A. C. F. |
2026-10-03 |
PDF |
引言。终身基因组医学,即利用储存的基因组数据为终生医疗提供信息,正从愿景走向现实,全球已有数十个新生儿测序项目正在开展,数据再分析也已进入临床实践。关于其价值和可行性的专业观点尚未得到考察。方法。我们对52位美国专业人士进行了半结构化访谈并进行了主题分析,包括临床遗传学家、遗传咨询师、初级保健临床医生、实验室人员以及基因组筛查实施者。访谈探讨了服务提供场景、纵向临床关系、数据再分析和再次联系、知情同意、数据管理、隐私以及儿科到成人的过渡。分析将演绎领域与归纳编码相结合,并关注各利益相关群体之间的异同。结果。所有五个群体的参与者都认为终身基因组医学具有临床价值, citing 基因组信息在多个生命阶段的相关性、随着情况变化重新查询基因组的能力,以及根据不断演变的知识采取行动的能力。少数人质疑这一价值,倾向于更有针对性的检测。许多参与者认为该模式不可避免,并描述了许多组成活动的操作先例,从对十年前数据的再分析和重新分类流程,到“一次测序,多次查询”工作流程和电子健康记录整合警报。参与者描述了治理方面的重大缺口,涵盖服务提供场景、知情同意、数据管理、再次联系以及儿科到成人的过渡,同时还有持续存在的操作挑战,如互操作性。没有哪个服务提供场景被明确青睐:参与者认为新生儿筛查提供了最强的公平性理由,但与其将要求的明确知情同意相冲突;卫生系统提供将那些无法获得服务的人排除在外;商业模式可能寿命短暂。参与者在入组、维持随访以及儿科到成人交接环节提出了公平性担忧,我们认为这些担忧对于与卫生系统联系最少的人群而言是累积且相互强化的。结论。许多参与者预计终身基因组医学将会实施,但尚未出现一个全面或明确受青睐的负责任提供模式。需要在治理方面进行协调投资,同时需要证据表明哪些形式的终身基因组医学具有足够的临床价值以证明其成本合理。 |
| 慢性护理路径优化的强化学习:跨三种临床目标类型的统一框架 |
Wang, R. |
2026-10-03 |
PDF |
慢性病照护需要在生物标志物、安全性和成本等多重约束下进行序贯治疗,而不同疾病的临床目标结构各不相同。本版本探讨一种基于生理学的强化学习范式能否只编写一次,然后无需疾病特异性策略架构即可实例化用于三种目标结构(达标治疗、多标志物巡航和有界周期完成)。痛风、慢性肾脏病和PCOS介导的生育治疗是三个实例。训练采用行为克隆,随后对每种疾病500条模拟轨迹进行近端策略优化。评估使用配对种子(N = 50主要分析;N = 500自助法95%置信区间)、多种子偏移42-51、消融和分布外特征。PCOS(周期完成):在N = 50时,PPO为72.0%,医生基线为54.0%;在N = 500时,PPO为69.8% [65.6, 73.8],医生为52.8% [48.8, 57.2]。痛风(达标治疗):PPO为88.0%,对照为90.0%(McNemar p = 1.0)。CKD(巡航):医生为32.0%,BC/PPO为38.0%。本v2撤回v1中出现的三个文献坐标,它们与任何可恢复来源均不匹配。被撤回的比较由第4、8和12周的NOR-Gout校准替代,该校准属于平行期刊手稿重新校准后的核心内容。共享的BC到PPO训练在三种目标类型中实例化,且不进行跨疾病权重共享。前瞻性验证仍有必要。 |