跳转至

medRxiv 2026-06-15

标题 作者 发布日期 PDF链接 摘要
2026年刚果民主共和国-乌干达本迪布焦病毒病疫情期间,对航空公司介导的潜在输入风险的早期评估 Kinoshita, R. 2026-06-15 PDF 在2026年刚果民主共和国和乌干达暴发的本迪布焦病毒病疫情期间,我们利用当代航空网络和外部校准的埃博拉输入风险,预测了潜在的航空媒介输入风险。有效距离分析识别出比利时、法国、南非、肯尼亚和阿拉伯联合酋长国等主要国际枢纽国家,在30天内成为较高概率的输入门户。这些早期预测为实时国际态势感知提供了可复制的框架,同时强调输入风险并不等同于本地传播风险。
医学实习生专业选择态度:来自霍尔木兹甘医科大学的数据证据 Kashefi Sis, P. 2026-06-15 PDF 背景:选择医学专科是一项关键职业决策,既影响医生未来的职业生涯,也影响医疗人力资源的构成。专科偏好受个人、教育和社会经济等多重因素影响,但来自伊朗南部高年级医学生的证据仍然有限。本研究旨在评估霍尔木兹甘医科大学医学实习生接受专科培训的意愿,明确其首选专科,并探讨影响其决策的相关因素。方法:本描述性分析横断面研究于2023年在伊朗阿巴斯港的霍尔木兹甘医科大学医学实习生中开展。采用便利普查法,邀请所有符合条件的实习生参与,共83名学生完成在线问卷。问卷收集了人口学、学业和职业数据,以及愿意或不愿意接受专科培训的原因和专科偏好。内容效度和表面效度由教职员工和学生评估,本研究内部一致性信度可接受(Cronbach α = 0.82)。数据采用描述性统计和SPSS 27版逻辑回归分析。结果:在83名参与者中,50人(60.2%)表示愿意接受专科培训,33人(39.8%)不愿意。在愿意继续的学生中,最常见的原因是获得更好的经济地位、更广泛的就业机会和更高的社会地位。在不愿意继续的学生中,最常见的原因是长期学习导致的疲劳、经济问题以及毕业后希望立即工作。放射科是最常见的首选专科,其次是耳鼻喉科、皮肤科和心内科。在回归分析中,最终多变量模型中没有任何人口学或学业变量与接受专科培训的意愿独立相关。结论:大多数医学实习生对接受专科培训感兴趣,偏好集中在少数被认为提供良好经济前景、声望和生活方式的专科。经济问题和学业疲劳是影响愿意和不愿意继续专科教育的主要因素。这些发现凸显了提供结构化职业咨询、拓宽不同专科接触面以及制定政策解决住院医师培训的经济和结构性障碍的必要性。关键词:医学专科选择;医学实习生;住院医师培训;医学教育;霍尔木兹甘医科大学
缩短囊胚玻璃化冷冻时间可实现与标准方案相当的活产率:一项基于3168例冷冻移植的分析 Ebinger, E. 2026-06-15 PDF 研究问题:缩短的囊胚玻璃化冷冻与复苏方案能否提供与传统方案相当的活产率及产科和围产期结局? 总结答案:缩短的玻璃化冷冻与复苏方案在活产率、产科及围产期结局方面与传统方案相当。缩短玻璃化冷冻联合传统多步复苏方案对35岁以上女性有显著益处。 已知背景:胚胎冷冻保存后的存活能力取决于卵裂球存活率和功能完整性,两者均受冰晶形成和渗透梯度影响。近年冷冻保存技术的创新对逐步脱水和复水方案的必要性提出挑战。虽然一步式“快速”囊胚复苏方案似乎能提供与传统“慢速”方案相当的临床结局,但关于囊胚脱水速率能否同样提高的研究较少。仍需对治疗成功率和后代健康进行全面的安全性和有效性评估。 研究设计、规模、持续时间:本研究为回顾性连续队列研究,纳入同一网络内的三家诊所,收集2023-2025年间2170例患者中3603个复苏囊胚的周期数据,最终完成3168次冻融囊胚移植。采用广义加性模型及线性/逻辑回归分析“快速”与“慢速”方案与结局的关系。使用Yates校正的双尾卡方检验分析妊娠丢失及产科和围产期结局;p<0.05视为显著。 参与者/材料、方法、环境:所有周期均使用患者自身配子,未进行胚胎植入前遗传学检测。所有囊胚在玻璃化冷冻前均经人工皱缩处理,冷冻方案分为传统“慢速”方案(Sydney IVF, Cook Medical)或改良的2.5分钟“快速”方案(SAGETM, CooperSurgical)。复苏方案分为传统“慢速”多步方案或1分钟一步式“快速”方案(均使用1.0M蔗糖,SAGETM, CooperSurgical)。 主要结果与偶然性作用:总体活产率为33.1%(1050/3168),女性平均年龄35.2±4.5岁(范围22-46岁)。根据复苏至活产过程分为三组:传统玻璃化冷冻/多步复苏(S/S组,n=751个囊胚复苏)、短时玻璃化冷冻/多步复苏(F/S组,n=991)、短时玻璃化冷冻/一步复苏(F/F组,n=1593)。以S/S组为统计对照组。总体而言,所有生殖结局(包括活产率)及产科和围产期结局在各组间均无显著差异(所有p>0.05)。值得注意的是,玻璃化冷冻时年龄≥35岁的女性(n=1715次移植)从F/S策略中获益,其活产率较S/S组显著提高(OR:1.42 [1.02-1.98] p=0.038)。低质量胚胎在F/S策略下同样表现出活产率提升(OR:1.78 [1.12-2.83] p=0.015),提示该冷冻保存策略对受损生殖质的发育潜能具有保护作用。 局限性及注意事项:回顾性研究可能未纳入影响结果的其他因素。 研究结果的更广泛意义:总体而言,缩短的“快速”玻璃化冷冻与复苏方案可提供与传统方案相当的生殖结局。玻璃化冷冻阶段缩短冷冻保护剂暴露时间联合复苏阶段逐步渗透梯度,为35岁以上患者及低质量胚胎提供了显著临床获益,提示可根据特定患者群体调整玻璃化冷冻方案以优化临床结局。
GLLaucoMed:一种基于安全大语言模型的智能工作流,用于从自由文本青光眼临床记录中自动提取用药信息 Solages, N. 2026-06-15 PDF 目的:评估大语言模型(LLMs)从电子健康记录(EHR)中青光眼临床记录提取药物相关信息的能力。设计:横断面研究。受试者:Bascom Palmer眼科数据库中1250名受试者。方法:提取2014年至2024年间青光眼相关就诊的临床记录,由两名青光眼专家标注,第三名专家担任裁决者。标注者需以结构化方式标注当前局部用药(CTM)、局部用药变更方案({Delta}TM)、当前口服用药(COM)及口服用药变更方案({Delta}OM)。数据集按临床医生分层,分为开发集(10%)、验证集(10%)和测试集(80%)。开发集和验证集用于设计优化提示词,保留测试集用于模型评估。五款LLM(Claude Opus 4.6、DeepSeek-V3.2、GPT 5.2、Grok 4.1和Qwen3.6-35B-A3B)在符合HIPAA合规要求的环境下通过Microsoft Azure AI Foundry访问。标注者间一致性采用Gwet AC1评估。LLM性能首先通过F1分数进行二元评估,阳性病例的文本匹配程度通过精确匹配准确率和Jaccard指数(JI)评估。主要结局指标:F1分数、精确匹配准确率、JI。结果:标注者间一致性Gwet AC1值:CTM为0.799,{Delta}TM为0.888,COM为0.985,{Delta}OM为0.988。CTM的F1分数:Claude 0.985、Deepseek 0.971、GPT 0.978、Grok 0.968、Qwen 0.970;{Delta}TM:0.905、0.826、0.897、0.842、0.855;COM:0.923、0.887、0.899、0.906、0.894;{Delta}OM:0.958、0.815、0.937、0.835、0.940。阳性病例中,CTM(N=1354)的精确匹配准确率范围为0.730-0.882,JI范围为0.809-0.918;{Delta}TM(N=404)的精确匹配准确率范围为0.619-0.780,JI范围为0.668-0.827;COM(N=47)的精确匹配准确率范围为0.766-0.872,JI范围为0.765-0.870;{Delta}OM(N=25)的精确匹配准确率范围为0.583-0.920,JI范围为0.583-0.922。结论:GLLaucoMed流程在从非结构化临床记录中提取和标准化药物数据(包括当前用药和变更方案)方面表现出高性能。Claude和GPT表现最为突出。
成纤维细胞功能检测在诊断原发性线粒体疾病中的临床实用性 Van Hove, J. L. K. 2026-06-15 PDF 异质性原发性线粒体疾病(PMD)的基因组测序常发现意义未明的变异,需通过功能检测辅助诊断,且部分患者未检出变异。本研究对204例PMD患者(按功能分类)的成纤维细胞进行线粒体酶活性检测、蓝色-native聚丙烯酰胺凝胶电泳(BN-PAGE)结合胶内活性染色、复合物I组装印迹及选择性蛋白丰度分析,并与51例对照及53例鉴别诊断病例比较。结果显示:呼吸链酶活性检测的总体敏感性和特异性分别为46%和93%,BN-PAGE为40%和98%,复合物I组装检测为49%和99%。所有检测的综合敏感性为76%,特异性为93%,阳性预测值96%,阴性预测值67%。高敏感性类别包括孤立性复合物缺陷、核DNA编码的线粒体蛋白合成缺陷、辅因子缺陷及线粒体氨酰-tRNA合成酶相关疾病(结合蛋白丰度分析时)。线粒体DNA突变及维持障碍类别的敏感性较低。继发性功能障碍罕见。完整的功能检测组合在成纤维细胞中展现出强大的诊断临床效用。
糖尿病与生命历程:来自面板数据和电子健康记录的证据 Heitzig, C. 2026-06-15 PDF 2型糖尿病的发病率在人们经历教育、工作、家庭和财务转型的年龄段持续上升,然而我们缺乏有力证据表明早期治疗能否改变生命历程结果及其作用时间跨度。本文利用糖尿病诊断的医学临界值(糖化血红蛋白6.5%)作为自然实验,通过电子健康记录和面板数据研究糖尿病治疗的效果。本文有三项主要发现:第一,基于电子健康记录数据,我们发现当糖化血红蛋白达到6.5%时,糖尿病诊断和处方开具的概率均出现显著跃升。第二,治疗糖尿病可降低糖化血红蛋白水平、体重、身体质量指数和血压,并增加以糖化血红蛋白检测次数为代理变量的医疗照护量。诊断和处方均能独立产生代谢健康的积极改善,但处方在此方面效果更显著。第三,我们得出结论:对于24-32岁的美国年轻群体,糖尿病治疗对生命历程结果无显著影响,尽管干预后八年仍可观察到糖化血红蛋白水平的降低。综合来看,这些发现表明接受诊断和处方均是有效的糖尿病治疗手段,但并未在中期内显著改变年轻成年人的生活轨迹。
基于HCAHPS患者评论的方面级情感分析中大型语言模型的成本-性能评估:一项验证研究 Nawab, K. 2026-06-15 PDF 背景:医院消费者评估医疗提供者与系统(HCAHPS)自由文本评论包含可操作的反馈,但依赖第三方供应商的卫生系统在实现及时、可扩展且经济高效的情感分析方面仍面临挑战。目标:以人类评分者间一致性为可重复性基准,评估成本优化型与旗舰型大语言模型(LLM)在HCAHPS评论方面情感分析中的成本-性能权衡。方法:我们分析了2023日历年从两家社区医院收集的512条HCAHPS自由文本评论。六名经过培训的评审员(医学生、应届医学毕业生及执业内科医生)独立为每条评论-方面对分配正面、负面或中性标签;三名评审员中的多数标签构成共识参考标准。通过OpenAI API以零样本设置调用两个OpenAI模型——GPT-5-nano(成本优化型)和GPT-5(旗舰型)。我们计算成对Cohen's κ建立人类评分者间基线,随后使用Cohen's κ、准确率、加权F1及每次调用成本与延迟,将每个模型的标签与共识进行比较。结果:人类评分者间平均一致性为κ=0.79(高度一致)。两个LLM均超过此基线(成本优化型κ=0.85;旗舰型κ=0.85),准确率(0.92)和加权F1(0.93 vs. 0.93)几乎相同。在正面(F1~0.97)和负面(F1~0.90)类别上表现强劲,但在代表性不足的中性类别上表现较差(F1≤0.19)。成本优化型模型处理全部512条评论花费0.04美元,而旗舰型为0.18美元——成本差异达4.2倍,且未带来可测量的性能提升。结论:商用LLM能以人类水平的可重复性对HCAHPS评论进行方面情感分析,成本优化型层级足以满足常规分类需求。这为卫生系统提供了一种快速、可扩展、低成本的替代方案,以取代基于供应商的患者体验分析。
SPIRIT-CONSORT-ELM:使用大型语言模型对随机对照试验报告进行元素级评估 Jiang, L. 2026-06-15 PDF 随机对照试验(RCT)在评估干预措施的获益与风险中具有核心作用。RCT出版物报告不完整可能损害其可验证性和实用性。SPIRIT和CONSORT报告指南分别旨在提高RCT方案和结果报告的完整性,但许多RCT仍存在报告不完整的问题。在发表前对稿件进行自动化检查,可帮助作者提升报告完整性。我们此前基于SPIRIT 2013和CONSORT 2010的83个清单条目,构建了包含200篇文献(100对方案-结果出版物)的SPIRIT-CONSORT-TM语料库,并训练了机器学习模型用于条目级报告自动评估。每个清单条目可能包含多个构成要素(即该条目所需的具体细节),仅当所有要素均存在时方可视为完整报告。然而,既往研究未在要素层面明确捕捉或评估报告完整性。为弥补这一空白,我们通过引入要素级标注并据此评估报告完整性,扩展了SPIRIT-CONSORT-TM(形成SPIRIT-CONSORT-ELM)。我们将要素级评估转化为机器阅读理解任务,通过119个问题实现,每个问题针对清单条目中的特定报告要素。基于SPIRIT-CONSORT-TM中的200篇文献,两名标注员独立对50篇文献(25对方案-结果出版物)回答119个问题,并通过讨论解决分歧;其余150篇文献(75对方案-结果出版物)由单名标注员评估。随后,我们利用SPIRIT-CONSORT-ELM开发了要素级评估自动化流程:该流程首先应用基于PubMedBERT的模型识别包含条目级报告信息的句子,再通过生成式大语言模型(LLM;GPT-5)结合思维链推理,基于检索到的证据回答要素级问题。两名标注员间一致性较高(Gwet's AC1: 0.782),我们的流程在识别要素级报告证据方面达到高准确率(F1: 0.822, Gwet's AC1: 0.796)。消融研究表明,思维链推理和包含示例性上下文样例可适度提升LLM在机器阅读理解任务中的表现。SPIRIT-CONSORT-ELM为评估要素级报告指南完整性提供了基准,可超越清单条目简单存在与否的层面评估RCT透明度,并已在https://osf.io/kznx4/公开。该自动化流程为评估RCT报告建立了稳健基线,并展现出作为实用工具帮助作者、审稿人和编辑识别并弥补RCT报告完整性与透明度不足的潜力。
机器学习模型与传统临床计算器在心血管风险预测中的比较分析 Arango Plaza, N. 2026-06-15 PDF 背景:心血管疾病(CVD)仍是全球首要死因,2021年约占全球总死亡人数的31%。传统风险计算器(包括Framingham、ASCVD、SCORE和SCORE2)长期构成初级预防策略的基石,但这些工具主要基于高收入的欧洲和北美人群开发,因此在不同流行病学背景(尤其是西班牙裔/拉丁裔社区)中的预测准确性受限。机器学习(ML)为捕捉生物医学数据中的非线性交互作用提供了替代方案。目的:本研究利用1999-2018年美国国家健康与营养调查(NHANES)数据集,开发并验证基于ML的心血管死亡预测模型,并系统比较其与11种传统临床CVD风险计算器的判别性能。材料与方法:设计专用软件平台"CardioPrediQ",整合多种CVD计算器与ML风险评估。从NHANES中提取包含16个预测变量的12,847名参与者队列。采用六种算法(逻辑回归、Cox比例风险模型、梯度提升、AdaBoost、随机森林和极端随机树),结合六种类别平衡策略进行训练,生成36种模型配置。所有模型按分层70/30比例划分训练集与测试集,并使用Saerens先验概率调整方法进行校准。通过AUC-ROC、灵敏度、特异度、F1分数和加权综合评分评估性能。采用DeLong检验评估最佳ML模型与各传统计算器之间AUC差异的统计显著性。结果:采用2:1过采样和Saerens校准的梯度提升模型取得最佳整体性能(AUC=0.8934;综合评分=0.7904),在综合排名中优于所有传统计算器。前六名全部由ML和统计模型占据。心血管死亡者的平均年龄为67.43岁,而存活者为47.74岁。DeLong检验证实该模型在统计上优于六种传统CVD计算器(p<0.05),但与表现最佳的计算器(ASCVD、HEARTS Caribbean、ASCVD Colombia、SCORE2、HEARTS North America)相比未达到统计显著性。年龄在特征重要性中占主导地位(相对权重41.2%),其次是收缩压(18.7%)。Saerens校准将Brier分数从0.1286降至0.1158,显著改善了概率校准。结论:ML模型在综合性能上优于传统计算器。在NHANES队列中与最高性能传统计算器的统计等效性具有情境依赖性,并验证了方法学流程。CardioPrediQ平台满足了整合型、可扩展CVD风险评估工具的迫切需求,尤其适用于计算器验证有限的拉丁美洲人群。这些发现支持将校准后的ML风险预测整合到临床实践中,同时强调概率校准对临床决策的重要性。
黑人和拉丁裔女性高血压的多重社会风险 Belak, L. 2026-06-15 PDF 背景:高血压是主要可改变的心血管危险因素,受健康相关社会需求(HRSN)显著影响。关于HRSN的详细信息能否改善少数族裔女性高血压的识别尚不明确。方法:纳入18-65岁的黑人和拉丁裔女性,完成美国医疗保险和医疗补助服务中心的"责任健康社区筛查工具",评估13个HRSN领域。通过基于电子病历的验证算法或自我报告确定高血压。采用逻辑回归检验HRSN与高血压的关联。使用10折交叉验证的LASSO回归在训练集(随机70%)中推导多社会风险评分,并在验证集(30%)中与人口社会学模型(年龄、种族、收入、教育)进行对比测试。结果:在1302名参与者中(平均[标准差]年龄40.1[11.3]岁,70.4%为黑人,44.3%为拉丁裔),HRSN累积负担越高,高血压风险越大(每增加一个HRSN领域的校正比值比[aOR]:1.07 [95% CI 1.01-1.14],P=0.02)。食物不安全(aOR 2.30 [1.37-3.87],P=0.002)、公用事业中断(aOR 1.44 [1.04-1.96],P=0.02)、注意力不集中(aOR 1.57 [1.13-2.17],P=0.007)和社会孤立(aOR 1.77 [1.14-2.73],P=0.01)与高血压相关。在验证集中,多社会风险评分相比人口社会学模型未改善高血压的区分能力(AUC 0.76 [95% CI 0.71-0.81] vs. AUC 0.80 [0.75-0.85])。结论:在这项针对黑人和拉丁裔女性的横断面分析中,累积社会劣势程度越高与高血压相关。虽然纳入HRSN未能超越传统人口社会学指标改善高血压预测,但研究结果可为针对心血管代谢风险少数族裔的靶向干预提供依据。