跳转至

medRxiv 2026-06-22

标题 作者 发布日期 PDF链接 摘要
EAGLE-AI:一种用于自动提取和评分与自闭症谱系障碍相关的基因文献证据的大型语言模型工作流程 Furlan, V. 2026-06-22 PDF 我们此前开发了自闭症基因关联证据评估(EAGLE)整理框架,并用于表征219个自闭症相关基因。但这项工作耗费了数年人力。现推出EAGLE-AI——一个整合大语言模型(LLMs)的自动化整理系统。在经筛选的论文集中,该系统F1值达91%,评分误差17.2%,接近人类水平。由于表格解析和上下文过载问题,EAGLE-AI在未经筛选的论文上表现较差,我们通过if-else评分和计算机视觉工具加以应对。补充材料的处理仍是未解难题。研究结果证明了实现临床基因组学整理流程大部分自动化的概念可行性。
儿童身高发育的遗传与蛋白质组学决定因素及其与成年身高和2型糖尿病的关联 Fragoso-Bargas, N. 2026-06-22 PDF 身高是儿童健康的关键指标,但调控儿童生长发育的分子与代谢机制尚未完全明确。我们对从出生到儿童期的身高进行了全基因组关联分析(574,580次测量;72,704名挪威儿童),并整合了英国生物样本库数据(10岁及成年期数据)。研究发现身高遗传学特征的发育阶段特异性转变,揭示了包括GLP1R附近具有BMI独立效应的变异在内的新型儿童期特异性遗传位点,并识别出三个时间聚类——婴儿期与儿童期聚类富集内分泌及代谢通路,而终身生长聚类则富集骨骼生物学通路。蛋白质组分析显示,青春期前身高与循环系统中的广泛变化相关,鉴定出106种身高相关蛋白,并将IGF1、IGF2和IGFBP3水平与儿童身高多基因评分相关联。孟德尔随机化研究表明,胎儿生长受限和青春期前身高增长会增加2型糖尿病风险,且该效应独立于成年身高。这些发现揭示了儿童生长发育中发育阶段特异性的遗传与蛋白质组学影响,及其与成年代谢健康的关联。
从电子健康记录中提取患者报告的大麻使用情况及使用原因:大型语言模型的基准测试研究 Wang, Y. 2026-06-22 PDF 目的 开发并评估一种基于大语言模型(LLM)的可扩展、可复现的自然语言处理(NLP)方法,用于从非结构化电子健康记录(EHR)临床笔记中识别自身免疫性风湿病(ARDs)患者的 cannabis 使用状态及使用原因。方法与分析 我们开展了一项回顾性研究,使用2015年至2024年ARDs患者的EHR临床笔记。通过模糊字符串匹配,基于相似度阈值为90的精选关键词词典筛选提及cannabis的笔记,提取50词上下文窗口(约25词)。两位领域专家对886个随机抽样的片段进行四类标注:(1)非真实cannabis提及/不确定,(2)否认使用,(3)既往阳性使用,(4)当前阳性使用。利用这些标注,我们比较了多种LLM提示策略(零样本到少样本;温度调参)和一个微调的临床模型(GatorTron 345M)。针对“使用原因”,对1027个片段进行六类标注:疼痛、恶心、睡眠、焦虑/压力/情绪、食欲、未提及/未知。模型在保留验证集上通过准确率、F1、召回率和精确率进行评估。随后将片段级预测聚合至患者级,以描述时间趋势和亚组差异。结果 对于cannabis使用状态分类,微调的GatorTron模型表现最佳(准确率0.90;F1 0.91;召回率0.90;精确率0.90)。对于cannabis使用原因分类,gpt-oss-20B表现最佳(准确率0.77;F1 0.77;召回率0.77;精确率0.86)。患者级分析描述了2015年至2024年cannabis使用记录的趋势,并比较了当前使用者与否认使用者的临床特征。结论 结合微调的临床语言模型和基于LLM的分类器,从EHR笔记中高精度提取cannabis使用状态及原因是可行的。该方法可实现对ARDs患者自我报告症状管理策略的可扩展测量,支持观察性研究及潜在的临床决策支持。
DentaCoPilot:一种面向全科牙科的LLM增强型下一操作推荐系统,专为牙医辅助设计 Rodrigues, C. C. 2026-06-22 PDF 背景 2026年的商业牙科人工智能主要集中于诊断领域:在X光片上检测龋齿、牙结石、根尖周病变及骨水平。然而,每次诊断后临床上面临的更困难问题——根据患者病历和最近一次操作,牙医下一步应做什么——在普通牙科规模上仍未解决。最接近的已发表系统MultiTP(Chen等,2024)是一个仅限于部分缺牙病例的CNN-RNN模型,既未提供校准的不确定性、结构化推理,也未将模型视为决策支持而非自主分类器进行评估。 方法 我们提出DentaCoPilot,一个推荐系统,给定结构化病历后,返回:(i) 针对下一步操作的当前牙科术语(CDT)代码的校准Top-K概率分布,(ii) 口头化的置信度标签,(iii) 当上下文不足时的明确弃权标志,以及(iv) 基于病历的推理。我们在一个包含500名患者(1284个测试样本)的合成病历语料库上,比较了四种经典基线方法(频率二元组、TF-IDF + 逻辑回归、XGBoost、MultiTP风格CNN-RNN)和六种大语言模型(LLM)变体(Claude Haiku、Sonnet + 思维链、Sonnet + 检索、Opus + 思维链、Sonnet + 经典先验、Opus + 经典先验)。所有LLM推理通过本地Anthropic Claude Code CLI路由,每次调用均记录以供完整审计。 结果 在公平比较下,经典基线方法达到0.567的Top-1准确率和0.967的Top-5准确率;纯LLM变体表现较差,Top-1准确率为0.267-0.467。将Sonnet LLM以经典基线方法的Top-10候选(M5)进行提示条件化后,差距缩小:Top-5准确率从0.733(纯Sonnet + 思维链)提升至0.933,与经典基线方法持平,同时保留了推理和弃权功能。将LLM骨干从Sonnet升级为Opus,无论是否使用提示,均未提高准确率。报告了基线方法的温度缩放校准和覆盖风险分析。 结论 将小型LLM以经典基线方法的Top-K进行提示条件化,是我们测试的用于下一步操作推荐的最具成本效益的LLM设计,且该设计保留了将系统与自主分类器区分开的增强功能。下一步工作包括在KLE Vishwanath Katti牙科科学研究所(印度贝尔高姆)进行预注册的临床医生参与评估,以及在多机构BigMouth牙科数据存储库上进行真实数据评估。
APOE ε4纯合子的血浆蛋白质组学分析识别出可能由司美格鲁肽调节的临床前阿尔茨海默病改变 Dammer, E. B. 2026-06-22 PDF 携带两个载脂蛋白E ε4(APOE ε4)等位基因的个体罹患阿尔茨海默病(AD)的风险较高,但APOE ε4纯合子对AD相关生物学通路在生命周期中的影响尚不明确。本研究分析了20至90岁APOE ε4/ε4基因型个体(伴或不伴AD相关认知障碍,共413例)的血浆蛋白质组,并与认知功能正常的APOE ε3/ε3基因型个体(共2764例)进行对比。研究发现,ε4纯合子在青年期即出现多条生物学通路改变,包括代谢、胰高血糖素样肽1/胰岛素样生长因子(GLP-1/IGF)、线粒体、微管、蛋白质稳态及突触通路。在AD临床前及临床阶段,GLP-1受体激动剂司美格鲁肽可逆转ε4纯合子代谢与突触通路的异常改变。针对ε4/ε4基因型个体,至少在50岁前通过干预代谢及其他通路进行治疗,可能是降低该特殊人群AD风险的最有效策略。
南亚人群中的选择引导发现提示MAPT位点与胰岛素抵抗相关。 Pennarun, E. 2026-06-22 PDF 南亚人口占全球人口的25%,却占2型糖尿病(T2D)患者的33%(1)。尽管疾病负担沉重,他们在全基因组关联研究(GWAS)中的代表性仍然严重不足,这限制了对祖先相关疾病生物学的发现(2),进而阻碍了生物学认知和基因组学突破。本研究整合了13个南亚人群(3,4)近期正选择的全基因组信号与跨性状遗传关联数据(3,4),鉴定出1797个位于近期正选择区域内的基因,并优先筛选出65个南亚共享基因。经选择优先化的基因座在跨祖先最大规模T2D-GWAS的可信集及与脂肪营养不良样脂肪分布、肥胖和胰岛素原生物学相关的多基因评分分区簇中显著富集。多性状精细定位恢复了已知T2D基因座(包括RBM6和PEPD),并在两个独立南亚队列(5-7)中鉴定出与肝脏胰岛素抵抗、红细胞特征和HbA1c相关的MAPT信号。这些发现表明,近期正选择信号可与遗传关联数据整合以优先筛选代谢相关基因座,为代表性不足人群的遗传发现提供补充路径。
扩张悖论:为何增加医学院配额可能减少韩国关键专科医生 Yu, H. 2026-06-22 PDF 背景:我提出一个概念性模型,用以说明经济和法律上的负面激励如何可能导致韩国基本医疗领域(在总体劳动力约束之外,而非替代)出现专业和执业场所的错配,并以“五大关键”专科(内科、普通外科、妇产科、儿科和心胸外科)为研究对象。方法:我构建了两个模型:一是人力资本错配成本模型,用于估算专科医生在非培训领域执业时造成的资源损失;二是基本领域从业期望值模型,包含净回报、执业医生一生中遭遇诉讼的概率和风险成本。所有参数均为明确假设,并进行了敏感性分析。基于2024年危机中每位住院医师空缺的急诊系统支出和直接取自全国数据的错配率,得出了全国替代成本当量。结果:全国数据显示,高比例的心胸外科医生在其主要领域之外执业。在既定假设下,扩大招生规模会稀释净回报,并通过培训不足提高诉讼概率;只有当诉讼风险被假定为上升时,期望值才会下降并转为负值,而在诉讼风险保持不变时则保持正值。因此,这一逆转取决于招生扩张与诉讼风险之间的假设关联,而非仅由收入稀释导致。结论:我提出一个基于模型的假设——“扩张悖论”:在不解决薪酬和法律风险的情况下扩大配额,可能会减少而非增加选定基本领域的活跃专科医生。我未比较任何替代政策,也未确定最优政策;仅主张,除非同时解决报销和医疗法律风险问题,否则仅靠配额扩张不太可能改善基本专科的留任情况。
手术评估与医疗保健(SAH)指数:胃癌外科医生层面质量审计的风险调整框架 Sah, B. K. 2026-06-22 PDF 背景 胃癌治疗的异质性显著,尽管主刀外科医生主导整个诊疗路径的决策,但医生层面的预后差异仍缺乏量化评估。本研究引入外科评估与医疗质量(SAH)指数,评估风险校正后医生身份作为生存率的独立预测因子。 方法 这项单中心回顾性研究(上海交通大学医学院附属瑞金医院;NCT07180966)纳入2019年由8名顾问医师实施根治性切除术的692例胃腺癌患者(pStage I-III期)。采用多变量Cox回归模型分析总生存期(主模型:199个事件,EPV 16.6;完整病例敏感性模型:N=647)。SAH指数通过医生×分期的五年死亡率与严重并发症(Clavien-Dindo ≥ IIIa级)的观察-预期比值进行表达。中位随访时间为74.3个月。 结果 生存独立预测因子包括肿瘤分期(HR 2.979/级)、年龄(HR 1.030/年)及非远端胃切除术(HR 1.498;所有P≤0.006)。经全面校正后,医生身份仍具显著性(Wald=14.58,df=7,P=0.042):两名医生的风险比约为参考值的两倍——S6(HR 2.219,P=0.003)和S8(HR 2.034,P=0.031),其队列中新辅助化疗率最低(3.0%和7.0%对比17.6%),提示术前路径决策的影响。该效应在敏感性模型中持续存在(MSI亦具预后意义,HR 3.162,P=0.007)。并发症基准评估未发现任何医生存在超额并发症(无2级标记),仅发现一个生存异常单元(S6,II期;3级标记)。 结论 在可测量的病例组合之外,医生身份与胃癌生存率独立相关。SAH指数为机构内及院际基准评估提供了可重复工具,其分级稳定性在所有四种预设权重方案中均得到验证——证实分级分类独立于权重设定。
刚果民主共和国金沙萨的登革热和基孔肯雅病毒传播 Sendor, R. 2026-06-22 PDF 尽管有传播证据,但刚果民主共和国(DRC)及整个非洲地区对登革热(DENV)和基孔肯雅热(CHIKV)的研究仍显不足。我们通过2021年采集的干血斑样本,采用抗原捕获ELISA法测量了刚果民主共和国金沙萨省的DENV和CHIKV IgG血清阳性率。利用贝叶斯催化模型,根据年龄分层血清阳性率估算了感染强度(FOI)。在1250名参与者中,DENV IgG血清阳性率为38.1%(95% CI: 34.5%-41.8%),随年龄增长而升高,且在城郊Kimpoko地区最高(54.9%)。CHIKV IgG血清阳性率为24.2%(95% CI: 21.1%-27.6%),同样随年龄增长而升高,城郊Kimpoko与农村Bu地区水平相当,而市中心仅发现少数血清阳性者。12.8%的参与者检测到DENV-CHIKV IgG共阳性。时变FOI模型对年龄分层血清阳性率的拟合效果最佳,且存在空间变异。金沙萨地区持续的DENV和CHIKV传播凸显了被低估的传播风险,并强调需加强刚果民主共和国及周边地区的虫媒病毒监测。
绘制肌痛性脑脊髓炎/慢性疲劳综合征(ME/CFS)的症状特征与负担:来自TIMES调查的见解。 Tyson, S. F. 2026-06-22 PDF 目的:描述肌痛性脑脊髓炎/慢性疲劳综合征(ME/CFS)的症状特征。方法:1028名成年ME/CFS患者在线完成《ME症状指数》(TIMES)量表。将原始有序数据通过Rasch模型转换为等距数据,采用参数统计方法进行分析。结果:TIMES平均得分为57.2/100(标准差5.4),表明存在影响多系统的严重症状负担。症状负担与年龄、病程的相关性可忽略不计,与ME/CFS严重程度呈中等相关。女性症状负担重于男性。所有参与者均出现疲劳、神经系统症状和自主神经功能障碍。疲劳量表平均得分为重度(67.7,标准差19.9),神经系统量表(均值45.11,标准差9.45)和自主神经功能障碍量表(均值43.98,标准差8.42)为中度。超过90%的参与者存在不同程度的认知、疼痛、运动感觉、睡眠、心肺、脑神经及胃肠道症状。除认知症状为重度外,其余症状总体呈轻中度困扰。结论:ME/CFS导致严重的多系统症状负担。尽管多数单一症状为轻中度困扰,但累积效应达到重度或极重度。疲劳是最常见且最困扰的症状,其次为认知症状、睡眠障碍和疼痛。女性症状负担重于男性,症状负担与疾病严重程度呈中等相关。