2026-06-15 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| TrustedARI:面向自主AI的可信原生代理路由基础设施 | Qi Li | 2026-06-14 | AI智能体越来越多地通过智能体路由基础设施(ARI)访问外部模型、工具和服务,以管理异构接口和碎片化订阅的开销。然而,ARI的架构引入了根本性的信任风险:它能够以明文形式获取智能体查询和服务响应,同时智能体无法验证其查询是否被路由到预期的服务提供商,也无法验证请求和响应是否未被篡改。为解决这一问题,我们提出了TrustedARI——首个面向智能体AI的信任原生智能体路由基础设施。在架构上,TrustedARI基于三项核心创新构建:(i)一种适配ARI的三方TLS握手协议,通过角色特定的TLS密钥材料分发,使智能体和ARI能够联合认证服务提供商;(ii)一种隐私保护的查询构建协议,允许智能体和ARI在不暴露各自私有输入的情况下协作构建格式正确的查询;(iii)一种可验证的计费协议,支持基于使用量的公平结算,同时保障服务响应的完整性和机密性。我们实现并广泛评估了TrustedARI的原型以验证其性能。实验证实TrustedARI具有高效性:与现有三方TLS握手相比,我们的ARI适配握手协议将通信开销降低了39.34%。此外,隐私保护查询构建协议带来的开销可忽略不计——计算时间平均为0.19秒,通信成本为0.58 MB——而可验证计费协议将证明生成速度提升了28.20倍。关键在于,TrustedARI无需对服务提供商进行任何修改即可直接部署。 | |
| 真相留在家中:通过模型谱系中继承的诚实头增强上下文基础 | Miso Choi | 2026-06-14 | 大型语言模型(LLM)的最新进展催生了众多专门的多模态大语言模型(MLLM),这些模型共享基础LLM,形成了不同的模型谱系。目前尚不清楚基础LLM与下游变体之间是否存在根本性的行为关联。我们通过量化注意力头级别的上下文真实性分数来探究这一问题。在包括Vicuna、Qwen2.5、LLaMA2和Mistral系列模型在内的多种LLM和MLLM谱系中,我们发现真实性分数在模型家族内部得到强烈保留,即使在指令微调或多模态适配后也是如此。我们进一步证明,这种继承性与注意力头权重的保留一致,且上下文真实头会关注与查询相关的证据。基于这一发现,我们提出TruthProbe,一种软门控策略,在保留其他头贡献的同时增强上下文真实头。TruthProbe在HaluEval上提升了上下文真实性,并在POPE和CHAIR上减少了多模态幻觉,基础LLM的真实性分数能有效迁移至其微调后的LLM和MLLM后代。代码已开源:https://github.com/miso-choi/TruthProbe。 | |
| SACE:视觉自回归模型中语义奇点处的概念擦除 | Siya Yang | 2026-06-14 | 视觉自回归(VAR)模型的快速进展为高保真文本到图像合成开辟了变革性前沿,同时也加剧了对生成内容安全对齐的担忧。现有擦除技术主要针对扩散模型的同质去噪步骤设计,直接应用于VAR模型会导致灾难性语义崩溃和视觉伪影。为应对这一基础性挑战,我们首先提出语义奇点公理,该公理认为提示中嵌入的任何目标语义概念在Scale-0阶段被确定锁定。随后通过提出的增量语义显著性分析(ISSA)严格验证该公理,该方法还能使社区透明地审视从粗到细的语义注入过程。基于这一洞见,我们提出首个面向VAR模型的尺度感知概念擦除框架(SACE)。通过将干预严格限制在第一个尺度,我们的方法结合了熵正则化擦除目标以防止高熵采样退化,同时采用恢复性保留损失安全锚定纠缠良性先验的完整性。大量实验表明,我们的方法在各类领域实现了精准的概念擦除性能,且训练开销极小,及时而优雅地解决了新兴VAR架构中固有的关键安全漏洞。代码开源地址:https://github.com/limerenceysy/SACE | |
| ScratchLens:面向Scratch程序的透镜参数化行为等价性 | Yuan Si | 2026-06-14 | 两个Scratch程序可能在语法上差异很大——重命名变量、拆分脚本、提取自定义积木或重新排序初始化——但行为仍然相同;而一个积木的编辑,例如将阻塞广播替换为异步广播,可能仅在特定调度下才显现出差异。判定行为等价性对于自动反馈、评分支持和修复验证至关重要,但树差异比较过于严格,而单次运行的动态比较对于并发、随机和时序依赖的行为来说并不可靠。我们观察到,基于积木的程序的等价性是透镜参数化的:最终状态、帧轨迹、监视器、事件因果性和调试轨迹会引发不同的观察关系。SPECTRA通过一套因果发散现象和观察透镜的分类体系使这一点明确化。它将Scratch项目编译为类型化资源和语义事务的因果中间表示,规范化重命名、守卫条件和过程体,用Mazurkiewicz轨迹范式对同触发器并发进行商化,将程序顺序与竞态分离,并通过SMT约束和虚拟机支持的反例引导精化处理剩余边界。结论性判定附带证据:通过双射和轨迹商化证明等价性,通过类型化见证证明差异性,未解决的情况则标记为未知。在来自真实Scratch项目的虚拟机见证变异语料库上,SPECTRA判定所有444个验证对,并在严格评分下对见证差异对未产生任何虚假等价声明(0/158)。结构方法、纯动态方法和LLM基线在分类体系预测的类别上均失败;消融实验量化了偏序归约和透镜参数化的贡献;针对性场景揭示了随机测试遗漏的模糊变异发散。 | |
| 关于定义自然语言处理中的抹除伤害 | Yu Lu Liu | 2026-06-14 | 自然语言处理系统的部署引发了对其可能产生危害的担忧,其中包括表征性危害。近期文献已开始概念化并衡量其中一种危害——消除危害。然而,该领域在识别和衡量消除危害方面缺乏清晰且连贯的概念基础。现有对消除危害的概念化往往过于宽泛——难以明确界定和衡量消除危害所需的条件——或局限于特定场景——虽便于针对这些场景进行测量,但可能难以适应其他场景。为填补这一空白,我们构建并提出了一种结构化的消除危害定义,阐明确立消除危害是否发生所需的必要要素,以及实践者需明确阐述和操作化以衡量消除危害的具体内容。 | |
| 布朗核阶梯 | Mahdi Mohammadigohari | 2026-06-14 | 构建在数学上易于处理的函数空间以捕捉层级组合表示,仍是统计学习理论的核心挑战。我们引入布朗核阶梯(BKL),这是一种通过布朗核积分构造递归定义的积分再生核希尔伯特空间层级结构。从线性泛函出发,每一层通过对前一层子集上概率测度支持的布朗核进行积分获得,从而形成深度直接通过层级编码的递归函数空间模型。基于该框架,我们定义了规范BKL空间及其关联的复杂度泛函。我们建立了这些空间的若干解析与统计性质,特别证明了BKL空间构成拟巴拿赫空间、满足深度依赖的赫尔德正则性估计,并具有关于深度的严格单调性。进一步,我们证明了正则化经验风险最小化的存在性结果,并推导了在环境维度和层级深度上一致受控的高斯复杂度界。分析的关键要素是基于递归子集分解与布朗核阈值表示的组合证明技术。这些估计为BKL空间上的正则化经验风险最小化提供了近参数阶的超额风险保证。我们的结果为研究深度学习中的组合表示提供了数学上易于处理的层级函数空间框架。 | |
| 让他们偷:用知识蜜罐诱捕大语言模型提取攻击 | Yuyang Dai | 2026-06-14 | 作为商业API部署的大型语言模型容易受到模型提取攻击,而现有防御措施要么响应滞后,要么损害合法用户的体验。我们提出知识陷阱防御机制,通过构建蜜罐知识图谱和面包屑引导探索,将提取攻击导向低迁移性的知识。该机制不阻断查询或扰动输出,而是消耗攻击者有限查询预算于下游效用可忽略的知识,同时保持良性用户性能。在医疗和金融领域的实验表明,知识陷阱在不降低合法用户准确率的情况下,平均减少替代模型一致性6.2%,优于现有对用户产生可测量影响的防御方案。这些结果表明,防御知识空间遍历是缓解大语言模型提取攻击的可行方向。 | |
| AttackonCTF:大语言模型时代下的硬件安全竞赛基准防御 | Mohamadreza Rostami | 2026-06-14 | 诸如HackTheSilicon等硬件安全竞赛,既是评估漏洞检测方法的基准平台,也是训练人类与AI的工具。然而,我们的研究表明,大语言模型正在威胁这些平台的有效性。检测器并非基于真正的安全推理,而是利用一种类似diff的语法比较方式,实现了83%的检测率,这破坏了公平评估。为解决这一问题,我们提出了首个面向LLM、语义保持的混淆框架,专门用于这些基准测试。与知识产权保护方法不同,该框架在保持功能的同时,应用了人类可读的变换和受控的diff噪声。在HackTheSilicon上,该框架在仅10%混淆率下将基于LLM的检测准确率降低了50%,在完全混淆下降低了78.6%,从而恢复了基准测试的可靠性。 | |
| 基于记忆增强的图液态时间常数网络的连续跨域交通状态预测 | Jinrong Xiang | 2026-06-14 | 交通状态预测是智能交通系统中的基础任务。在实际应用中,部分区域因感知基础设施不足导致交通观测数据有限,这使得跨领域知识迁移成为解决数据稀缺型交通预测的重要方案。然而,现有跨领域交通预测方法仍存在若干局限,包括粗粒度的源-目标域适配、对未见目标域模式的有限处理能力,以及在非规则或异质时间条件下对连续交通动态建模不足等问题。针对上述问题,本文提出一种连续跨域交通预测框架——记忆增强图液态时间常数网络(MA-GLTC)。具体而言,我们首先构建时空单元(STU)将交通网络分解为可迁移的局部单元,实现跨领域的细粒度知识对齐;随后开发图液态时间常数网络(GLTC)以连续时间建模图耦合的交通演化过程。与通用图神经ODE模型不同,GLTC将图耦合循环电导引入液态时间常数动态中,使节点状态能够通过泄漏、自适应时间常数和邻域感知反馈进行演化。此外,我们设计了基于记忆的迁移存储(MTS)机制,用于保留源域知识、检索匹配的交通模式,并在出现未见状态时更新可靠的目标域模式。在五个公开交通数据集上的实验表明,MA-GLTC在短期和长期预测任务中均持续优于代表性域内和跨域基线方法。与次优方法相比,MA-GLTC分别将平均预测误差降低了3.02%、0.33%、8.92%、10.09%和2.11%。 | |
| 离散扩散语言模型的平均场并行解码 | Tamim Zoabi | 2026-06-14 | 离散扩散语言模型支持并行令牌生成,为低延迟解码提供了可行路径。然而,基于边际置信度独立选择令牌会限制并行效率:单独看来可靠的令牌在同时更新多个位置时可能形成不兼容的配置。我们提出了一种无需训练的推理框架来协调这些并行更新。在每次前向传播中,该方法为每个掩码位置分配提交分数,并通过模型预测分布中的成对交互来优化这些分数。通过变分松弛方法,我们得到一个简单的定点更新公式,可在单次前向传播中抑制冲突的同步提交。该机制使解码器能够在保持竞争性生成质量的同时并行提交更多令牌。该方法轻量化,无需辅助模型或重新训练,可直接嵌入现有扩散解码流程。在推理和代码生成基准测试上的实验表明,该方法在质量-延迟权衡方面实现了持续改进。 |
bioRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 一项在秀丽隐杆线虫中进行的前向遗传学筛选,旨在寻找通过线粒体未折叠蛋白反应调节α-突触核蛋白诱导神经退行性变的基因。 | Willicott, K. | 2026-06-15 | α-突触核蛋白(α-syn)作为一种天然无序蛋白,其过表达会触发秀丽隐杆线虫线粒体未折叠蛋白反应(UPRmt)通路的慢性激活,并伴随多巴胺能(DAergic)神经退行性病变加重。将UPRmt主要转录调控因子atfs-1的功能缺失型突变引入α-syn转基因线虫后,可显著保护DA神经元免受α-syn诱导的损伤,表明补偿机制具有神经保护作用。我们以atfs-1功能缺失突变体为背景,在秀丽隐杆线虫中开展F3代正向遗传学筛选,旨在鉴定通过UPRmt信号调控α-syn表达DA神经元退行性病变的分子组分。通过检测纯合突变体增强的神经退行性表型,我们发现了多个独立等位基因。其中鉴定出编码组蛋白赖氨酸去甲基化酶(H3K27me3)jmjd-1.2和jmjd-3.1的新型无义突变等位基因,另一株系携带twk-14的无义突变。该基因编码哺乳动物中称为KCNK12的保守蛋白,通过介导被动背景钾离子漏电流来设定并稳定静息膜电位。为深入探究这些基因产物与DA神经退行性病变的关联,我们采用突变体分析和/或RNA干扰技术。在α-syn + atfs-1功能缺失背景下,分别敲低jmjd-1.2、jmjd-3.1或twk-14均可观察到DA神经退行性病变。这些结果证明:编码已知H3K27me3去甲基化酶的jmjd-1.2和jmjd-3.1,以及与人KCNK12同源但功能未明的twk-14基因产物,天然具有抵御α-syn神经毒性的保护作用。 | |
| 利用皮质-肌肉相干性,深入了解感觉运动皮层中β振荡抑制的非聚焦性 | Georgiev, C. | 2026-06-15 | 在运动准备和执行过程中,常观察到13-30 Hz感觉运动区(SM1)β振荡的事件相关去同步化(ERD)。人体电生理测量表明,这种β ERD沿SM1具有广泛的地形分布,但目前尚无便捷方法量化其局灶性程度。本研究测试了一种方法,用于探究单侧躯体定位SM1区域运动诱发的β ERD如何影响邻近SM1区域的β振荡。36名受试者在保持右侧第一骨间背侧肌(FDI)次最大等长收缩的同时,执行右侧上臂运动。通过脑电图(EEG)评估左侧SM1上臂区域的β ERD,并通过SM1脑电信号与静止等长收缩的右侧FDI肌电及力信号之间的皮质肌相干性(CMC),评估该ERD对邻近SM1 FDI区域β活动的影响。结果显示,SM1上臂区域出现强烈的运动诱发β ERD,同时伴随与两种FDI信号的CMC衰减。这些发现表明,β ERD可能并非严格局灶性现象,因其可能扩散至邻近SM1区域。重要的是,我们提出了一种结合双运动任务范式与CMC评估β传播效应的新方法,该方法可应用于研究健康及临床人群中β振荡的地形特性及其在运动控制中的作用。 | |
| 红细胞计数与人类自然寿命极限:来自长寿家族研究的证据 | Arbeev, K. G. | 2026-06-15 | 红细胞生成是体内复制最密集的过程。其终生的复制需求可能削弱造血细胞的复制能力,导致老年人红细胞计数下降并限制其寿命。我们在长寿家庭研究中分析了1620名年龄≥70岁参与者的红细胞计数与死亡率之间的关系,发现较低的红细胞计数进一步加剧了随年龄呈指数增长的死亡率。我们识别出一个红细胞计数阈值(约3.8×10¹²/L),低于该阈值时死亡率显著升高(p=9.3×10⁻⁶)。随着红细胞计数随年龄增长而下降(p=8.2×10⁻¹⁸),许多参与者的红细胞计数降至该阈值以下,导致其死亡风险急剧增加。这一基于死亡率的老年人红细胞计数阈值源于建模分析,独立于世界卫生组织基于≤65岁人群血红蛋白分布统计阈值(第5百分位数)定义的贫血标准。因此,红细胞计数下降可能是对许多老年人施加自然寿命限制的生物学因素之一。 | |
| 词汇产生的认知控制中的半球分离 | Yucel, A. | 2026-06-15 | 本研究探讨了在受限与非受限任务中,额下回(IFG)对词汇产生的半球贡献。本研究采用假对照、双盲设计的聚焦环形经颅直流电刺激(tDCS),结合图片-词汇干扰(PWI)任务和图片描述任务。54名健康年轻成年人在相同刺激时段内完成两项任务,分别接受左侧或右侧IFG的阳极刺激。根据任务特异性数据排除标准,每项任务分析各纳入52名参与者。在PWI任务中,类别相关干扰词产生语义干扰效应,联想相关干扰词促进命名反应时,这与先前研究结果一致。刺激未影响反应时。在错误率方面,两个刺激部位以相反方向调节联想效应:左侧IFG阳极刺激增强了错误率中的联想优势,而右侧IFG阳极刺激则产生相反模式。在图片描述任务中,右侧IFG阳极刺激提高了语速,对每分钟词汇数、未修剪每分钟词汇数及每分钟音节数产生显著影响,而左侧IFG组未出现等效效应。词汇多样性和话语长度未受刺激影响。综合来看,这些发现为词汇产生的半球分离提供了汇聚证据:右侧IFG似乎参与言语输出的调节和干扰抑制的控制,而左侧IFG则支持词义的检索与选择。 | |
| 在鸣禽求偶过程中,听觉皮层的反馈信号会重新调整。 | Jones, C. B. | 2026-06-15 | 听觉反馈对于发声学习和控制至关重要,但尚不清楚观众的存在如何影响自我发声的神经表征。本研究记录了斑胸草雀在独自练习鸣唱和向雌鸟定向求偶鸣唱时的听觉皮层神经活动。我们首先发现许多听觉神经元在求偶鸣唱期间改变了其与鸣唱相关的放电模式。通过使用针对音节失真的听觉反馈(DAF),我们测试了与鸣唱反馈失真相关的信号如何依赖于求偶情境。尽管过往研究表明多巴胺神经元在求偶期间会统一降低对DAF的反应,但皮层听觉神经元在雌鸟存在时表现出异质性的DAF信号重调。因此,鸣禽听觉皮层中的单个神经元在处理自我发声的反馈时,独自鸣唱与向雌鸟定向求偶鸣唱存在差异。 | |
| 蓝藻中c-di-GMP受体与两个转录因子相互作用调控IV型菌毛依赖功能的研究 | Wallner, T. | 2026-06-15 | 蓝藻利用IV型菌毛实现多种行为反应,如趋光性、聚集、漂浮和DNA摄取。IV型菌毛依赖的功能受核苷酸第二信使c-di-GMP和cAMP调控。本研究探究了蓝藻中近期发现的含ComFB结构域的c-di-GMP受体(CdgR)的功能。ComFB结构域蛋白广泛存在于蓝藻及异养细菌中。我们证实模式蓝藻集胞藻PCC 6803(用于研究IV型菌毛依赖功能的模式生物)中的CdgR同源物能特异性结合c-di-GMP。遗传与表型分析表明,集胞藻CdgR参与趋光运动与自然转化能力。cdgR失活导致特定次要菌毛蛋白(对运动或自然转化至关重要)的表达谱改变。我们鉴定出CdgR与CRP家族转录因子SyCRP1和SyCRP2存在相互作用。c-di-GMP水平升高会触发CdgR-SyCRP1与CdgR/SyCRP2复合体的解离。此外,cAMP和c-di-AMP等其他环核苷酸也影响这些复合体的组装与稳定性。这些相互作用表明,CdgR通过响应环核苷酸信使(特别是c-di-GMP)信号调控基因表达的复杂机制。本研究揭示了CdgR在c-di-GMP信号传导中的重要性,及其在集胞藻IV型菌毛依赖功能调控中的作用。CdgR通过与转录因子SyCRP1和SyCRP2的互作,调控特定次要菌毛蛋白基因的表达,从而建立蓝藻多种IV型菌毛功能与适应性行为。 | |
| 预测连续结果:联想方法在偶然性学习中的一些新测试。 | Chow, J. | 2026-06-15 | 传统联想学习模型通常依赖对线索和结果的二元分类来简化权变学习,例如是否实施医疗干预、是否观察到患者康复。这类模型虽能成功捕捉人类与动物研究中的基础学习现象,却无法表征现实情境中普遍存在的人类经验变异性。事实上,当结果量值存在差异时(如医疗场景中疾病严重程度),这类模型至多只能近似结果均值,而无法呈现潜在数值分布。本文提出一种将分布式架构整合至预测误差学习模型的方法,该模型可追踪线索与维度化结果间的权变关系。我们的分布式模型允许线索节点与结果节点之间形成联想连接,根据结果量值提供分布式表征,从而突破均值近似的学习局限。通过四项权变学习实验对比分布式模型与简单增量模型,我们发现几乎所有被试中,分布式模型对经验数据的拟合度显著更优。这些发现表明人类学习者依赖一种保留事件连续性的结果编码方式,深化了我们对复杂环境中因果推理机制的理解。 | |
| 进化核糖体中增强翻译动力学的结构适应性 | Raskar, T. | 2026-06-15 | 核糖体RNA序列调控翻译动力学,但保守催化中心以外的序列变化如何影响动力学和蛋白质产量仍不明确。通过正交核糖体噬菌体辅助连续进化技术,我们近期报道了源自大肠杆菌、铜绿假单胞菌和霍乱弧菌的嵌合核糖体,其正交翻译活性较原始核糖体显著提升。本研究利用冷冻电镜解析了这些动力学增强核糖体的结构,发现16S rRNA稳定性与翻译效率之间存在潜在关联。相较于原始核糖体,进化后的核糖体展现出广泛的RNA结构适应性变化,通常由关键螺旋连接处的错配引发,导致局部RNA-蛋白质重排并破坏非经典碱基对。恢复碱基配对稳定性和消除柔性的补偿性突变使翻译活性降至野生型水平。在不同进化路径中,翻译输出增加与16S rRNA序列中特定元件引入有限结构不稳定的细微局部变化相关。综上,本研究揭示了rRNA结构可塑性的新机制,并为设计具有改变翻译特性的核糖体建立了原理基础。 | |
| 多平台重新评估人类线粒体DNA甲基化揭示与技术假象一致的信号 | Basrai, S. | 2026-06-15 | 线粒体DNA甲基化的存在及其功能相关性仍存争议。本研究采用无需文库制备中化学转化的正交测序方法,系统分析了人类脑组织和血液组织(涵盖健康与恶性状态)中的胞嘧啶甲基化与羟甲基化图谱。核DNA呈现典型甲基化模式,而线粒体DNA始终显示可忽略的信号,与背景技术噪声无差异。通过比对线粒体DNA与核基因组嵌入的线粒体序列中的胞嘧啶-鸟嘌呤位点,我们证实这些核同源序列不仅可能干扰胞嘧啶甲基化测量,同样会影响羟甲基化检测,这印证并拓展了先前关于核污染可能是表观线粒体信号来源的发现。研究还识别出多种导致线粒体DNA甲基化信号虚高的技术因素,包括序列背景偏差、测序芯片化学性质、以及重链与轻链间覆盖度依赖性差异。综合而言,这些结果提供了趋同证据,反对线粒体DNA中存在具有生物学意义的胞嘧啶甲基化或羟甲基化。该发现警示:未经严格正交验证及全面考量技术与分析混杂因素,不应将人类成体组织中的表观线粒体DNA甲基化信号解读为具有生物学意义。 | |
| 人脑中词类的不变神经表征 | Misra, P. | 2026-06-15 | 阐明大脑中语言的内部表征对于认知科学、脑部疾病和人工智能具有重大意义。语言学研究的基石之一是词语具有特定功能(通常称为词性)的概念。本研究在20名癫痫患者颅内植入1801个电极,记录其处理由形容词和名词构成的双词短语时的神经生理反应。我们观察到能够区分这两种词性的神经信号。这些选择性信号局限于左侧外侧眶额皮层的一个小区域。词性表征在视觉和听觉呈现模态下表现出不变性,对词语长度、顺序、频率和语义等属性具有稳健性,甚至能跨语言泛化。这种针对名词与形容词的选择性、不变性及局部化词性表征,为语言的组合加工提供了关键要素。 |
medRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 2026年刚果民主共和国-乌干达本迪布焦病毒病疫情期间,对航空公司介导的潜在输入风险的早期评估 | Kinoshita, R. | 2026-06-15 | 在2026年刚果民主共和国和乌干达暴发的本迪布焦病毒病疫情期间,我们利用当代航空网络和外部校准的埃博拉输入风险,预测了潜在的航空媒介输入风险。有效距离分析识别出比利时、法国、南非、肯尼亚和阿拉伯联合酋长国等主要国际枢纽国家,在30天内成为较高概率的输入门户。这些早期预测为实时国际态势感知提供了可复制的框架,同时强调输入风险并不等同于本地传播风险。 | |
| 医学实习生专业选择态度:来自霍尔木兹甘医科大学的数据证据 | Kashefi Sis, P. | 2026-06-15 | 背景:选择医学专科是一项关键职业决策,既影响医生未来的职业生涯,也影响医疗人力资源的构成。专科偏好受个人、教育和社会经济等多重因素影响,但来自伊朗南部高年级医学生的证据仍然有限。本研究旨在评估霍尔木兹甘医科大学医学实习生接受专科培训的意愿,明确其首选专科,并探讨影响其决策的相关因素。方法:本描述性分析横断面研究于2023年在伊朗阿巴斯港的霍尔木兹甘医科大学医学实习生中开展。采用便利普查法,邀请所有符合条件的实习生参与,共83名学生完成在线问卷。问卷收集了人口学、学业和职业数据,以及愿意或不愿意接受专科培训的原因和专科偏好。内容效度和表面效度由教职员工和学生评估,本研究内部一致性信度可接受(Cronbach α = 0.82)。数据采用描述性统计和SPSS 27版逻辑回归分析。结果:在83名参与者中,50人(60.2%)表示愿意接受专科培训,33人(39.8%)不愿意。在愿意继续的学生中,最常见的原因是获得更好的经济地位、更广泛的就业机会和更高的社会地位。在不愿意继续的学生中,最常见的原因是长期学习导致的疲劳、经济问题以及毕业后希望立即工作。放射科是最常见的首选专科,其次是耳鼻喉科、皮肤科和心内科。在回归分析中,最终多变量模型中没有任何人口学或学业变量与接受专科培训的意愿独立相关。结论:大多数医学实习生对接受专科培训感兴趣,偏好集中在少数被认为提供良好经济前景、声望和生活方式的专科。经济问题和学业疲劳是影响愿意和不愿意继续专科教育的主要因素。这些发现凸显了提供结构化职业咨询、拓宽不同专科接触面以及制定政策解决住院医师培训的经济和结构性障碍的必要性。关键词:医学专科选择;医学实习生;住院医师培训;医学教育;霍尔木兹甘医科大学 | |
| 缩短囊胚玻璃化冷冻时间可实现与标准方案相当的活产率:一项基于3168例冷冻移植的分析 | Ebinger, E. | 2026-06-15 | 研究问题:缩短的囊胚玻璃化冷冻与复苏方案能否提供与传统方案相当的活产率及产科和围产期结局? 总结答案:缩短的玻璃化冷冻与复苏方案在活产率、产科及围产期结局方面与传统方案相当。缩短玻璃化冷冻联合传统多步复苏方案对35岁以上女性有显著益处。 已知背景:胚胎冷冻保存后的存活能力取决于卵裂球存活率和功能完整性,两者均受冰晶形成和渗透梯度影响。近年冷冻保存技术的创新对逐步脱水和复水方案的必要性提出挑战。虽然一步式“快速”囊胚复苏方案似乎能提供与传统“慢速”方案相当的临床结局,但关于囊胚脱水速率能否同样提高的研究较少。仍需对治疗成功率和后代健康进行全面的安全性和有效性评估。 研究设计、规模、持续时间:本研究为回顾性连续队列研究,纳入同一网络内的三家诊所,收集2023-2025年间2170例患者中3603个复苏囊胚的周期数据,最终完成3168次冻融囊胚移植。采用广义加性模型及线性/逻辑回归分析“快速”与“慢速”方案与结局的关系。使用Yates校正的双尾卡方检验分析妊娠丢失及产科和围产期结局;p<0.05视为显著。 参与者/材料、方法、环境:所有周期均使用患者自身配子,未进行胚胎植入前遗传学检测。所有囊胚在玻璃化冷冻前均经人工皱缩处理,冷冻方案分为传统“慢速”方案(Sydney IVF, Cook Medical)或改良的2.5分钟“快速”方案(SAGETM, CooperSurgical)。复苏方案分为传统“慢速”多步方案或1分钟一步式“快速”方案(均使用1.0M蔗糖,SAGETM, CooperSurgical)。 主要结果与偶然性作用:总体活产率为33.1%(1050/3168),女性平均年龄35.2±4.5岁(范围22-46岁)。根据复苏至活产过程分为三组:传统玻璃化冷冻/多步复苏(S/S组,n=751个囊胚复苏)、短时玻璃化冷冻/多步复苏(F/S组,n=991)、短时玻璃化冷冻/一步复苏(F/F组,n=1593)。以S/S组为统计对照组。总体而言,所有生殖结局(包括活产率)及产科和围产期结局在各组间均无显著差异(所有p>0.05)。值得注意的是,玻璃化冷冻时年龄≥35岁的女性(n=1715次移植)从F/S策略中获益,其活产率较S/S组显著提高(OR:1.42 [1.02-1.98] p=0.038)。低质量胚胎在F/S策略下同样表现出活产率提升(OR:1.78 [1.12-2.83] p=0.015),提示该冷冻保存策略对受损生殖质的发育潜能具有保护作用。 局限性及注意事项:回顾性研究可能未纳入影响结果的其他因素。 研究结果的更广泛意义:总体而言,缩短的“快速”玻璃化冷冻与复苏方案可提供与传统方案相当的生殖结局。玻璃化冷冻阶段缩短冷冻保护剂暴露时间联合复苏阶段逐步渗透梯度,为35岁以上患者及低质量胚胎提供了显著临床获益,提示可根据特定患者群体调整玻璃化冷冻方案以优化临床结局。 | |
| GLLaucoMed:一种基于安全大语言模型的智能工作流,用于从自由文本青光眼临床记录中自动提取用药信息 | Solages, N. | 2026-06-15 | 目的:评估大语言模型(LLMs)从电子健康记录(EHR)中青光眼临床记录提取药物相关信息的能力。设计:横断面研究。受试者:Bascom Palmer眼科数据库中1250名受试者。方法:提取2014年至2024年间青光眼相关就诊的临床记录,由两名青光眼专家标注,第三名专家担任裁决者。标注者需以结构化方式标注当前局部用药(CTM)、局部用药变更方案({Delta}TM)、当前口服用药(COM)及口服用药变更方案({Delta}OM)。数据集按临床医生分层,分为开发集(10%)、验证集(10%)和测试集(80%)。开发集和验证集用于设计优化提示词,保留测试集用于模型评估。五款LLM(Claude Opus 4.6、DeepSeek-V3.2、GPT 5.2、Grok 4.1和Qwen3.6-35B-A3B)在符合HIPAA合规要求的环境下通过Microsoft Azure AI Foundry访问。标注者间一致性采用Gwet AC1评估。LLM性能首先通过F1分数进行二元评估,阳性病例的文本匹配程度通过精确匹配准确率和Jaccard指数(JI)评估。主要结局指标:F1分数、精确匹配准确率、JI。结果:标注者间一致性Gwet AC1值:CTM为0.799,{Delta}TM为0.888,COM为0.985,{Delta}OM为0.988。CTM的F1分数:Claude 0.985、Deepseek 0.971、GPT 0.978、Grok 0.968、Qwen 0.970;{Delta}TM:0.905、0.826、0.897、0.842、0.855;COM:0.923、0.887、0.899、0.906、0.894;{Delta}OM:0.958、0.815、0.937、0.835、0.940。阳性病例中,CTM(N=1354)的精确匹配准确率范围为0.730-0.882,JI范围为0.809-0.918;{Delta}TM(N=404)的精确匹配准确率范围为0.619-0.780,JI范围为0.668-0.827;COM(N=47)的精确匹配准确率范围为0.766-0.872,JI范围为0.765-0.870;{Delta}OM(N=25)的精确匹配准确率范围为0.583-0.920,JI范围为0.583-0.922。结论:GLLaucoMed流程在从非结构化临床记录中提取和标准化药物数据(包括当前用药和变更方案)方面表现出高性能。Claude和GPT表现最为突出。 | |
| 成纤维细胞功能检测在诊断原发性线粒体疾病中的临床实用性 | Van Hove, J. L. K. | 2026-06-15 | 异质性原发性线粒体疾病(PMD)的基因组测序常发现意义未明的变异,需通过功能检测辅助诊断,且部分患者未检出变异。本研究对204例PMD患者(按功能分类)的成纤维细胞进行线粒体酶活性检测、蓝色-native聚丙烯酰胺凝胶电泳(BN-PAGE)结合胶内活性染色、复合物I组装印迹及选择性蛋白丰度分析,并与51例对照及53例鉴别诊断病例比较。结果显示:呼吸链酶活性检测的总体敏感性和特异性分别为46%和93%,BN-PAGE为40%和98%,复合物I组装检测为49%和99%。所有检测的综合敏感性为76%,特异性为93%,阳性预测值96%,阴性预测值67%。高敏感性类别包括孤立性复合物缺陷、核DNA编码的线粒体蛋白合成缺陷、辅因子缺陷及线粒体氨酰-tRNA合成酶相关疾病(结合蛋白丰度分析时)。线粒体DNA突变及维持障碍类别的敏感性较低。继发性功能障碍罕见。完整的功能检测组合在成纤维细胞中展现出强大的诊断临床效用。 | |
| 糖尿病与生命历程:来自面板数据和电子健康记录的证据 | Heitzig, C. | 2026-06-15 | 2型糖尿病的发病率在人们经历教育、工作、家庭和财务转型的年龄段持续上升,然而我们缺乏有力证据表明早期治疗能否改变生命历程结果及其作用时间跨度。本文利用糖尿病诊断的医学临界值(糖化血红蛋白6.5%)作为自然实验,通过电子健康记录和面板数据研究糖尿病治疗的效果。本文有三项主要发现:第一,基于电子健康记录数据,我们发现当糖化血红蛋白达到6.5%时,糖尿病诊断和处方开具的概率均出现显著跃升。第二,治疗糖尿病可降低糖化血红蛋白水平、体重、身体质量指数和血压,并增加以糖化血红蛋白检测次数为代理变量的医疗照护量。诊断和处方均能独立产生代谢健康的积极改善,但处方在此方面效果更显著。第三,我们得出结论:对于24-32岁的美国年轻群体,糖尿病治疗对生命历程结果无显著影响,尽管干预后八年仍可观察到糖化血红蛋白水平的降低。综合来看,这些发现表明接受诊断和处方均是有效的糖尿病治疗手段,但并未在中期内显著改变年轻成年人的生活轨迹。 | |
| 基于HCAHPS患者评论的方面级情感分析中大型语言模型的成本-性能评估:一项验证研究 | Nawab, K. | 2026-06-15 | 背景:医院消费者评估医疗提供者与系统(HCAHPS)自由文本评论包含可操作的反馈,但依赖第三方供应商的卫生系统在实现及时、可扩展且经济高效的情感分析方面仍面临挑战。目标:以人类评分者间一致性为可重复性基准,评估成本优化型与旗舰型大语言模型(LLM)在HCAHPS评论方面情感分析中的成本-性能权衡。方法:我们分析了2023日历年从两家社区医院收集的512条HCAHPS自由文本评论。六名经过培训的评审员(医学生、应届医学毕业生及执业内科医生)独立为每条评论-方面对分配正面、负面或中性标签;三名评审员中的多数标签构成共识参考标准。通过OpenAI API以零样本设置调用两个OpenAI模型——GPT-5-nano(成本优化型)和GPT-5(旗舰型)。我们计算成对Cohen's κ建立人类评分者间基线,随后使用Cohen's κ、准确率、加权F1及每次调用成本与延迟,将每个模型的标签与共识进行比较。结果:人类评分者间平均一致性为κ=0.79(高度一致)。两个LLM均超过此基线(成本优化型κ=0.85;旗舰型κ=0.85),准确率(0.92)和加权F1(0.93 vs. 0.93)几乎相同。在正面(F1~0.97)和负面(F1~0.90)类别上表现强劲,但在代表性不足的中性类别上表现较差(F1≤0.19)。成本优化型模型处理全部512条评论花费0.04美元,而旗舰型为0.18美元——成本差异达4.2倍,且未带来可测量的性能提升。结论:商用LLM能以人类水平的可重复性对HCAHPS评论进行方面情感分析,成本优化型层级足以满足常规分类需求。这为卫生系统提供了一种快速、可扩展、低成本的替代方案,以取代基于供应商的患者体验分析。 | |
| SPIRIT-CONSORT-ELM:使用大型语言模型对随机对照试验报告进行元素级评估 | Jiang, L. | 2026-06-15 | 随机对照试验(RCT)在评估干预措施的获益与风险中具有核心作用。RCT出版物报告不完整可能损害其可验证性和实用性。SPIRIT和CONSORT报告指南分别旨在提高RCT方案和结果报告的完整性,但许多RCT仍存在报告不完整的问题。在发表前对稿件进行自动化检查,可帮助作者提升报告完整性。我们此前基于SPIRIT 2013和CONSORT 2010的83个清单条目,构建了包含200篇文献(100对方案-结果出版物)的SPIRIT-CONSORT-TM语料库,并训练了机器学习模型用于条目级报告自动评估。每个清单条目可能包含多个构成要素(即该条目所需的具体细节),仅当所有要素均存在时方可视为完整报告。然而,既往研究未在要素层面明确捕捉或评估报告完整性。为弥补这一空白,我们通过引入要素级标注并据此评估报告完整性,扩展了SPIRIT-CONSORT-TM(形成SPIRIT-CONSORT-ELM)。我们将要素级评估转化为机器阅读理解任务,通过119个问题实现,每个问题针对清单条目中的特定报告要素。基于SPIRIT-CONSORT-TM中的200篇文献,两名标注员独立对50篇文献(25对方案-结果出版物)回答119个问题,并通过讨论解决分歧;其余150篇文献(75对方案-结果出版物)由单名标注员评估。随后,我们利用SPIRIT-CONSORT-ELM开发了要素级评估自动化流程:该流程首先应用基于PubMedBERT的模型识别包含条目级报告信息的句子,再通过生成式大语言模型(LLM;GPT-5)结合思维链推理,基于检索到的证据回答要素级问题。两名标注员间一致性较高(Gwet's AC1: 0.782),我们的流程在识别要素级报告证据方面达到高准确率(F1: 0.822, Gwet's AC1: 0.796)。消融研究表明,思维链推理和包含示例性上下文样例可适度提升LLM在机器阅读理解任务中的表现。SPIRIT-CONSORT-ELM为评估要素级报告指南完整性提供了基准,可超越清单条目简单存在与否的层面评估RCT透明度,并已在https://osf.io/kznx4/公开。该自动化流程为评估RCT报告建立了稳健基线,并展现出作为实用工具帮助作者、审稿人和编辑识别并弥补RCT报告完整性与透明度不足的潜力。 | |
| 机器学习模型与传统临床计算器在心血管风险预测中的比较分析 | Arango Plaza, N. | 2026-06-15 | 背景:心血管疾病(CVD)仍是全球首要死因,2021年约占全球总死亡人数的31%。传统风险计算器(包括Framingham、ASCVD、SCORE和SCORE2)长期构成初级预防策略的基石,但这些工具主要基于高收入的欧洲和北美人群开发,因此在不同流行病学背景(尤其是西班牙裔/拉丁裔社区)中的预测准确性受限。机器学习(ML)为捕捉生物医学数据中的非线性交互作用提供了替代方案。目的:本研究利用1999-2018年美国国家健康与营养调查(NHANES)数据集,开发并验证基于ML的心血管死亡预测模型,并系统比较其与11种传统临床CVD风险计算器的判别性能。材料与方法:设计专用软件平台"CardioPrediQ",整合多种CVD计算器与ML风险评估。从NHANES中提取包含16个预测变量的12,847名参与者队列。采用六种算法(逻辑回归、Cox比例风险模型、梯度提升、AdaBoost、随机森林和极端随机树),结合六种类别平衡策略进行训练,生成36种模型配置。所有模型按分层70/30比例划分训练集与测试集,并使用Saerens先验概率调整方法进行校准。通过AUC-ROC、灵敏度、特异度、F1分数和加权综合评分评估性能。采用DeLong检验评估最佳ML模型与各传统计算器之间AUC差异的统计显著性。结果:采用2:1过采样和Saerens校准的梯度提升模型取得最佳整体性能(AUC=0.8934;综合评分=0.7904),在综合排名中优于所有传统计算器。前六名全部由ML和统计模型占据。心血管死亡者的平均年龄为67.43岁,而存活者为47.74岁。DeLong检验证实该模型在统计上优于六种传统CVD计算器(p<0.05),但与表现最佳的计算器(ASCVD、HEARTS Caribbean、ASCVD Colombia、SCORE2、HEARTS North America)相比未达到统计显著性。年龄在特征重要性中占主导地位(相对权重41.2%),其次是收缩压(18.7%)。Saerens校准将Brier分数从0.1286降至0.1158,显著改善了概率校准。结论:ML模型在综合性能上优于传统计算器。在NHANES队列中与最高性能传统计算器的统计等效性具有情境依赖性,并验证了方法学流程。CardioPrediQ平台满足了整合型、可扩展CVD风险评估工具的迫切需求,尤其适用于计算器验证有限的拉丁美洲人群。这些发现支持将校准后的ML风险预测整合到临床实践中,同时强调概率校准对临床决策的重要性。 | |
| 黑人和拉丁裔女性高血压的多重社会风险 | Belak, L. | 2026-06-15 | 背景:高血压是主要可改变的心血管危险因素,受健康相关社会需求(HRSN)显著影响。关于HRSN的详细信息能否改善少数族裔女性高血压的识别尚不明确。方法:纳入18-65岁的黑人和拉丁裔女性,完成美国医疗保险和医疗补助服务中心的"责任健康社区筛查工具",评估13个HRSN领域。通过基于电子病历的验证算法或自我报告确定高血压。采用逻辑回归检验HRSN与高血压的关联。使用10折交叉验证的LASSO回归在训练集(随机70%)中推导多社会风险评分,并在验证集(30%)中与人口社会学模型(年龄、种族、收入、教育)进行对比测试。结果:在1302名参与者中(平均[标准差]年龄40.1[11.3]岁,70.4%为黑人,44.3%为拉丁裔),HRSN累积负担越高,高血压风险越大(每增加一个HRSN领域的校正比值比[aOR]:1.07 [95% CI 1.01-1.14],P=0.02)。食物不安全(aOR 2.30 [1.37-3.87],P=0.002)、公用事业中断(aOR 1.44 [1.04-1.96],P=0.02)、注意力不集中(aOR 1.57 [1.13-2.17],P=0.007)和社会孤立(aOR 1.77 [1.14-2.73],P=0.01)与高血压相关。在验证集中,多社会风险评分相比人口社会学模型未改善高血压的区分能力(AUC 0.76 [95% CI 0.71-0.81] vs. AUC 0.80 [0.75-0.85])。结论:在这项针对黑人和拉丁裔女性的横断面分析中,累积社会劣势程度越高与高血压相关。虽然纳入HRSN未能超越传统人口社会学指标改善高血压预测,但研究结果可为针对心血管代谢风险少数族裔的靶向干预提供依据。 |