2026-08-11 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 感知先于监督:从反事实盲点进行自包含视觉蒸馏 | Shravan Venkatraman | 2026-08-10 | 多模态大语言模型(MLLMs)的自我提升通常依赖于基于奖励的方法,这些方法仅提供粗略的标量反馈。蒸馏通过密集的令牌级监督提供了更丰富的替代方案,但在视觉领域,它通常依赖于使用外部标注和工具或更强模型构建的特权上下文。我们引入了\textbf{CVPD}(对比反事实视觉过程蒸馏),据我们所知,这是首个完全自包含的框架,用于MLLMs的密集、在线策略、令牌级视觉自我蒸馏。CVPD识别视觉盲点,在这些盲点中,放大某个区域会改变并锐化模型的答案分布,而移除相同区域则使全图行为基本不变。这些区域揭示了模型能够编码但在全图条件下未能一致利用的感知信息。我们提出了一种三门反事实准则,直接从模型自身的响应中识别这些区域,并将其转换为密集的对比监督用于自我蒸馏。在Qwen3-VL-8B-Instruct上,CVPD在十二个基准测试中优于六个自我进化基线,包括依赖外部GPT-4o监督的方法,且没有出现任何回归。它在OCRBench上取得了$+3.60$的提升,在MMStar细粒度感知上取得了$+3.38$的提升,在MMStar逻辑推理上取得了$+3.08$的提升,同时在更广泛的多模态基准测试上保持或提高了性能。 | |
| 超越自然度:在语言学维度上探究自动文语转换评估器 | Oluwanifemi Bamgbose | 2026-08-10 | 自动文本转语音(TTS)评估方法(平均意见得分(MOS)预测器和音频大语言模型(Audio-LLM)评判器)预期反映人类感知,但尚不清楚它们在多大程度上捕捉到听众实际感知的语音的不同方面。我们将“自然度”解构为一个基于语言学的标注模式,涵盖10个不同的感知维度,并利用该模式构建了首个维度级TTS元评估基准,包含860条由训练有素的语言学家评分者标注的语音样本。对四个MOS预测器和四个Audio-LLM评判器进行基准测试的结果显示,MOS预测器主要聚焦于声学信号质量,而Audio-LLM评判器则表现出选择性的、依赖提示的检测能力,且无法在所有维度上泛化。这两类方法均未能可靠地捕捉到广泛的语言结构化语音错误。我们的数据集、标注模式和评估代码已公开,以支持更具针对性和可解释性的TTS评估。 | |
| 多模态模型差异分析用于特征发现与控制 | Hunar Batra | 2026-08-10 | 多模态大语言模型(MLLMs)展现出强大的视觉理解能力,但导致这些行为的内部特征仍难以识别、审计或控制。虽然适用于事后检查,但使用稀疏自编码器(SAEs)分解为可解释特征方向的隐藏状态,既不能轻易隔离多模态训练改变了哪些特征,也不直接用于针对性控制。我们引入MMDiff,一种多模态模型差异框架,它训练多模态SAEs并将其转化为特征级接口,用于发现和控制多模态行为。MMDiff支持三种用途:(i)特征隔离,通过将基础语言模型SAE与其多模态适配版本进行差异比较,识别多模态训练改变的特征;(ii)任务特定特征检测,通过逐令牌对比激发分析隔离因果特征;(iii)特征级控制,通过因果移除或引导所发现的特征方向。我们为三个MLLM家族——LLaVA-MORE、PaliGemma 2和InternVL3.5——训练多模态SAEs,并在视觉空间理解、多模态安全和OCR上评估。MMDiff发现稀疏、因果特定的特征,其移除在空间任务上平均选择性退化目标行为12%,在OCR上退化17%,并将多模态安全攻击的成功率降低24%,且对VQA性能无影响。引导这些特征在标准单层引导基线上平均提高空间和OCR准确率+3.6%和+1.8%。这些结果表明,多模态SAEs不仅可作为可解释性工具,还可作为审计、引导和控制MLLM行为以生成更安全、更强大输出的机制。 | |
| 学习世界如何演化:通过潜在动态推理实现外推式视频世界模型 | Haodong Li | 2026-08-10 | 世界按照其动力学(即运动定律)演化。然而,领先的视频扩散模型主要拟合像素,而不建模像素如何随时间转换。因此,它们生成视觉上合理的帧,但可能无法准确遵循这些定律。为了纯粹从像素中捕捉动力学,我们引入了潜在动力学推理(LDR)。LDR将潜在转换视为显式运动学积分,其中低阶动力学被数值积分,模型仅回归驱动推演的三阶及更高阶残差。为使此积分更好地外推,LDR在结构化潜在空间而非密集卷积特征上运行。遵循PhyWorld,我们在一个受控的白盒物理基准上验证LDR,该基准涵盖五个任务(匀速运动、抛物线、碰撞、弹跳、逼近),重点关注分布外场景,以揭示模型是否真正学习了底层动力学。LDR能更好地外推所学动力学:在单任务和联合任务训练下,256²分辨率时,其分布内与分布外误差之间的差距比视频扩散基线小20倍以上,同时使用参数少26倍,运行速度快143倍。LDR甚至能在严重偏移下泛化:例如,仅用红色球从左向右移动训练,它能正确预测蓝色方块从右向左移动。据我们所知,这是首个能将其所学动力学外推到训练分布之外的视频世界模型。项目页面:https://lat-dyn-reason.github.io/ | |
| 从价值观到基准:评估荷兰政府应用中大型语言模型的表现 | Laurens Samson | 2026-08-10 | 大型语言模型正日益部署于政府环境之中,然而现有评估框架鲜有同时反映公共行政价值观及非英语语境的语言要求。我们提出了“Grip on LLMs”框架,这是一套专为荷兰政府使用而设计的系统性评估套件,与一家大型荷兰市政组织的领域专家合作开发。通过咨询委员会流程、用户研究以及对公务员聊天机器人用户的调查,我们确定了六个评估维度(事实性、诚实性、社会偏见、能源消耗、成本及训练数据透明度),并将其操作化为一个涵盖30多个多语言及荷兰语特定模型的基准套件。我们的结果显示,没有任何单一模型能在所有维度上表现出色,且权衡不可避免:更高质量始终伴随着更大的环境影响和财务成本,而偏见则大体上独立于这两者。我们进一步发现,事实性(模型是否正确回答)与诚实性(模型是否承认其未知内容)受不同属性支配,高事实性并不意味高诚实性。为使这些发现对非技术受众具有可操作性,我们发布了一个公开可访问、用户友好的模型概览,旨在服务于参与政府LLM选择的各类利益相关者,从工程师到政策制定者。 | |
| GENCO——嵌入开发框架中的统一神经求解器,用于稳态电网分析 | Alban Puech | 2026-08-10 | 基础模型正在改变业务流程并提升生产力,但在电力系统分析等工程领域仍基本缺失,这些领域必须严格遵循物理一致性。我们提出GENCO(几何神经校正优化器),一种统一的神经求解器,用于稳态输电网分析,在单一架构和共享网络表示中处理潮流(PF)、最优潮流(OPF)和状态估计(SE)。为支持神经电力系统求解器的进展,我们推出开源GridFM开发框架,该框架在低代码环境中标准化合成数据生成和训练。我们还发布大规模数据集,包含跨多种电网拓扑的数百万个PF和OPF场景,以支持可复现的基准测试。我们在PFDelta和OPFData基准上评估GENCO,与最先进的神经求解器和经典求解器(包括Newton-Raphson和IPOPT)进行比较,并在真实世界Hydro-Québec SCADA数据上测试。对于大规模PF,GENCO恢复完整交流运行状态,包括直流PF无法提供的电压幅值和无功功率,同时匹配直流PF级别的有功功率平衡残差。它比Newton-Raphson快达30倍,仅比直流PF慢2倍。对于OPF,它比IPOPT快达85倍,同时在可行性、最优性和运行时间上优于直流OPF。对于SE,GENCO比经典加权最小二乘法对噪声测量和网络参数误差更稳健,即使加权最小二乘法无法收敛时也总能返回高质量估计。统一架构和开发框架共同为大规模稳态电网分析提供了新方法,降低了电力系统工程师的入门门槛,标志着向电网基础模型迈出一步。 | |
| 使用基础模型检测Python重构实现中的行为变化 | Jonhnanthan Oliveira | 2026-08-10 | Python是一种广泛采用的编程语言,因其简洁性和灵活性而受到重视。然而,尽管重构是软件演化中旨在改善内部代码结构而不改变外部行为的重要实践,Python的自动化重构仍然具有挑战性。理解重构过程中如何引入行为变化至关重要,因为这类问题可能损害软件可靠性并降低开发人员生产力。我们提出了一种基于基础模型预言机的方法,该方法分析git风格的差异,以识别Python重构引入的行为变化。我们在Rope重构实现上评估了我们的技术,重复使用了先前研究中的1,152次重构尝试,并使用预言机分析了217个结果转换对。我们的基于模型的分析在研究的七种重构类型中发现了13个不同的缺陷。所有报告的缺陷都已提交给相应的开发人员,根据问题跟踪器的证据,13个问题报告中有12个被接受。这些结果突显了提高当前Python重构工具鲁棒性的必要性,以确保自动化代码转换的正确性并支持可靠的软件维护。 | |
| 通过合成生成克服硬件保障中的数据稀缺与保密性问题 | Gijung Lee | 2026-08-10 | 硬件保障依赖于扫描电子显微镜(SEM)来验证纳米级结构,但组装自动化分析所需的大规模高质量数据集,受到耗时采集和对专有设计严格知识产权(IP)限制的阻碍。我们提出了一种隐私保护流程,通过大幅扭曲功能设计来保护IP,同时从少量初始样本生成视觉上逼真的合成数据集。StyleGAN首先学习硬件布局掩码的分布,以生成新颖的、宏观上多样化的结构。随后,条件生成对抗网络(Pix2PixHD)将这些掩码转换为保留真实纹理和噪声的逼真SEM图像。本研究的主要发现是,仅在此合成数据上训练的分割模型不仅成功实现了对真实图像的“模拟到真实”迁移,而且性能优于在有限真实数据集上训练的基线模型。由于底层合成布局明显新颖,且不复制原始设计的任何特定专有布线,部署最终分割模型可降低将敏感IP暴露于梯度反演和成员推断等攻击的风险,为硬件保障提供了高度安全且高性能的解决方案。 | |
| 超越危险相似性:面向免训练视频异常检测的对比事件裁决 | Wenti Yin | 2026-08-10 | 视频异常检测(VAD)旨在识别并时间定位视频中的异常事件。监督方法从目标域标注中学习异常决策边界,但需要大量域内数据。现有的免训练方法利用预训练模型的丰富语义知识和推理能力来解读视觉内容,然而这些能力并未直接定义异常决策标准:更丰富的异常描述能更好地捕捉危险相似性,却无法解决异常判定问题。为此,我们提出用于免训练视频异常检测的对比事件裁决方法(CEAVAD),将推理单元从孤立的异常概念转向可证伪的事件假设,并通过竞争性解释与视频证据之间的交互建立推理时的解释性边界。具体而言,CEAVAD首先利用公共安全知识构建危险-良性事件对比,将每种危险机制与通用正常描述及机制特定的良性对应项配对。随后,它判断目标区间更支持危险解释还是其良性竞争者,从而为目标生成可修正的对比边界提案。最后,CEAVAD在竞争性解释之间进行裁决,以确定危险假设是否在视频证据中成立,同时支持时间定位的异常检测和基于证据的解释。在三个广泛使用的VAD基准上的实验表明,CEAVAD在免训练范式下达到了最先进的性能。 | |
| DistMoE:分布式指令微调中混合专家模型的私有数据免排练路由机制 | Mainak Singha | 2026-08-10 | 多模态大语言模型(MLLMs)已展现出强大的多模态指令跟随能力,但将其适应于多样化的视觉-语言领域通常假设集中式数据访问和昂贵的联合训练。当数据分布在私有、领域特定或权限受限的客户端时,这种假设具有限制性。为此,我们提出DistMoE,一种用于分布式视觉指令调优的混合专家(MoE)方法。在语言解码器的每一层中,它通过客户端特定的私有前馈网络(FFN)专家增强公共前馈网络,旨在获取领域特定知识。然而,独立的专家训练导致私有FFN学习到不同尺度和量级的表示,使得合并专家变得困难。为减少客户端特定漂移,我们引入一个公共锚定的专家组合阶段,该阶段仅通过各向同性正则化损失,在本地客户端数据和公共数据的混合上更新路由器和轻量级私有投影适配器,从而实现无需跨客户端重放的组合。在推理时,DistMoE在公共和私有专家之间执行模块化路由,实现无需显式领域标签的令牌级领域组合。跨多种视觉-语言基准的实验表明,DistMoE支持灵活的专家重用、有效的领域适应和竞争性能,同时保持对客户端特定知识的模块化控制。代码可在https://github.com/mainaksingha01/DistMoE获取。 |
bioRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 在生长素分布起作用之前:MPK6依赖的AUX/IAA8磷酸化对拟南芥胚胎轴的预模式化 | Bischoff, T. | 2026-08-11 | 在植物生长发育过程中,信号分子生长素扮演着关键角色。许多模式形成过程以自组织方式受生长素信号调控。受精后,这一模式形成过程需要在植物生命历程中首次启动。与先前模型相反,我们展示了在合子的两个子细胞中,区分胚胎与胚外发育的首次差异性生长素响应,其发生并不依赖于可检测的生长素梯度。相反,MAP激酶信号对转录抑制因子Aux/IAA8的差异性磷酸化,导致两个子细胞间生长素敏感性的差异,从而在顶端细胞中启动胚胎发育。基底细胞中IAA8的磷酸化阻止了蛋白酶体降解,抑制了典型的生长素响应,进而启动胚外发育。因此,MAP激酶信号先于生长素梯度,并在不依赖生长素梯度的情况下预模式化顶端-基底轴。 | |
| 巨胞饮杯状结构重塑中V-ATPase功能的进化分化 | Chordiya, B. | 2026-08-11 | 巨胞饮是一种从单细胞真核生物到哺乳动物进化上保守的过程。该过程依赖于质膜下富含肌动蛋白的突起形成巨胞饮杯。传统上,V-ATPase在晚期内体酸化中的作用研究最为深入。然而,V-ATPase与细胞骨架机制的相互作用及其与脂质在巨胞饮杯形成中的交叉对话的具体作用尚未被探究。在此,我们揭示了V-ATPase在致病性阿米巴溶组织内阿米巴中塑造巨胞饮杯的前所未有的作用。我们的结果表明,溶组织内阿米巴V-ATPase复合体与巨胞饮杯处的F-肌动蛋白相关联。此外,我们发现V-ATPase复合体被动态招募至巨胞饮杯,并从巨胞饮体解离。我们进一步证明,V-ATPase V1B亚基直接与肌动蛋白结合,并独特地促进肌动蛋白聚合。pH生物传感器磷脂酸揭示其相互作用组中富含V-ATPase复合体和细胞骨架相关蛋白。令人惊讶的是,V1B亚基显示出与磷脂酸的可重复结合,且这种相互作用调节肌动蛋白聚合。总的来说,我们的工作强调了V-ATPase在直接驱动肌动蛋白聚合中的新作用,与磷脂酸协同,以塑造巨胞饮杯。 | |
| 预测快速范围扩张后冠蚊的过去、现在及未来分布 | Magaletta, O. | 2026-08-11 | 入侵性蚊虫物种对人类和动物健康构成重大风险。自2004年以来,作为一种具有公共卫生关注度的蚊虫媒介物种,Culex coronator在美国境内迅速扩展其分布范围,从历史上局限于得克萨斯州南部,蔓延至墨西哥湾沿岸地区,并进入东部和中大西洋各州。然而,与这一扩展相关的环境适宜性在历史、当代和未来气候条件下的变化尚未得到评估。在此,我们使用物种分布模型(SDMs),基于美国历史分布范围,比较了历史(1960-1989年)和近期(2000-2024年)气候条件下对Cx. coronator非生物适宜性的预测。我们还基于物种扩展前后的发生记录(1960-2024年)构建了一个当代SDM,并进一步预测当前和未来气候条件下的潜在分布。基于历史范围校准的模型仅预测了墨西哥湾沿岸地区适宜性的适度变化,未能识别出美国东部湿润亚热带地区现已占据的大片区域。相比之下,当代模型预测了美国南部和东部大部分地区的广泛适宜性。在中档SSP3情景下的未来预测显示,高纬度和高海拔地区的适宜性将增加。在所有模型中,干旱和半干旱地区的适宜性始终较低,包括历史西部范围边界,这表明水分可用性可能限制Cx. coronator的分布。综合来看,这些结果强调了在建模入侵性蚊虫物种时纳入更新发生记录的必要性,以加强监测和控制策略。 | |
| 纯合性与遗传负荷作为蝴蝶种群衰退的敏感早期预警 | Fava, S. | 2026-08-11 | 昆虫通常被认为凭借高繁殖力、短世代时间和庞大的种群规模而免受基因组侵蚀。然而,昆虫种群可能衰退并最终灭绝,这凸显了需要能够提供种群崩溃可操作早期预警的基因组指标。在此,我们通过比较濒危蝴蝶——地中海庞廷群岛特有的Ponza灰蝶(Hipparchia sbordonii)的当代与历史基因组,以及广泛分布的欧洲同属物种H. semele的基因组,来检验这一预期。利用全基因组重测序、基于外群变异极化、人口史重建、纯合片段、选择扫描和基于注释的遗传负荷分析,我们表明H. sbordonii经历了持续的人口收缩,包括近期急剧下降。尽管平均全基因组杂合度的时间变化有限,我们观察到当代H. sbordonii中广泛的纯合性、升高的近交水平,以及从掩蔽遗传负荷向现实遗传负荷的明显转变。R'XY分析显示,H. sbordonii和H. semele中高影响衍生变异的相对频率相似,表明种群崩溃期间净化选择无效,而低和中等影响变异在H. sbordonii中相对富集,尤其是在候选选择区域内。这表明动态更为复杂,功能变异受到漂变、放松的净化选择以及可能局部适应的共同影响。我们的研究表明,衰退的蝴蝶种群带有独特的基因组侵蚀特征,与脊椎动物中记录良好的模式相呼应。然而,H. sbordonii近期的种群崩溃更清晰地通过长纯合片段和现实遗传负荷捕捉,而非平均全基因组杂合度的变化,凸显了它们作为监测衰退昆虫种群早期预警指标的潜力。 | |
| 昆虫中金属羧肽酶E的基因丢失倾向受结构多功能性及金属羧肽酶D更广泛表达的影响,而非功能重要性 | Wegener, C. | 2026-08-11 | 基因丢失是塑造基因组进化的普遍现象,然而决定为何某些基因反复丢失而其他功能相关基因得以保留的因素仍知之甚少。我们利用肽加工金属羧肽酶羧肽酶E(CPE)和羧肽酶D(CPD)解决了这一问题,它们是保守的旁系同源物,对神经肽成熟至关重要,但在进化命运上显著不同:cpe基因在两个主要昆虫谱系中独立丢失,而cpd/svr则普遍保留。结合基因系统发育分析、赤拟谷盗(Tribolium castaneum)中的功能遗传学以及果蝇(Drosophila melanogaster)中的跨物种拯救实验,我们表明CPE和CPD尽管在结构、生物体重要性和表达上存在显著差异,但保留了部分可互换的酶功能。与预期相反,cpe在赤拟谷盗中对生存和发育稳健性比cpd/svr更为关键,而同时通过RNAi介导下调两个基因导致完全幼虫致死,表明仅存在部分功能冗余。此外,甲虫CPE部分拯救了果蝇CPD的致死性丢失,确立了跨越约3亿年昆虫进化的保守分子互换性。基因系统发育分析进一步表明,两侧对称动物的CPE起源于祖先CPD第二催化结构域的复制。总之,我们的结果表明,昆虫cpe的反复丢失不能归因于功能重要性的降低。相反,我们提出CPD的结构多样性、更广泛的组织分布和多功能性,包括其多结构域架构和剪接异构体,使得在基因丢失后能够补偿CPE,从而塑造了昆虫进化中基因保留和丢失的长期模式。 | |
| 黄绿藻(黄藻纲,不等鞭毛门)多细胞性及繁殖策略的演化 | Choi, S.-W. | 2026-08-11 | 多细胞性的演化长期以来与生殖策略相关联。一个长期存在的争论是,多细胞生物主要是通过产生小型单细胞繁殖体以最小化遗传异质性来稳定,还是通过较大的多细胞和多核繁殖体来提高个体发育成功率和生存能力。黄藻纲为研究这些问题提供了极佳模型,其展现出从单细胞到多细胞丝状体和共囊体形态的转变,以及包括单细胞游动孢子和自孢子、多核单孢子和厚壁孢子在内的多种繁殖模式。然而,在该谱系中,缺乏稳健的系统发育框架和性状演化的系统分析。在此,我们基于18个物种的680个基因核数据集(包括17个新生成的转录组)提出了一个系统基因组学框架。核系统发育树稳健地解析了所有取样的目间和科间关系,连接法和溯祖分析结果完全一致,而来自33个物种的质体(141个基因)和线粒体(31个基因)数据集恢复了相同的拓扑结构。基于这些结果,我们建立了一个新目(拟绿球藻目),修订了一个目(异球藻目),并提出了五个新科。祖先性状重建表明,从单细胞祖先到简单多细胞性至少发生了四次独立转变。对多细胞性和繁殖性状的贝叶斯分析显示,这些转变始终伴随着从多种自孢子型繁殖体向单一单孢子和厚壁孢子型繁殖体的转变,而回归单细胞性则与自孢子繁殖的重新出现相关。这些结果为理解黄藻纲的多细胞演化提供了系统基因组学框架,并揭示了繁殖模式与简单多细胞性出现之间的关系。 | |
| 修补位点:基因诞生与进化创新的基因组热点 | Weisman, C. M. | 2026-08-11 | 进化如何创造新事物?一个关键策略是“修补”:以新方式改变和重用现有生物组分。修补通常被认为在基因组层面无模式,发生时不具空间或其他结构。在此,我发现“修补位点”——千碱基规模区域,其通过修补产生新基因的速率显著更高——在果蝇基因组中普遍存在。这些区域通过积累来自基因组各处异常高浓度的重复基因片段来运作,提高它们被征用以创造新基因的速率,尤其是那些包含先前无关片段新组合的基因。其活性在数百万年时间尺度上变化;它们利用由所有主要转座子类型启用的通用机制;并形成网络以集体创新,使其有用产物能复制成基因家族。修补位点表明进化创新可以是基因组架构的属性,并提示一种可调机制,塑造动物进化的节奏与模式。 | |
| 灰海豹亚种间的当代杂交与局部基因组分化 | Konstantopoulou, A. | 2026-08-11 | 灰海豹分为两个亚种:波罗的海的Halichoerus grypus grypus和北大西洋的H. grypus atlantica。历史上, intense捕猎导致灰海豹在其分布范围内局部灭绝,并促进了亚种间的地理隔离。然而,近期种群恢复和再殖民使得它们在丹麦和瑞典水域的接触区重新重叠。本研究利用119个个体的全基因组测序数据,探讨灰海豹的种群历史、亚种分化,以及接触区局部适应和潜在杂交的基因组特征。我们估计分化始于约1万年前,基因流在2000年前停止。我们检测到高遗传分化峰位于与渗透压和体温调节推定功能相关的基因附近,这与波罗的海和北大西洋之间的盐度和温度差异一致。作为地理隔离打破的证据,我们在西南波罗的海接触区报告了一个杂交个体,具有波罗的海母系和北大西洋父系祖先,并在北海识别出一个波罗的海起源的迁移个体。我们的研究阐明了局部环境变异和长期捕猎压力如何在短进化时间尺度上促进哺乳动物亚种分化,而近期种群恢复、再殖民和杂交正在重塑基因流动态。广泛而言,我们的工作强调了在人为影响(包括干扰和保护成功)背景下研究进化过程的重要性,其中种群波动、范围变化、基因流改变和对变化环境的适应以复杂且可能具有深远后果的方式相互作用。 | |
| 雌性繁殖输出的密度依赖性可塑性介导了黑腹果蝇中的Allee效应 | Kulkarni, R. K. | 2026-08-11 | Allee效应是指个体适应度各组成部分与种群中个体数量或密度之间的正相关关系。在果蝇(Drosophila melanogaster)中,负密度效应在各个生命阶段均有充分记录,而Allee效应则较为罕见,且主要局限于幼虫阶段。然而,尽管高密度存在代价,成年果蝇仍表现出对同性同类的吸引力,这表明同类的存在具有一定的适应度价值。我们测量了以1、2或10只同性密度饲养的单次交配雌蝇的适应度相关性状,发现低密度下终生繁殖产出显著降低。此外,这些雌蝇将繁殖努力集中在成年早期,尽管这并未改善适应度估计值。当在不同密度下饲养时,雌蝇会根据即时密度调整繁殖产出,但除非能够再次交配,否则无法改善这一表现,这表明交配与密度之间存在交互作用。总体而言,我们的研究结果表明,雌性果蝇对同类存在所做出的繁殖可塑性反应,介导了密度对适应度的正效应。理解这种可塑性的生理和生态基础,可能有助于解释果蝇社会倾向的进化。 | |
| 基因组可塑性与同源重组驱动Pectobacterium jejuense在不同宿主和地理区域间的进化 | Arizala, D. | 2026-08-11 | Pectobacterium jejuense是一种新近描述的软腐病原菌,具有新兴的农业重要性,但其进化动态和基因组多样性仍知之甚少。本研究利用全球214个Pectobacterium基因组(包括从夏威夷羽衣甘蓝分离的四个新生成完整基因组)调查了P. jejuense的进化模式和毒力相关特征。基于基因组的分类学分析确认了夏威夷分离株的身份,并支持将菌株IPO:4059 NAK:253重新分类。基于1,181个核心基因的系统发育基因组学分析将P. jejuense解析为一个与P. brasiliense密切相关的独立谱系。尽管核心致病性决定因子(包括植物细胞壁降解酶和I-III型及VI型分泌系统)保守,但辅助基因含量存在显著变异。重组分析揭示了广泛的种间基因流动(7,715个事件),各菌株间重组频率异质性明显。值得注意的是,重组热点富集于参与铁获取、应激反应、代谢和植物细胞壁降解的基因中,提示其在生态适应中的作用。种内分析鉴定出四个谱系,其中夏威夷菌株形成一个独特分支,其特征为重组减少和独特基因组特征。质粒含量变异明显,夏威夷P. jejuense菌株携带单一质粒,而其他菌株缺乏质粒;抗菌基因簇的差异进一步凸显了竞争和适应潜力的变异。综合这些发现表明,同源重组和基因组可塑性塑造了P. jejuense的进化,影响与宿主适应、生态适应性和致病潜力相关的性状。 |
medRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 使用WHO框架量化学生抑郁的学术风险因素:比值比、SHAP可解释性与临界点分析 | Ahmed, T. | 2026-08-11 | 抑郁症已成为全球学生面临的严重问题。本研究与世界卫生组织《青少年茁壮成长(HAT)指南》及健康社会决定因素(SDoH)模型保持一致,从印度27,880名大学生数据集中分离出五个与学业相关的因素——学业压力、学习/工作时间、学习满意度、睡眠时长和经济压力,并量化其与抑郁症的关联。与以往追求分类准确率最大化的研究不同,本研究优先考虑可解释性:逻辑回归提供具有95%置信区间的比值比(OR),随机森林(RF)和XGBoost按特征重要性对预测因子排序,SHAP(SHapley Additive exPlanations)值将分析扩展到个体层面的风险解释。SMOTE过采样仅应用于训练集,性能在原始不平衡测试集(n = 5,576)上评估。两种集成模型均达到约77-78%的准确率和0.845的AUC,经5折管道交叉验证确认(CV AUC [~] 0.843)。学业压力是主导风险因素(OR = 2.271;RF重要性 = 0.481;平均|SHAP| = 0.174),而学习满意度(OR = 0.796)和睡眠时长(OR = 0.835)具有保护作用。RF模型在学业压力 > 4.02处产生临界点,交互图显示抑郁风险如何因睡眠不足、高经济压力和延长学习时间而放大。这些发现提供了与WHO认可的可改变决定因素一致的数据驱动阈值,以支持早期发现和机构咨询。 | |
| 一种优化的血清学机器学习模型,用于实现针对间日疟原虫疟疾的靶向检测与治疗 | Smith, L. | 2026-08-11 | 间日疟原虫的持续存在由隐藏的感染库驱动,构成消除的关键障碍。抗体在无性感染从外周血清除后仍持续存在,因此可指示当前及近期既往感染。在此,我们提出一种机器学习算法,利用血清学标志物对近期间日疟原虫感染进行分类,以识别可能的休眠子携带者。利用在三个低传播环境中进行的为期一年的观察性队列研究(包括阴性对照,N=2,635)的血清学测量数据,我们通过平衡血清诊断性能与检测复杂性和可扩展性,选择了最优标志物子集。我们最初训练了随机森林分类器,随后比较了多种机器学习分类器。基于树的方法始终表现最佳,尽管差异不大。开发了一个在线R Shiny应用程序(PvSeroApp),用于自动化数据处理、质量控制和血清状态分类。该算法支撑间日疟血清学检测与治疗(PvSeroTAT)策略,实现靶向抗休眠子治疗并加强消除工作。 | |
| CT ECV Mapper:一个交互式3D Slicer应用程序,具备批量处理能力的流水线,用于肝脏及肝肿瘤的体素级CT衍生细胞外体积映射 | Suzuki, M. | 2026-08-11 | 背景。基于增强CT的细胞外体积分数(ECV)是肝纤维化的已验证标志物,并据报道在肝细胞癌(HCC)与肝内胆管癌之间存在差异。在已发表的研究中,它通过少量手工放置的二维感兴趣区域获得,计算其的软件要么绑定于特定制造商的工作站,要么基于光谱或双能量采集。我们未发现一种可访问的工具,能从常规单能量多期CT生成体素级肝脏ECV图。方法。我们开发了CT ECV Mapper,这是一个脚本化的3D Slicer扩展,采用三层架构,其数值核心不导入slicer或vtk,并在3D Slicer外部进行单元测试。交互式应用提供两阶段配准,操作员在计算任何ECV前检查并接受,操作员放置三维感兴趣区域,用户可调整计算参数,体素级ECV彩色图和ROI统计;同一逻辑层可无人值守地驱动整个队列。该工具应用于公共WAW-TACE多期HCC/TACE数据集的164名患者,这些患者均有平扫和延迟期序列。结果。156/164例(95.1%)完成无人值守处理。全肝ECV中位数为36.2%(四分位距31.9-41.5),与已发表的纤维化和肝硬化肝脏CT-ECV值一致。按需配准动脉期和门脉期将肿瘤ECV从常规两期流程可达到的38个病灶扩展到156名患者中的248个病灶。每个失败均可归因于可识别机制:六例中相位间头尾视野不匹配,一例血池区域主动脉钙化,一例源数据集标签错误,其中声明为平扫的序列被证明是门脉期的第二次重建;这通过血池有效性检查而非视觉审查检测到。结论。在开放平台上,从常规多期CT进行肝脏和肝肿瘤的体素级CT ECV映射是可行的,既可交互式也可作为无人值守批量处理,并带有明确且可诊断失败的质控仪器。这是一份技术开发和可行性报告;该应用尚未对照参考标准进行评估,且不声称临床有效性。 | |
| 基于人群的神经退行性疾病血液生物标志物参考方程与Z评分 | Lehmann, S. | 2026-08-11 | 背景 血液生物标志物越来越多地被用于支持神经退行性疾病的诊断和监测。然而,其解读受到生理决定因素(包括年龄、性别、体重指数和肾功能)以及不同分析方法间绝对浓度差异的影响而变得复杂。我们旨在开发基于人群的参考方程,以实现神经病学中主要血液生物标志物的个体化解读。方法 在这项横断面研究中,我们分析了选自法国CONSTANCES和Three-City基于人群队列的认知正常参与者的血浆样本。使用广义可加模型对位置、尺度和形状进行建模,根据年龄、性别、体重指数和肾功能,对神经丝轻链(NfL)、胶质纤维酸性蛋白(GFAP)、磷酸化tau 181(p-tau181)、淀粉样蛋白-{beta}40、淀粉样蛋白-{beta}42及其比值进行建模。所得方程提供了个体化的预期浓度、百分位数和Z分数。先前建立的疾病特异性浓度被转换为Z分数。针对不同分析方法和样本基质间的NfL测量,开发了交叉校准方程。结果 最终参考人群包括5123名参与者用于淀粉样蛋白生物标志物和p-tau181,以及5122名用于NfL和GFAP;中位年龄为52.3岁,一半为女性。在40至80岁之间,预期NfL和GFAP浓度分别平均每年增加2.6%和2.2%。肾功能、体重指数和性别对生物标志物有额外的特异性影响。将方程应用于临床队列保留了不同的疾病相关特征:NfL Z分数在涉及神经轴突损伤的疾病中升高,而p-tau181和GFAP在阿尔茨海默病中显示最大增加。NfL交叉校准方程在方法和基质间表现出极佳的一致性,组内相关系数大于0.90。解读 这一基于人群的多生物标志物框架使得血液生物标志物浓度能够相对于具有相似生理特征的个体进行解读。公开可用的方程、参考曲线和标准化Z分数可改善个体化解读以及跨生物标志物、实验室和临床人群的可比性。 | |
| 利用重复测量的膳食摄入数据考察饮食模式的时间稳定性:来自黑人女性健康研究的结果 | Stephenson, B. J. K. | 2026-08-11 | 背景:许多流行病学研究仅依赖基线时的膳食暴露数据。这限制了我们理解饮食与疾病关联的能力,因为需要假设个体或膳食模式组成具有一定的时间稳定性。目的:本研究旨在利用一组具有重复食物频率问卷(FFQ)测量的美国黑人女性队列,评估模式结构一致性和基线依从性这些分析假设。方法:评估了来自黑人女性健康研究的6151名年龄21-69岁的黑人女性,她们在1995年、2001年、2013年和2021年具有完整的FFQ数据,以评估时间稳定性。使用过拟合潜在类别模型推导基线膳食模式。然后将基线模型的参数估计应用于后续波次,以追踪个体在现有模式之间的转变。还在每个时间点使用过拟合潜在类别模型独立推导膳食模式,并评估模式组成随时间的变化。结果:1995年识别出五种基线膳食模式。仅有18%的参与者在所有四个时间点保持相同的基线膳食模式,而所有其他人都转变到不同的基线衍生模式。在后续时间点独立推导的膳食模式,每个时间点产生不同数量的模式(2001年:6种模式,2013年:5种模式,2021年:4种模式)。后续推导模式与基线模式的相关强度在2001年后显著减弱(40%的配对相关性>0.5),到2021年没有模式的相关性超过0.5。结论:依赖基线膳食暴露数据的前瞻性研究不能假设模式组成或个体模式依从性随时间保持稳定,因为这忽略了饮食习惯的变化,并可能使我们对饮食-疾病途径的理解产生偏差。 | |
| 基于血液的细胞骨架与细胞外重塑特征用于导管内乳头状黏液性肿瘤的风险分层 | Patterson, L. L. | 2026-08-11 | 摘要 背景:导管内乳头状黏液性肿瘤(IPMNs)被认为是胰腺导管腺癌(PDAC)的前驱病变。然而,从低级别异型增生进展至晚期疾病的分子程序尚未完全阐明。本研究整合了血浆和组织蛋白质组学分析,并结合空间和单细胞转录组学,以识别在循环中反映的生物学一致性重塑程序,这些程序可区分不同异型增生级别及浸润性疾病的IPMN。方法:采用O-link邻近延伸分析平台,对低级别(LG)IPMN(n=30)、伴或不伴相关PDAC的高级别(HG)IPMN(IPMN/PDAC;n=40)以及无IPMN的PDAC(n=8)患者血浆样本中的1,104种蛋白质进行了定量。评估了单个生物标志物的预测性能;进行似然比检验以识别与CA19-9互补的蛋白质生物标志物,用于IPMN恶性风险预测。研究结果与可用的IPMN组织空间(N=13)和单细胞(N=6)转录组数据集,以及独立一组切除人IPMN组织(N=9)的基于质谱的蛋白质组学谱进行了交叉分析。结果:与LG IPMN相比,在HG、IPMN/PDAC以及HG+IPMN/PDAC病例中分别发现28、43和35种循环蛋白存在差异表达。差异蛋白中包括已知的PDAC相关标志物CEACAM5、CTRC和REG3A,以及若干反映细胞骨架和细胞外基质重塑及炎症过程的生物标志物。聚焦于细胞骨架和ECM相关蛋白,并采用似然比检验,考虑CA19-9、BGN和ITGB1BP1的OR规则在HG+IPMN/PDAC中实现了48.7%的总体敏感性,包括HG IPMN的38.1%敏感性,总体特异性为90%,优于单独使用CA19-9(总体敏感性为28.2%;McNemar精确检验单侧p值:0.011)。IPMN组织的整合蛋白质组学和空间转录组学数据集显示,细胞骨架和ECM重塑的协调改变以及基质硬度升高是与IPMN/PDAC相关的显著特征,这与BGN和ITGB1BP1的一致增加相平行。基于空间和单细胞数据的细胞类型来源分析进一步显示,成纤维细胞和髓系细胞是BGN表达水平的主要贡献者,而ITGB1BP1主要在肿瘤性上皮中表达。结论:晚期IPMN异型增生和浸润性疾病以协调的组织重塑程序为特征,这些程序在循环蛋白质组学谱中系统性反映。通过本研究鉴定的血液生物标志物,如BGN和ITGB1BP1,有潜力在IPMN风险分层中优于CA19-9,从而更好地指导临床管理。 | |
| 间皮瘤和胸腺上皮肿瘤的I期试验代表性及地理分布 | Mishra, S. | 2026-08-11 | 背景与目的:罕见胸部肿瘤长期被排除在临床试验之外。为解决这一问题,我们对胸腺上皮肿瘤(TETs)和间皮瘤的I期试验进行了特征分析,涵盖其代表性、地理分布、作用机制及临床结局。材料与方法:从ClinicalTrials.gov中识别1995年1月至2026年1月期间的I期实体瘤试验,并使用Python提取试验状态。通过Python流程筛选出TET和间皮瘤相关试验,并将其分为有结果和无结果两类。有结果的试验经过人工审查,并通过PubMed、Google Scholar和LARVOL CLIN验证发表状态。结果:在筛选的6,610项I期试验中,3.1%(n=203)包含罕见胸部肿瘤。其中,11.3%(n=23)报告了结果,34.8%(8/23)推进至I期以上阶段,21.7%(n=5)发表于高影响力期刊(IF > 10)。靶向治疗在分类中占主导地位(65.2%),其次是免疫治疗(34.8%)和抗体药物偶联物(ADCs;8.7%)。报告的有效性结局范围广泛:客观缓解率(ORR,0-44%)、无进展生存期(PFS,1.3-8.3个月)和总生存期(OS,3.0-19.3个月)。疲劳是最常见的毒性反应,在58%的靶向治疗试验以及100%的免疫治疗和ADC队列中观察到。没有新型药物获得后续的疾病特异性FDA批准。地理分布上,在96个试验地点中,49.0%集中在欧洲,21.9%在美国。结论:当前I期试验中,针对间皮瘤和TETs的研究显著匮乏,且主要集中在高收入地区。弥合这一差距需要优先关注罕见胸部肿瘤,并在代表性不足的国家建设临床基础设施,以提高试验可及性和多样性。关键词:胸腺上皮肿瘤、间皮瘤、I期临床试验、ClinicalTrials.gov、罕见胸部恶性肿瘤。 | |
| HYROX运动员的损伤流行病学:一项国际横断面调查 | Ketzer, C. E. | 2026-08-11 | 摘要 目的 HYROX是一项快速增长的混合健身赛事,将跑步与功能性训练站相结合。我们的目标是描述自我报告的HYROX相关损伤的12个月患病率、特征和严重程度。方法 我们对418名HYROX运动员进行了一项国际横断面在线调查。主要结果是自我报告的至少一次HYROX相关损伤的12个月期间患病率;次要结果包括每1000小时总训练暴露的暴露调整后下界损伤率,以及最显著损伤的特征和严重程度。通过多变量逻辑回归分析相关因素。结果 总体而言,418名参与者中有208人(49.8%,95% CI 45.0至54.5)报告至少一次HYROX相关损伤。暴露调整后下界损伤率为每1000小时总训练暴露1.65次报告损伤。损伤主要影响下肢,最常见的是膝关节(20.8%);肌腱相关不适是主要类型(41.6%),且大多数为渐进性发作。在具有严重程度数据的参与者中,20.3%报告训练中断超过28天或未能恢复到之前的运动表现水平。较高的HYROX专项训练频率是唯一与损伤报告独立相关的因素(调整后OR 1.61,95% CI 1.20至2.16;p = 0.001)。结论 大约一半的受访者报告在过去12个月内至少发生一次HYROX相关损伤,主要涉及渐进性发作的下肢不适。较高的HYROX专项训练频率与损伤报告相关,尽管横断面设计排除了因果解释。需要前瞻性、基于暴露的监测来量化HYROX专项损伤的发生率和负担,并检查训练频率、负荷分配和恢复是否对损伤风险有贡献。 | |
| 与阿尔茨海默病(AD)相关的ACE变异分类:ACE突变——AD浏览器 | Buianova, A. A. | 2026-08-11 | 背景:ACE变异是阿尔茨海默病(AD)的遗传风险因素,可能通过降低酶活性和损害淀粉样蛋白{β}水解发挥作用。目的:建立一个与ACE缺乏和AD相关的ACE变异公开数据库,并估算有害ACE变异的群体频率及其对血液ACE水平的影响。方法:ACE变异从文献、公共数据库(VarSome、dbSNP、ClinVar、gnomAD)以及5147名俄罗斯个体的测序数据(WES/WGS)中汇编。变异使用共识性计算机评分(AlphaMissense、MetaRNN、EVE)进行分类。在330名携带64种不同ACE突变的个体中测量了血液ACE水平。结果:我们识别出1682种独特的ACE变异。其中,608种(36.2%)被分类为功能性有害,包括17种信号肽、210种功能丧失和381种错义变异。有害ACE变异的估计携带频率为2%(1/50)。值得注意的是,24种与实验确认的血液ACE水平降低相关的变异,在一般人群中的合并估计携带频率为3.9%,这是根据gnomAD v4.1.0等位基因频率在罕见变异独立模型下计算得出的。一个开放获取的浏览器可在https://ace-browser.com/上访问。结论:与血液ACE水平降低相关的变异估计在一般人群中约有1/25的个体携带。这一频率与75-84岁个体中阿尔茨海默病痴呆的13.2%患病率(阿尔茨海默病协会,2025)处于同一数量级,与ACE缺乏可能代表晚发型AD易感性中一个未被充分认识的贡献因素的假设一致。本文提供的ACE突变-AD浏览器和整合的基因型-表型数据为未来关于ACE依赖性AD的基础、转化和临床研究提供了新资源。 | |
| 跨生物样本库的局部祖先感知遗传关联分析统一框架 | Hu, L. | 2026-08-11 | 生物库越来越多地包含具有混合基因组的个体,然而传统的全基因组关联研究框架要么排除无法被自信地分配到某个离散祖先群体的参与者,要么忽略祖先特异性效应。我们提出了FELIX,一个可扩展的局部祖先感知遗传分析框架,它保留所有参与者而无需离散祖先分配。FELIX结合了紧凑的祖先解析基因型表示(FELIXla)与一个自适应关联检验,该检验在每个变异位点联合评估共享效应和祖先特异性模型(FELIXassoc)。模拟实验展示了在病例-对照不平衡下的校准良好的推断,以及适应位点最优模型的统计功效。在240,038名All of Us参与者中的24种表型中,FELIX分析了被全局祖先聚类排除的12.1%个体,并识别出比全局祖先荟萃分析多15.4%的全基因组显著位点。额外的发现来自恢复混合参与者携带的祖先特异性单倍型,以及检测祖先依赖性边际效应。全队列效应估计还改善了跨祖先和性状的多基因评分预测。 |