2026-07-09 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 通过深度原生结构推理实现准确、跨学科且透明的结构-性能理解 | Chen Tang | 2026-07-08 | 结构-性质关系是生物学、化学和材料科学的基础,功能、反应性和物理响应源于空间、化学和周期性的组织。从机制上解释这些关系需要运用科学原理和物理约束(从立体化学和键合到对称性、能量学和周期有序性)来解读结构证据。然而,将人工智能应用于这一过程面临着表征与推理的双重挑战:模型必须保留领域原生的结构信息,同时展示特定证据如何在这些约束下支持预测。在此,我们提出SciReasoner,这是一个跨蛋白质、小分子和无机晶体的多模态科学基础模型,专用于原生结构推理。SciReasoner将坐标、拓扑结构和周期性连接离散化为统一的结构感知词汇表,在推理过程中将结构标记视为可寻址的证据单元。在同源性控制的基因本体预测中,SciReasoner改进了低同源性和孤儿样蛋白质的细胞组分注释,将$F_{\max}$从0.42提升至0.55。在化学领域,它将单步逆合成准确率从0.63提升至0.72,同时生成片段级断键和前体验证轨迹。在材料科学中,其表征能够区分元素相和化合物相,并分辨高带隙与低带隙区域。在86个基准测试中,SciReasoner在67项任务上达到了最先进性能。双盲专家评估显示,其推理轨迹在98%的案例中优于或至少与前沿大语言模型相当。通过将结构作为科学约束下可检验的推理基底,SciReasoner将准确预测与可解释的科学推断联系起来。 | |
| Co-LMLM:连续查询有限记忆语言模型 | Yair Feldman | 2026-07-08 | 有限记忆语言模型(LMLMs)在预训练阶段将事实性知识外化到知识库(KB)中,而非将其记忆在模型权重内。生成过程中,模型按需从知识库获取知识。这一新近提出的范式具有多重优势,包括传统大语言模型(LLMs)无法实现的知识控制能力。我们提出连续查询LMLM(CO-LMLM),其知识库将连续键与文本知识值配对,这显著区别于以往依赖关系型知识库和查询的方法。CO-LMLM以极低成本生成灵活向量查询,同时仍能将人类可读且可归因的检索知识整合到生成过程中。我们为该设计配套开发了标注流水线,可对任意文本中的自由形式事实片段进行标注,突破了先前工作仅限维基百科的限制。在维基百科和FineWeb-Edu上的预训练实验及多模型规模测试中,CO-LMLM在困惑度和事实精确度上均优于先前的LMLMs和标准LLMs。在360M参数规模下,其困惑度甚至低于使用40倍数据预训练的模型,且SimpleQA验证性能与gpt-4o-mini相当,高于Claude Sonnet 4.5。 | |
| 实现线性化的关键:分析驱动的Transformer线性化 | Anna Kuzina | 2026-07-08 | 因果自注意力的二次复杂度严重制约了长上下文Transformer的推理效率。尽管存在多种事后线性化方案,但难以判断哪些组件能保持模型质量。本研究在严格冻结骨干网络的框架下,分离了状态更新设计的影响。我们证明softmax依赖于键相关的秩一正交投影,揭示了为何delta式网络优于纯门控累积机制。我们识别了近似误差的潜在来源,并引入结构性干预措施——具体包括汇合令牌、短卷积和固定预算缓存路由——有效缩小了剩余差距。我们将该线性化方法扩展到LLaMA和Qwen系列中参数规模达320亿的模型,在MMLU基准上超越此前所有事后基线方法,并在长上下文检索任务中达到与复杂自适应缓存框架相当的水平。 | |
| 从噪声轨迹到根本原因:面向智能体优化的结构轨迹分析与因果提取 | Ying Chang | 2026-07-08 | 长周期智能体的优化越来越依赖于基于反思的机制,即利用大型语言模型作为优化器来诊断智能体故障并改进智能体策略。然而,真实的执行轨迹难以直接用于优化:大量轨迹集合往往冗余且异构,导致优化效率低下且容易过拟合于低价值故障;同时,每条单独轨迹也包含许多无关步骤,而简单的上下文缩减方法(如截断或滑动窗口)可能丢弃因果关键证据,产生误导性优化信号。为解决这一困境,我们提出STRACE(结构轨迹分析与因果提取)框架,该框架构建高信噪比的优化上下文,以实现更精准有效的优化。在批次层面,STRACE挖掘故障模式以过滤冗余轨迹并保留代表性故障;在每条选定轨迹内,它通过文本依赖图进行因果定位,移除非因果步骤并识别出需要优化的真正根因模块。实验结果表明,STRACE显著优于标准上下文过滤基线。值得注意的是,在具有挑战性的形式化验证任务(VeruSAGE-Bench)上,它成功优化了人类专家设计的智能体,将成功率从42.5%提升至58.5%(提升1.4倍)。代码已开源:https://github.com/moomight/STRACE。 | |
| 打破数据库锁定:面向数据库绕行的高性能存储读取器的智能再生 | Victor Giannakouris | 2026-07-08 | 在外部数据库系统中运行的分析型工作负载面临一个根本瓶颈:数据访问完全受限于数据库驱动程序(如JDBC或ODBC),所有读取操作都必须通过查询执行及其他驱动层,而这些层并非为批量列式分析而设计。我们提出Jailbreak方法,通过直接读取存储文件并物化为内存列式缓冲区,完全绕过数据库引擎。Jailbreak的核心洞察在于:数据库文件格式虽然复杂,但其源代码和文档已完整定义了规范,大型语言模型(LLM)可吸收这些人工制品,无需人工解析逻辑即可重新生成特定于操作符的表读取组件。Jailbreak利用LLM辅助的代码合成进行数据库存储解码,将传统上不透明的格式转化为可直接查询的制品。我们在PostgreSQL和MySQL存储文件上评估Jailbreak,针对只读副本和离线处理管道中常见的分析快照场景。生成的读取器可直接产生Apache Arrow缓冲区,被大多数广泛使用的查询引擎(包括DuckDB、Apache Spark以及GPU加速框架如cuDF和Spark RAPIDS)消费。我们使用TPC-H基准测试,在所有查询结果上验证了与基于JDBC/ODBC基线的正确性,并展示了端到端分析吞吐量的显著性能提升,最高实现27倍加速。结果表明,LLM辅助的存储读取器合成是一种可行且可泛化的方法论,可打破跨数据库系统的数据锁定,其应用范围超越PostgreSQL和MySQL,适用于任何文件格式可通过文档或源代码提供给LLM的系统。 | |
| 机构红队测试:部署规则而非仅模型本身,因果性地塑造多智能体AI安全。 | Yujiao Chen | 2026-07-08 | 我们提出机构红队测试,一种用于测试多智能体AI中部署规则的评价方法论:固定智能体、目标和任务状态,仅改变一条规则,并将由此产生的集体行为变化归因于该规则。我们将该方法论实例化为IABench-CA,一个涵盖228个情境、五条经典规则和七个模型群体(33,924场博弈)的后果分配基准,并配有规范性合作参考和自动标注的推理轨迹。三项发现浮现:(1)部署规则因果性地改变集体安全:仅改变后果规则,每个群体内的平均致死率变动22至58个百分点。(2)不存在安全默认设置,但针对危害具有普遍性:最安全规则、最不安全规则甚至发病率效应的方向在不同群体间各异,然而回归性身份针对在任何情境下对任何群体都从未成为决定性最安全选项,在30-87%的博弈中消除资源最少的智能体,且对所有七个群体而言,相对于合作参考在选择性上不安全。(3)身份显著性为机制:对最易受剥削群体(gpt-5.1)进行的一次性匿名化消融实验表明,仅在规则文本中命名损失承担者,就在相同收益下将针对性消除率从22%提升至81%;在重复博弈下,匿名化仅延迟针对行为,因为智能体从观察到的消除中重新推断隐藏规则。我们将该方法论打包为安全案例工作流,为每个部署情境和群体认证一个临时规则区域Φ(c,P),并附带明确的残余风险和监控义务。 | |
| 选择性时间步加权与基于优势的回放在样本高效扩散RLHF中的应用 | Eric Zhu | 2026-07-08 | 基于人类反馈的强化学习已成为将生成模型与人类偏好对齐的强大范式。然而,将RLHF应用于扩散模型仍存在严重的反馈效率问题,现有方法通常需要大量人类或奖励模型评估。这一局限性降低了扩散RLHF在反馈成为主要瓶颈的真实场景中的实用性。本文提出两种互补策略,在保持对未见提示泛化能力的同时,显著提升扩散RLHF的反馈效率。我们的关键发现是扩散轨迹中的奖励信息分布不均:并非所有去噪时间步或轨迹对从奖励信号中学习的贡献相同。通过在优化过程中强调信息量大的时间步和轨迹,我们获得了更有效的梯度更新。首先,我们引入逐时间步加权方案,在策略优化期间重新加权去噪步骤。我们从理论上将该加权与近端策略优化的最优收敛特性相关联,并通过实验近似所得加权趋势。其次,我们引入优先处理信息量丰富轨迹的回放机制,使模型能够复用过往样本而无需重复查询新奖励。这些策略共同显著提升了扩散RLHF的反馈效率。在相同超参数设置下,与广泛使用的扩散RLHF基线相比,我们的方法实现了高达6倍的样本效率提升。 | |
| Agon:基于隐式对手推理评级的竞争性跨模型强化学习 | Vladislav Beliaev | 2026-07-08 | 基于可验证奖励的强化学习(如GRPO)是当今推理模型的引擎,但它仅对最终答案进行评分。在困难问题上,这训练模型写更多内容而非更好思考,因为推理过程本身从未被评分,且不存在良好思考的标签。我们提出Agon,让两个竞争模型互为评分者。两者尝试同一问题;在交替角色中,一个起草解决方案,另一个在解题时阅读该方案,每个模型因比对方解题更优而获得奖励。为了获胜,模型必须比看到其工作的对手推理更出色,因此在训练过程中隐式地评判推理,无需过程标签和奖励模型。由于两个模型都被优化,每个模型面对逐渐增强的对手,这是单模型强化学习无法提供的。两者只需实力相当且行为不同。推理时,模型按训练方式部署,即两阶段级联:一个模型起草,另一个在阅读草稿后作答。在DeepMath的困难子集上结合Qwen3,该方法使GRPO的pass@1翻倍,大约是未经训练的混合专家模型在相同基线上增益的八倍。该结果在竞赛编程代码和不同模型家族(Qwen3.5、Gemma 4)中均得到复现。目前模型以文本交流;下一步是让它们在潜在空间中共同推理。 | |
| 代理交付工程预测可靠性框架 | Dexing Liu | 2026-07-08 | 长周期大语言模型多智能体系统面临基础设施监控无法察觉的可靠性风险。我们提出ADE预测性可靠性框架(ADE-PRF),实现从被动退化检测到主动健康轨迹预测。ADE-PRF将跨五层的20个异构信号聚合为信任裕度指标(TM,动态范围39.2点)。三重并行预测方法支持8小时预测:指数方法达到MAE=1.228,方向准确率76.8%,99.65%的预测落在±10点容差内。生产验证涵盖15个连续天内六种智能体配置的380,227次预测与280,579次验证,以及七项沙盒控制实验。关键发现包括检测到"虚假繁荣"——正常表面指标掩盖的退化——以及ADE插件集成后TM与真实状态的即时耦合,其中16/20个因子依赖ADE采集数据。指数方法持续优于卡尔曼方法。ADE-PRF为生产环境LLM智能体提供了最早期的可靠性量化与前瞻性预警之一。 | |
| 使用MPI和改进的几何多重网格求解器扩展WaterLily.jl | Bernat Font | 2026-07-08 | 我们介绍了WaterLily.jl近期面向性能的进展,这是一个用纯Julia编写的可解析尺度的不可压缩流求解器,能在任意厂商的CPU和GPU上无缝运行。在新加入的基于MPI并行机制支持下,强可扩展性测试呈现出接近理想的线性趋势,弱可扩展效率在节点内存并发竞争主导并行性能前保持在85%以上。当网格规模达到10亿单元时,节点间弱可扩展性仍维持在96%以上。我们还进一步评估了通过自适应欠松弛红黑高斯-赛德尔平滑器结合各向异性粗化算子实现的几何多重网格泊松求解器的改进效果。 |
bioRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 三种猪繁殖与呼吸综合征病毒群体监测方法的比较 | Neujahr, A. C. | 2026-07-09 | 猪繁殖与呼吸综合征病毒(PRRSV)对生猪养殖业构成显著的健康和经济负担,凸显了疾病监测与防控策略的重要性。为此,本研究旨在评估一种名为DARO系统的新型环境监测方法,并将其与成熟的血清和口腔液监测方法进行对比,以检测PRRSV。研究设计包含一头PRRSV感染源猪和46头未感染保育猪,每种监测方法均用于评估PRRSV检出时间。结果显示,DARO系统监测方法比血清和口腔液监测方法提前1-2天检出PRRSV。 | |
| 超越Delta质量:MS Andrea直接解析开放搜索中的组合肽修饰 | Buur, L. M. | 2026-07-09 | 开放修饰搜索(OMS)策略在基于质谱的蛋白质组学中日益流行,用于鉴定携带未知或意外翻译后修饰的肽段。然而,大多数OMS搜索引擎仅报告前体离子与匹配肽段之间的整体质量差异,未在肽段-谱图匹配(PSM)层面明确识别或评分多种修饰的组合,将质量偏移的解释工作留给最终用户及下游分析工具。本文介绍MS Andrea——一种新型OMS搜索引擎,无需预定义即可直接识别并评分每个肽段上最多四种可变修饰的组合。MS Andrea采用基于序列标签的策略,在评分前高效过滤候选肽段。剩余候选肽段通过MS Amanda评分函数评估:首先仅考虑固定修饰,随后在第二阶段评分中,基于观测到的质量差异从Unimod数据库中筛选修饰组合,并与谱图进行匹配。我们使用人类组蛋白数据集以及来自HeLa细胞和拟南芥的两个磷酸化肽段数据集对MS Andrea进行评测,并将其性能与广泛使用的OMS引擎MSFragger和Sage进行比较。在标准目标-诱饵方法下,MS Andrea在1%假发现率水平上鉴定出最多PSM数量;采用基于模型的假发现率估计时,其PSM鉴定数量更高或相当。重要的是,MS Andrea可直接在PSM层面报告修饰身份与位点,并支持鉴定含最多四种可变修饰的肽段。这些结果表明,MS Andrea在维持OMS蛋白质组学分析中竞争性鉴定性能的同时,能够实现更详细且可解释的肽段修饰表征。 | |
| 精准靶向肌钙蛋白I磷酸化可预防舒张功能障碍并保持收缩功能 | Chao, Y.-C. | 2026-07-09 | 背景 心脏舒张功能缺陷(舒张功能障碍)在心力衰竭中普遍存在,尤其在糖尿病、肥胖、高血压和衰老背景下,并与死亡率增加相关。然而目前尚无直接针对这种异常舒张的治疗方法。cAMP依赖性蛋白激酶A(PKA)对肌钙蛋白I的磷酸化可促进舒张,但全局性PKA激活会产生广泛的不良效应。本研究探讨了选择性增强肌钙蛋白I磷酸化能否在不激活整体PKA信号网络的情况下改善舒张功能。 方法 为解析亚细胞尺度的cAMP信号,我们结合实时cAMP测量与靶向特定纳米域的FRET基因编码报告系统,并联合生化和遗传学方法。通过肽阵列技术绘制蛋白质相互作用界面,据此设计干扰肽以阻断特定相互作用。利用啮齿类和人类心肌细胞,通过生化检测、实时成像和功环分析评估该肽对心肌细胞功能的影响。通过超声心动图和血流动力学测量评估体内效应。 结果 我们发现一种此前未被识别的调控机制:cAMP水解酶PDE4D9与肌钙蛋白I相互作用,在纳米尺度域内限制局部cAMP水平,从而选择性调控肌钙蛋白I磷酸化。在啮齿类和人类心脏疾病中,PDE4D9-肌钙蛋白I结合显著增强。在心力衰竭小鼠模型中,将PDE4D9从肌钙蛋白I上置换的肽能选择性增强肌钙蛋白I磷酸化,加速心肌细胞舒张,并预防舒张功能障碍,同时不损害收缩功能。 结论 这些发现揭示了一个高度特异的调控纳米域控制肌钙蛋白I磷酸化,并提出了一种首创的、基于机制的 therapeutic 策略,有望解决心力衰竭中一个未被满足的主要病因。 临床视角 新发现是什么? - 我们识别出一种此前未知的纳米尺度调控机制:PDE4D9结合肌钙蛋白I,局部抑制cAMP,限制肌钙蛋白I磷酸化并减弱舒张。 - 我们证明该机制在疾病中发生适应不良:在啮齿类和人类衰竭心脏中,PDE4D9-肌钙蛋白I相互作用显著上调,这可在机制上解释心脏舒张功能受损。 - 我们显示该相互作用具有药物靶向性:合理设计的肽能选择性置换PDE4D9,恢复局部cAMP-PKA信号,并在不扰乱全局cAMP的情况下正常化心肌舒张。 - 从肌钙蛋白I上置换PDE4D9可改善舒张,且不影响钙瞬变幅度,也不对收缩输出和心脏储备产生不良影响。 临床意义是什么? - 舒张功能障碍作为心力衰竭的主要病因且缺乏靶向治疗,可能适用于通过亚细胞精度而非全局通路调节来调控cAMP信号的疗法。 - 选择性破坏PDE4D9-肌钙蛋白I结合提供了一种基于机制的方法,有望恢复舒张功能,同时最小化GPCR导向疗法的典型脱靶效应。 - 通过增强舒张同时保留收缩功能和心脏储备,该方法可能克服目前评估中的肌丝靶向疗法(具有负性肌力作用)对舒张功能障碍的局限性。 - 更广泛而言,本研究建立了靶向局部信号域的平台,这一概念可能超越心血管疾病,延伸至cAMP失调导致功能障碍的其他病理状态。 | |
| miR-425-5p通过调控视网膜母细胞瘤蛋白磷酸化调节细胞衰老 | Matai, L. | 2026-07-09 | MicroRNAs (miRNAs) 是一类在调控细胞衰老和机体老化中发挥关键作用的小型非编码RNA。我们近期研究发现,一个保守的秀丽隐杆线虫miRNA簇(miR-229/64/65/66)对正常成虫寿命至关重要,其过表达可显著延长寿命。值得注意的是,cel-miR-229在人类中具有进化保守性,hsa-miR-425与其共享完全相同的种子序列。本研究探讨了miR-425在哺乳动物细胞衰老中的作用。我们发现,在药物诱导衰老的人肺癌细胞中,miR-425表达显著降低。恢复miR-425表达可减弱衰老表型,并抑制衰老诱导后衰老相关分泌表型(SASP)细胞因子的表达。进一步观察发现,复制性衰老过程中miR-425水平下降,而在WI-38成纤维细胞中稳定过表达miR-425可延缓衰老积累并维持增殖能力。机制上,miR-425抑制TGF-β信号通路,导致细胞周期蛋白依赖性激酶抑制剂p21/CDKN1A表达降低,视网膜母细胞瘤蛋白(RB)磷酸化水平升高,从而促进细胞周期进程。我们进一步鉴定出蛋白磷酸酶2A(PP2A)催化亚基PPP2CB为miR-425的直接靶标。即使在衰老诱导条件下,miR-425-5p过表达细胞中PPP2CB表达仍被下调。使用siRNA敲低PPP2CB可模拟miR-425过表达的表型效应:减少衰老、增强增殖潜能并增加RB磷酸化。综上,我们的研究揭示miR-425是通过上调RB磷酸化发挥作用的保守性细胞衰老调控因子。这些结果确立了控制增殖与衰老的新型miR-425-PPP2CB-RB调控轴,提示miR-425可作为延缓衰老、促进健康寿命延长的潜在治疗靶点。 | |
| 高精度荧光引导冷冻聚焦离子束切割 | Perez, D. | 2026-07-09 | 冷冻电子断层扫描(cryo-ET)是直接在细胞内可视化大分子结构的强大技术,但其广泛应用受限于样品制备过程中难以可靠靶向特定结构。特别是,在冷冻聚焦离子束(cryo-FIB)减薄薄片中捕获微小或稀有目标仍是主要瓶颈。本文提出两种荧光引导的cryo-FIB减薄工作流程,克服了靶向误差的关键来源,实现了跨空间尺度的常规结构捕获。针对较大目标(>500 nm),我们提出改进的配准策略,结合FIB减薄标记与折射率失配深度校正。针对较小目标(150-500 nm),我们在商用cryo-FIB-SEM平台上实现实时荧光引导减薄,可稳定回收中心粒、初级纤毛等低拷贝小细胞器。两种工作流程均集成于开源软件包fibsemOS,共同拓展了cryo-ET可解析的细胞结构范围,为靶向原位结构生物学建立了可广泛部署的框架。 | |
| 免疫原性肿瘤团块休眠作为免疫治疗黑色素瘤中持续性残留病灶的驱动因素 | Shi, Y. | 2026-07-09 | 肿瘤休眠被认为是癌症复发的原因,但患者体内休眠的设定条件和机制尚不明确。在临床前模型中,已观察到免疫原性肿瘤团块休眠(涉及持续肿瘤细胞增殖与免疫介导的细胞死亡平衡)以及细胞水平静止两种状态。本研究证实,接受免疫检查点抑制剂治疗的黑色素瘤患者长期稳定的残留病灶中,存在团块休眠而非细胞静止。对一处大型稳定病灶进行精细空间分析显示,其增殖肿瘤细胞比例与ICI治疗后进展患者中部位匹配的肿瘤相似。其他患者的残留稳定病灶(临床病理评估仅含瘢痕组织)中,也发现被活跃免疫细胞包围的增殖肿瘤细胞巢。这些发现表明,持续存在的稳定病灶中存在存活肿瘤细胞及团块休眠,这对疾病监测与管理具有重要启示。 | |
| 子宫平滑肌肉瘤的多维单细胞转录组分析揭示了具有推断治疗脆弱性的不同肿瘤状态 | Korah, M. | 2026-07-09 | 子宫平滑肌肉瘤(ULMS)是一种罕见疾病,常复发和转移,由于缺乏有效治疗靶点,患者需接受多线化疗。为填补这一空白,我们利用单细胞RNA测序和空间转录组分析对ULMS进行了全面解析。我们发现了多种肿瘤细胞状态,包括具有间充质样特征的肿瘤细胞、由MYC程序定义的缺血性肿瘤细胞、具有活跃干扰素信号的炎症性肿瘤细胞,以及干细胞样激素受体阳性细胞。这些肿瘤细胞状态的推断空间关联显示出独特的定位模式。通过将这些特征与批量RNA测序数据相关联,我们证明了这些发现与临床结局的相关性。最后,利用单细胞整合与药物反应预测算法(scIDUC),我们提出了可能靶向特定肿瘤状态的药物预测。我们的发现为探索治疗ULMS的个体化、多层面治疗策略提供了新方向。 | |
| 液泡膜细胞分裂素核苷转运体在根-微生物界面调控细胞内激素可用性 | Hudecek, M. | 2026-07-09 | 细胞分裂素核苷是细胞分裂素的主要移动形式和前体形式,这种植物激素的运输和亚细胞分布调控着发育过程与胁迫响应。本研究鉴定出拟南芥平衡型核苷转运蛋白1(ENT1)是一种定位于液泡膜的细胞分裂素核苷转运蛋白。在原生调控元件驱动下进行的组织特异性亚细胞定位分析显示,ENT1主要分布于根表皮细胞和侧根冠细胞的液泡膜,在此处调控细胞内细胞分裂素核苷的可利用性。相应地,ENT1过表达增强了细胞分裂素核苷的敏感性和信号传导,而ENT1功能缺失则改变了腺苷代谢并破坏了细胞分裂素稳态,导致多种玉米素型细胞分裂素积累。ENT1依赖的细胞分裂素核苷区室化作用对有益微生物诱导的植物保护至关重要,因为ent1突变体无法获得对灰葡萄孢菌和丁香假单胞菌番茄致病变种DC3000的抗性。这些发现揭示了控制细胞内细胞分裂素核苷可利用性的液泡门控机制,并将激素区室化与有益微生物依赖的植物防御联系起来。 | |
| LUstiGE,光响应性玉米黑粉菌基因表达:玉米真菌病原体Ustilago maydis形态发生与致病性的光遗传学控制 | Tang, K. | 2026-07-09 | 担子菌玉米黑粉菌是研究病原体与宿主相互作用的经典模式生物,并在广泛的生物技术应用中具有重要价值。本研究旨在开发光诱导分子工具,以实现对信号网络、真菌-宿主通讯的动态研究,并应用于代谢工程策略。具体而言,光控光遗传学开关具备定量调控、时空可控、微创及可逆等特性。我们构建了两种基于蓝光诱导LOV结构域的基因表达开关,分别实现基因表达的上调(蓝光-开启)与下调(蓝光-关闭),并在玉米黑粉菌的孢子菌丝和菌丝中进行了功能表征。利用其动态调控范围与快速响应动力学特性,我们通过调控极性因子Rac1及其组成型活性突变体Q61L的表达水平,成功诱导单倍体孢子形态向丝状体的转变,实现了对细胞形态的光控调节。除展示效应因子表达水平可精确调控以解析真菌-植物互作机制外,我们通过两项原理验证实验,实现了对玉米黑粉菌丝状真菌侵入植物组织及肿瘤形成机制的目标性调控。为此,我们将两种玉米黑粉菌效应因子See1(幼苗高效效应因子1)和TIN2(肿瘤诱导因子2)置于蓝光-开启与蓝光-关闭控制下,并在玉米叶片上检测肿瘤形成。综上,本研究确立了蓝光开关作为控制玉米黑粉菌形态发生与致病机制的有效工具。 | |
| 参与细菌DNA分配的ParBF生物凝聚体的快速组装与体内融合 | Revoil, P. | 2026-07-09 | 细菌中DNA的忠实分离依赖于ParABS系统,其中ParB在着丝粒样parS位点组装成凝聚体,而ATP酶ParA则对这些复合物进行空间组织。这些ParB凝聚体如何在不坍缩为单一结构的情况下维持动态行为仍不清楚。本研究结合染色体降解与定量成像技术,解析了体内调控ParB凝聚体动力学的动力学机制与物理原理。在缺乏拟核的情况下,来自质粒F的ParB凝聚体可自由扩散,并在相遇后数秒内融合。值得注意的是,定量分析表明凝聚体可能处于融合-分离临界状态,使得复制后仅需最小能量即可将其分裂,从而防止不可逆融合。通过突变体实验,我们证实凝聚体组装是融合的必要条件,并揭示了ParAF的双重作用:拟核锚定限制了凝聚体迁移性并抑制融合,同时ParAF通过增强ParB-ParB相互作用,促进了具备组装与融合能力的ParBF状态形成。此外,经1,6-己二醇处理后凝聚体快速解聚与重组,凸显其可逆性及ParB-DNA相互作用的稳定化贡献。综上,我们的研究确立了ParBF复合物作为经ParAF调控以确保DNA稳健分离的真正生物凝聚体。更广泛而言,这些发现揭示了调控性相分离作为细菌复制子关键组织原则的作用。 |
medRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 在77,000名神经发育障碍参与者中,具象绘画能力映射出与非具象能力不同的认知机制 | Murphy, E. M. | 2026-07-09 | 非具象图案(平行线、手印模板)构成了已知最早的人类艺术,可追溯至约40万年前。相比之下,具象艺术——描绘可识别的动物和人类——在约4.5万年前突然出现。我们假设这种时间上的分离反映了语言与视觉操作背后不同神经认知机制的序列演化。基于我们先前建立的分类框架(该框架识别出不同的表达性和接受性语言机制),我们考察了神经发育障碍个体中这些机制与绘画能力的共现关系。结果揭示了特定的分离现象:具象绘画与句法机制(负责句法理解)同步出现。相反,非具象艺术则与修饰机制(介导名词与形容词的整合)相关。这些分离表明,具象描绘所需的认知架构与支撑句法机制的前额叶-顶叶-颞叶系统紧密相连。而更早出现的非具象艺术传统似乎主要依赖于修饰机制更基础的整合能力。因此我们提出:中更新世非具象艺术的出现很可能与修饰机制的演化涌现同步,而具象艺术的出现则反映了句法机制及其相关句法关系性句子结构理解能力的后期获得。 | |
| 结构信息认知表征在预测精神分裂症患者现实功能中的应用 | Chen, C. | 2026-07-09 | 预测精神分裂症(SCZ)患者的现实功能仍是临床优先事项,但现有模型受限于方法学约束及缺乏临床实用性验证。认知功能是常用预测指标,其表征方式可能影响预测效能。规范潜在认知结构(N-LCS)方法提供了一种结构化的表征方式,可弥补传统领域层级评分的局限性。本研究利用COBRE队列数据(163例SCZ患者,180例健康对照),在完全嵌套的乐观校正自助法框架内,采用N-LCS偏差指标结合先验人口学及临床预测因子,开发并内部验证了针对经济功能(EF)、职业功能(OF)及社会功能(SF)的岭回归模型。同时构建基于MCCB领域T评分的评分模型作为对照。通过乐观校正AUC、平衡准确率及校准度评估二分类结局,采用C指数和加权Kappa评估SF。决策曲线分析(DCA)评估二分类结局的临床效用。EF模型表现最优(校正AUC=0.73;平衡准确率=0.71),而OF和SF表现中等(AUC=0.63,平衡准确率=0.59;加权Kappa=0.27)。DCA显示EF模型在完整阈值范围内具有净获益。与评分模型相比,N-LCS模型在减少预测因子数量的同时达到可比预测性能,且校准度更优,支持更简约的功能结局预测方法。 | |
| 体内空间转录组学用于无出血分析人体内部器官 | Sun, H. | 2026-07-09 | 尽管空间转录组学在技术上取得了显著进步,但其临床应用仍远未充分开发。在此,我们开发了一套集成系统ENDO-Genome,用于微创体内转录本采样,以促进人体内部器官的实时空间转录组分析。该系统通过将纳米阵列生物芯片与现有内窥镜整合,实现压力传感器校准的"触碰即取"RNA提取,可直接从人体内部器官(包括高度血管化的肝脏或肾脏)中获取样本,无需组织活检,完全避免出血风险。通过胃肠内窥镜的示范应用,在常规检查中仅需5分钟操作即可从人体肠道多个位置获取55种mRNA转录本的多重图谱。得益于免测序方法,每次检测成本低于10美元。在涉及15名克罗恩病(CD)患者的临床研究中,47次ENDO-Genome操作未报告任何并发症案例,展示了该技术的温和沉积特性和卓越安全性。实时空间转录组学提供了CD病理反应在不同肠道位置的异质性空间转录程序的直接体内图像,揭示了独特的回肠表型。这表现为炎症基因簇独特的微尺度散射,以及在单细胞或多细胞尺度上发现的炎症与RNA甲基化调控之间的组织特异性协同机制。 | |
| 使用开放大型语言模型从芬兰电子健康记录中提取临床发现的不确定性感知方法 | Leinonen, J. V. | 2026-07-09 | 目的。评估开放权重大型语言模型(LLMs)能否从芬兰语儿科病历中准确提取临床发现,以及是否可以利用预测不确定性对病例进行专家复核分流,以最大限度减少人工工作量。材料与方法。回顾性队列研究,纳入赫尔辛基大学医院(2010-2023年)97例儿科缺血性卒中患者(1个月-17岁)。使用三种开放LLM(gpt-oss-20b、DeepSeek-R1-Distill-Qwen-32B和medgemma-27b-text-it),以英文提示词从每位患者的完整自由文本病历中检测四个提取目标(偏瘫、头痛、癫痫发作和作为阳性对照的卒中)。每个组合进行15次调用(五个温度参数×三次重复)。性能以临床医生参考为标准进行基准测试(准确率、召回率、精确率、F1值)。通过15次调用的香农熵量化模型内不确定性;模型间不一致性提供集成信号。根据不确定性对患者进行排序,用于模拟选择性复核工作流程。结果在独立的新生儿卒中队列(n=88)中进行外部验证。结果。Gpt-oss-20b在非对照提取目标上实现了最佳的召回率(0.91-1.00)和精确率(0.83-0.92)平衡,F1值为0.89-0.95。错误分类病例的熵值比正确分类病例高2.4-3.4倍。基于熵的分流通过复核<10%的患者即可实现完全错误覆盖:偏瘫(8.3%)、头痛(8.2%),癫痫发作(19.6%)。新生儿验证中,Apgar 1分钟和二元癫痫发作的F1值为0.95,四类卒中亚型分类的F1值为0.87。讨论。在非英语临床环境中,模型内熵和模型间不一致性提供了互补且校准的潜在错误信号。结论。开放LLM能从芬兰语儿科病历中提取临床发现,其准确性与已发表的英语基准相当,基于不确定性的分流可大幅减少所需的专家工作量。 | |
| 南非住院儿童中不同SARS-CoV-2变异株导致的新冠肺炎严重程度:一项回顾性队列研究 | Fiandrino, S. | 2026-07-09 | 由SARS-CoV-2关切变异株(VOCs)持续更替驱动的COVID-19流行病学演变,促使学界不断评估其对儿童疾病严重程度的影响。在中低收入国家(LMICs),由于营养不良、免疫接种不全、HIV暴露或感染、结核病以及医疗资源获取差异等因素,儿童罹患严重呼吸道疾病和肺炎相关死亡率更高。因此,来自LMICs的医院儿科研究对于理解COVID-19流行病学特征和严重程度如何随大流行波次变化至关重要。本研究纳入南非开普敦Tygerberg医院在原始株流行期、前奥密克戎(Beta和Delta)流行期及奥密克戎流行期收治的354名SARS-CoV-2感染住院儿童。我们分析了2020年3月至2022年6月期间收集的长期数据,采用统计学方法描述不同变异株流行期的临床特征,并通过多变量逻辑回归模型评估潜在风险因素与疾病严重程度的关联。儿童COVID-19严重程度在不同VOC流行期存在差异,其中前奥密克戎(Beta和Delta)流行期的疾病负担最重。多变量分析显示,低龄和流行变异株与疾病严重程度相关;CRP水平成为提示更严重疾病的标志物,而皮质类固醇治疗虽与疾病严重程度相关,但反映的是对重症病例的临床干预。这些发现有助于深入理解儿童COVID-19的流行病学特征和临床影响,并凸显在资源有限环境中开展因地制宜的监测和治疗策略的重要性。 | |
| 可解释机器学习用于预测帕金森病中的运动波动和左旋多巴诱导的异动症 | Endrizzi, W. | 2026-07-09 | 背景:运动并发症,如运动波动和左旋多巴诱导的异动症(LID),显著影响长期接受左旋多巴治疗的帕金森病(PD)患者的生活质量。预测其发生对制定个体化治疗方案至关重要。目的:开发并评估机器学习(ML)模型,以预测PD患者在基线评估后三年内新发运动波动和LID的风险,并分析训练队列构成对模型性能的影响。方法:采用重复嵌套网格搜索交叉验证的完整ML工作流程,对来自多中心队列的247例PD患者的真实临床数据进行分析。ML模型在基线无运动并发症的临床相关亚组中进行了严格评估,并通过SHAP分析提供模型可解释性。结果:模型对LID(SVC:MCC 0.28 ± 0.14)和运动波动(Voting MCC = 0.32 ± 0.18)均表现出中等预测能力。在LID预测中,最强预测因子为左旋多巴等效日剂量(LEDD)、基线运动波动及左旋多巴治疗持续时间,当LEDD超过300-400 mg阈值时风险显著增加。关键消融研究表明,排除已有并发症患者会导致模型敏感性骤降,凸显了这些患者在定义预测风险上限中的关键作用。结论:基于模型的风险评估与已知临床因素一致。训练集中纳入包含已有运动并发症患者的全疾病严重度谱系,对于实现稳健的概率风险标尺和可靠的新发预测模型校准至关重要。 | |
| 肯塔基州卡尔弗特市石化厂排放的多维环境与健康影响研究方案 | Huntington-Moskos, L. | 2026-07-09 | 尽管接触二氯乙烷和氯乙烯单体等挥发性有机化合物已被确认为肝病(尤其是肝血管肉瘤)的明确诱因,但表征工业中心周边社区的真实暴露特征仍具挑战性。肯塔基州卡尔弗特市(人口约2500人)提供了一个独特的研究场景,其特点在于同时存在活跃的工业排放与历史遗留的空气毒物源。为应对这些复杂性,本方法学论文描述了"社区外展与安全生物监测及环境评估(BEACON)"研究的框架。通过采用新型多维暴露评估策略,BEACON旨在表征空气毒物暴露特征,并为社区健康与安全提供可操作数据。在BEACON研究中,我们将利用肯塔基州空气质量部门对空气毒物的监测数据,分析小型社区志愿者队列的尿液样本,通过相邻社区污水检测社区尿液成分,对居民气味投诉进行地理编码,评估野生动物血液标志物,调查当地大、小动物兽医关于发病率和死亡率异常情况,并与区域卫生系统合作加强对该区域有毒物质相关健康问题的监测。此外,将在三个时间点采集血样并建立生物样本库以供未来分析。在可能的情况下,将努力将本研究与现有的大型长期队列研究进行关联。在整个项目过程中,社区参与将通过提升认知、促进合作、确保受影响居民的声音被倾听发挥关键作用。 | |
| 青少年鼻咽血管纤维瘤的单细胞图谱揭示VEGF驱动的血管生成重塑是治疗靶点 | Martini-Stoica, H. | 2026-07-09 | 背景:青少年鼻咽血管纤维瘤(JNA)是一种罕见的局部侵袭性血管性鼻窦肿瘤,主要影响青春期男性。尽管内镜手术和术前栓塞技术有所进步,但JNA仍存在重大手术出血风险和临床意义的复发问题,且非手术治疗选择有限。方法:为明确JNA血管形成的细胞程序,我们对JNA肿瘤(n=2)、肿瘤邻近黏膜及对照鼻窦组织进行了单细胞RNA测序。我们分析了细胞组成、差异基因表达、通路富集及细胞间通讯,并通过Drug2cell技术将转录状态映射至候选治疗靶点。结果:JNA含有由内皮细胞、成纤维细胞、周细胞、血管平滑肌细胞和神经嵴样细胞组成的扩增性纤维血管区室。神经嵴样细胞在JNA中富集,但与肿瘤邻近组织的转录差异相对有限。相比之下,内皮细胞表现出最强的疾病相关重塑,富集了血管生成、细胞外基质组织、缺氧反应和细胞迁移通路。内皮细胞还表现出适应性免疫信号通路的下调,提示肿瘤微环境中免疫参与减少。细胞间通讯分析揭示了JNA纤维血管网络中密集的内皮-基质信号传导。Drug2cell分析将VEGF/VEGFR信号通路列为候选治疗脆弱点,预测VEGFR靶向药物主要作用于血管和淋巴管内皮细胞群。结论:JNA围绕以内皮细胞为中心信号驱动的血管生成主导型纤维血管程序构建。这些数据支持进一步探索VEGF/VEGFR导向疗法作为复发性、不可切除或手术高风险JNA患者的潜在辅助治疗策略。 | |
| 一个包含14名健康个体的韩国泛基因组参考支持疾病基因组中的结构变异分析。 | Shin, D.-H. | 2026-07-09 | 在此,我们提出了首个基于图的韩国泛基因组参考(K-PanRef),该参考由14名健康韩国个体的基因组构建而成。K-PanRef包含13个高质量的二倍体韩国基因组组装(平均QV约62.0)以及KOREF1-G-TTAGGA——首个完整的韩国参考基因组。这些组装的整合生成了一个约3.2 Gb的泛基因组图,包含约3930万个节点和约5380万条边,其中常见序列(频率[≥]10%)的积累已达到平台期。此外,K-PanRef包含约430万个韩国特异性小变异和约7.6万个韩国特异性结构变异(SV),这些变异在中国和人类泛基因组参考中均不存在,从而相较于这些参考提高了对韩国遗传多样性的代表性。为评估其在基于短读长的SV分析中的实用性,我们对75个全基因组测序(WGS)样本进行了基因分型,其中包括15名早发性心肌梗死(MI)患者。尽管完全由健康基因组构建,K-PanRef在此探索性应用中仍支持了推定的疾病相关SV的识别。基于K-PanRef的基因分型鉴定出约9.56万个仅在早发性MI样本中观察到的小变异和820个SV。在早发性MI组的SV中,有491个在公共数据库中缺失,表明它们可能代表先前未被识别的与早发性MI相关的候选变异。其中,164个SV与134个基因重叠,这些基因中有89个已被报道与42种心血管疾病或性状相关,包括8个先前与MI相关的基因。综合这些结果,K-PanRef成为代表韩国遗传多样性的宝贵资源,并能够从短读长测序数据中更全面地发现人群特异性和新型推定的疾病相关变异。 | |
| 精神分裂症和双相情感障碍的疾病特异性及共享遗传结构 | Bhattacharyya, U. | 2026-07-09 | 精神分裂症(SCZ)与双相障碍(BIP)共享大量常见变异遗传风险,但在认知功能、医学共病及治疗反应方面存在差异。本研究将这种重叠分解为精神分裂症主导型、双相障碍主导型及共享精神病性维度,以检验这些成分是否具有不同的多效性与生物学特征。基于现有最大规模SCZ和BIP全基因组关联研究(GWAS),我们采用双向mtCOJO与基因组结构方程模型(Genomic SEM)推导出SCZcondBIP、BIPcondSCZ及PSY-shared三个成分,并通过成分间遗传相关性、FinnGen精神疾病终点指标及Genomic SEM潜变量进行验证。随后在认知、心脏代谢及免疫特征维度对各成分进行表征,继而开展基因组风险位点发现、通路分析、发育表达谱分析及药物靶点富集研究。三个成分呈现显著差异:SCZcondBIP与认知功能、教育程度、代谢综合征、C反应蛋白及中性粒细胞百分比呈负遗传相关,而BIPcondSCZ则呈现相反的认知特征,并向正性心脏代谢及免疫相关性偏移。PSY-shared保留了疾病层面观察到的混合认知模式及中间水平的外周相关性,提示共享精神病性遗传风险掩盖了更强的疾病特异性差异。成分间对比效应量约为对应SCZ与BIP直接对比的两倍。我们鉴定出248个共识基因组风险位点,其中81个未在输入疾病GWAS中检出。生物学层面,PSY-shared富集于突触信号、离子通道及神经发育通路;SCZcondBIP主要涉及突触信号与细胞稳态通路;BIPcondSCZ则呈现较弱但特异的突触囊泡生物学富集。药物靶点富集进一步区分各成分:PSY-shared显示强抗精神病药物富集,而条件因子呈现独特的非抗精神病药物信号。这些发现表明,SCZ与BIP遗传风险的最佳理解方式为生物学可区分的共享维度与疾病主导维度,它们差异性地映射至认知、心脏代谢、免疫及分子架构。本研究为评估成分特异性多基因评分能否改善严重精神疾病认知、心脏代谢及炎症异质性的分层提供了分析框架。 |