跳转至

2026-08-28 每日论文

来源 独立页面
arXiv arXiv
bioRxiv bioRxiv
medRxiv medRxiv

arXiv

标题 作者 发布日期 PDF链接 摘要
UrbanGround:从局部感知到真实尺度城市中的空间能动性 Tianjie Ju 2026-08-27 PDF 多模态大语言模型(MLLMs)能够解读街景,但城市行动能力取决于这些局部证据在智能体开始移动后是否仍然有用。本文探讨了当前MLLM智能体在复杂真实规模城市中,能将局部城市感知转化为可靠行动的程度。我们提出UrbanGround,这是首个沙盒环境,基于全港三维地理空间数据构建的物理约束香港复制品,使这一问题可测试。UrbanGround支持第一人称视角的闭环交互,并提供交互式地图用于导航。智能体可直接进入三维城市,从第一人称视角探索。我们的分析通过三个研究问题追踪空间问题的增长。首先,我们测试智能体在主动观察后,是否能充分理解局部场景以回答空间问题。然后,我们询问这种理解是否支持导航,当目的地变得更远且更不明确时。最后,我们检查所得行为是否在路线可用性和行人运动变化下保持稳定。当代MLLM智能体通常在视觉识别和短距离空间推理方面表现出有用的原子能力,而方向感和行人感知运动仍不可靠。它们的核心失败出现在扩展探索中,局部能力无法组合成持续的目标导向行为,且错误累积而缺乏有效纠正。我们希望UrbanGround能支持更广泛的研究,探讨当前MLLM智能体在复杂、开放城市环境中可靠探索的程度。
CritICL:从大型语言模型失败模式中实现推理时的弱到强泛化 Yufan Wu 2026-08-27 PDF 推理时扩展的最新进展显著提升了大语言模型(LLMs)的推理性能。然而,这些方法通常依赖于重复生成或外部验证。为解决这一局限,我们引入了CritICL,一种新颖的推理时框架,它在保持高效率的同时提升了推理能力。我们的关键洞察在于,同一模型家族内,LLM的失败模式在不同规模间表现出结构化规律。我们不将失败视为不期望的输出,而是利用它们作为指导来源。具体而言,我们利用从较弱模型中得出的失败模式,并通过基于批评的上下文示例将其融入推理过程。我们提出了两种变体:CritICL-dynamic,它自适应地预测输入特定的失败模式并检索批评;以及CritICL-static,它使用全局失败模式概况提供稳定指导。实验结果表明,CritICL在标准上下文学习上持续表现更优,并且在与测试时扩展方法相比时,性能具有竞争力或更优,同时所需生成次数和令牌成本显著降低。代码可在:https://github.com/umwyf/CRITICL 获取。
WikiSkill:将智能体经验编译为持久知识以促进技能演化 Liyan Tang 2026-08-27 PDF Agent技能包将专业知识和流程封装为可复用资源,以扩展AI代理的能力。近期研究从代理经验中自动发现此类技能,使代理能够通过交互逐步适应。然而,指导技能发展的洞察通常分散在优化历史中,限制了其在迭代中的系统性复用。我们引入了WikiSkill框架,该框架将代理技能与持久知识库(wiki)共同演化。在高层次上,WikiSkill分离了原始执行经验、积累的知识和可执行技能,同时持续将经验整合到wiki中,后续技能更新可在此基础上构建。在多种基准和模型中,WikiSkill始终优于最先进的技能演化方法,并在大多数模型-基准设置中优于无技能基线。我们发现技能演化与模型扩展互补:较大的模型通常从演化技能中获益更多,而具有技能的较小模型可以超越没有技能的显著更大的模型。我们还发现演化技能在模型和模型家族间有效转移,且由其他模型演化的技能可以超越自我演化的技能。最后,我们的消融研究确认,wiki中的持久知识积累对有效技能演化至关重要。这些结果证明了系统积累和精炼代理经验对于开发可复用和可转移技能的优势。
SWE-Prime:更少的轨迹,更优的性能 Dewu Zheng 2026-08-27 PDF 为提升大型语言模型解决真实世界软件问题的能力,先前工作侧重于构建大规模智能体轨迹数据集,并对成功轨迹进行监督微调(SFT)。然而,任务成功并不保证监督质量高:成功轨迹可能仍包含无效、冗余或风险步骤。直接使用此类轨迹进行SFT会引入噪声监督,并促使模型模仿不良的问题解决行为。因此,我们提出SWE-Prime,一种多粒度、两阶段的SFT数据选择方法,逐步在轨迹和片段层面过滤训练数据。具体而言,第一阶段基于过程质量、结果质量和数据代表性进行轨迹级筛选,选择高质量且具代表性的成功轨迹子集。第二阶段通过将连续步骤分组为语义片段,并根据每个片段对最终解决方案的贡献、可学习性和潜在风险进行评估,进行片段级选择。在SFT期间,所有片段保留在序列中以维持上下文,而仅选定的片段参与损失计算。在SWE-Bench Pro和SWE-Bench Verified上的实验表明,使用SWE-Prime选择的10%轨迹子集进行训练,优于在完整已解决数据集上的训练,分别带来高达12.2%和24.2%的相对性能提升。
TTPO:测试时策略优化 Aozhe Wang 2026-08-27 PDF 近期主流的后训练方法,如强化学习(RL)和同策略自蒸馏(OPSD),推动了大语言模型在数学推理方面的快速进展,但它们对真实标签的依赖阻碍了测试时训练(TTT)。用多数投票伪标签替代真实标签是一种自然的替代方案,但这种方法较为脆弱:一个错误的投票会污染教师模型,并误导每一个词元。我们观察到这种失败模式具有不对称性:与伪标签不一致的生成结果,无论投票本身是否正确,通常都是错误的。基于这一观察,我们提出了测试时策略优化(TTPO),这是一种不对称目标,通过OPSD蒸馏一致的生成结果,并通过分组RL惩罚不一致的生成结果。词元级选择进一步优化了这两个分支:蒸馏降低已收敛位置的权重,而RL仅惩罚高置信度的错误。即使在伪标签频繁出错的情况下,这两种更新仍能保持良好基础,并且随着模型改进,多数投票路由能提供更紧密的自我监督。在无任何标签的情况下,TTPO在五个竞赛级基准上匹配了标签监督的OPSD,将Qwen3-1.7B在TTT中的准确率从38.0%提升至45.2%,在无思考模式下带来+25.2%至+36.4%的提升,并展现出强大的跨任务泛化能力。
从静态到动态:使用MCR-Bench对真实世界代码审查进行基准测试 Dewu Zheng 2026-08-27 PDF 在真实世界的软件开发中,代码审查通常涉及开发者和审查者之间的迭代交互以提升软件质量,这使得该过程成本高昂且耗时。尽管近期研究探索了利用大型语言模型(LLMs)进行自动化代码审查,但大多数方法将代码审查过度简化为单轮、静态的决策任务,未能捕捉真实审查场景中固有的多轮交互性质及复杂问题解决过程。为弥补这一差距,我们引入了MCR-Bench,这是首个面向真实多轮代码审查的缺陷状态感知基准。MCR-Bench涵盖五种常用编程语言,包含2,269个真实多轮代码审查任务,每个任务均标注了细粒度的缺陷信息和跨轮状态标签。MCR-Bench中的每个任务配备了细粒度缺陷元数据(如描述、类型、严重程度)以及动态状态注释,捕捉缺陷在多轮过程中的完整演化轨迹。通过在MCR-Bench上对主流LLMs进行广泛实验,我们获得了若干发现。(1)整体能力有限:实验表明,主流LLMs在缺陷检测和缺陷生命周期状态跟踪方面的整体性能有限,且随着交互轮数增加,性能显著下降;(2)缺陷敏感性表现:LLMs的性能在不同缺陷类型和严重程度间差异显著,语义复杂或低显著性缺陷更易被遗漏;(3)潜在失败机制:我们的深入错误分析剖析了误报和漏报的不同驱动因素,揭示了跨轮时间错位和长程记忆不足等关键弱点。
RedEvoAgent:具有经验驱动技能进化的自动红队智能体 Junjie Zhang 2026-08-27 PDF 基于LLM的智能体越来越多地被部署在产品级执行框架中,在此类环境下,越狱攻击可能触发有害的工具使用和持久状态变化,从而比单纯生成不安全文本带来更大的风险。现有的自动红队方法通常依赖固定攻击,而近期的智能体攻击者则协调多种越狱工具,并通过基于轨迹的检索展现出更强的潜力。然而,这种检索可能因检索偏差和工具归因不清而重用误导性经验,且完整轨迹会增加上下文开销并降低可解释性。我们提出RedEvoAgent,一种黑盒红队智能体,它将跨案例攻击轨迹提炼为简洁、可读的攻击技能。该攻击技能通过工具效能分析和用于技能更新的决策工具归因,以及仅保留能提升验证性能更新的验证棘轮机制,实现自适应演化。在多个基准、目标模型和目标执行框架上的实验表明,RedEvoAgent优于固定和智能体基线,提升了工具效率,并能跨攻击者模型和目标执行框架迁移。
基于图结构电子占据的离散流匹配实现机理反应预测 Nguyen Xuan-Vu 2026-08-27 PDF 化学反应本质上是电子空间中的变换,然而大多数机器学习方法要么通过从头生成产物分子,要么通过直接作用于分子拓扑的启发式图编辑来建模反应。我们引入了MAELLE(MechAnistic Edit fLow-matching on eLectron rEarrangements),该方法将反应建模为电子占据向量上的离散流匹配。具体而言,我们将反应物到产物的映射形式化为一个连续时间马尔可夫链(CTMC),该链定义在所有成键、非键和氢位点上的图结构整数值电子占据空间上。为了构建中间编辑轨迹,我们使用最优传输将离散流匹配混合路径推广到离散电子重排,从而生成一系列机制上可解释的编辑步骤,而无需基元步骤注释。在USPTO-480K基准测试中,MAELLE与领先的反应预测模型相比取得了具有竞争力的性能。除了分布内准确性外,我们还在两种分布外设置——结构复杂性和反应类型——中评估了鲁棒性,发现MAELLE在现有方法性能下降的情况下仍保持强劲表现。最后,由于学习到的流作用于完整的电子重新分布,MAELLE自然能够恢复与已知化学一致的机制轨迹,并能预测反应的副产物。
转导语言模型的随机估计 Vésteinn Snæbjarnarson 2026-08-27 PDF 转导语言模型(TLMs)将预训练的源语言模型与功能性有限状态转换器组合,以在目标字符串上诱导出语言模型。在TLM下计算目标前缀的概率,相当于对所有源字符串的源模型概率求和,这些源字符串被转换器映射到以该前缀开头的目标字符串。这个集合可能是指数级大或无限的。先前的工作使用基于源前缀概率的计算捷径,然后通过阈值剪枝的束求和来近似所得总和。这产生了一个误差未知的下界。相反,我们无放回地重新采样源前缀,并根据每个选中前缀的包含概率的倒数对其重新加权。我们表明,递归应用此校正可得到目标前缀概率的无偏估计器,并使我们能够估计由阈值剪枝丢失的质量。我们的束求和算法扩展了保留的源前缀,并采样哪些前缀要保留,随着更多概率质量被添加到运行估计中,减少了它们的数量。这可以节省计算,并保证运行以概率一停止。我们在百科全书文本和DNA上,与有放回重采样的顺序蒙特卡洛基线进行了评估。它在文本上实现了更好的计算-方差权衡,在DNA上在相同最大粒子数下实现了更低的误差。在DNA到氨基酸的转导中,相对于阈值剪枝的束求和,它将运行时间减少了几个数量级,并使长目标字符串的前缀概率估计变得可行。在已发表的阅读时间分析中,用无偏采样替换阈值剪枝,显著降低了估计的语料库意外度,但发表的结论保持不变。
Persona-执行分离:一种在执行审计下演化LLM智能体的架构模式 Yisen Xi 2026-08-27 PDF 大型语言模型(LLM)代理在受治理组织中必须让人格(指令、语气、自我呈现)自由演化,同时保持执行(有状态、经审计的工作)可追踪。单一信任域无法廉价地同时满足这两点。我们提出人格-执行分离(PES):人格和执行驻留在不同信任域中,通过受治理的契约桥连接。人格是单归属的,可以漂移;执行是无面孔的,且经审计。状态摘要可返回;数据主体保留在限制性域中,除分级数据丢失防护(DLP)例外;身份保持连续。审批矩阵、DLP和审计强制执行跨越。PES源于三个目标——自由漂移、执行可追踪性和解耦。在LLM表征不可区分性下,任何满足所有三点的单域机制必须重新引入类型化变更对象、外部门和稳定审计锚点:PES以更高耦合成本重建。在受监管数字员工平台中的开发/试点案例记录了一个月内的五个决策,每个都有被拒绝的替代方案。对已部署实现的机制检查发现,在人格扰动(五种模型配置)下没有执行侧重新验证,且硬断言字段上没有人格指纹。对恢复的分离前构建的探测发现,受治理执行路径通过遗漏而非构造与人格解耦;后续接线更改可能逆转该隔离,而PES将其变为经审计的架构规则。该模式适用于多用户部署、执行审计和预期人格变动同时成立的情况。

bioRxiv

标题 作者 发布日期 PDF链接 摘要
通过半胱氨酸配位实现致癌驱动因子的单原子抑制 Zhao, W. 2026-08-28 PDF 小分子抑制剂依赖于合适结合口袋内的分子识别,这使得许多疾病相关蛋白难以被靶向。在此,我们引入单原子抑制剂的概念,其中金(Au)与致癌驱动因子的关键半胱氨酸残基结合以抑制其活性。我们采用AI辅助的小样本学习方法识别用于体内Au递送的EGFR靶向肽,并证明先导候选物10714促进了EGFR表达细胞和肿瘤中Au的积累。在体内,Au利用其对半胱氨酸的内在亲和力抑制两种结构不同的致癌蛋白,分别结合EGFR T790M中的Cys797和KRAS G12C中突变衍生的Cys12,这些位点邻近各自的核苷酸结合口袋。结构和计算分析支持非活性核苷酸结合状态的稳定化,而这些半胱氨酸残基的突变则消除了Au介导的抑制。因此,10714-Au抑制了致癌信号传导,降低了非小细胞肺癌细胞活力,并在EGFR和KRAS突变异种移植模型及患者来源类器官中抑制了肿瘤生长。这些发现为跨结构不同致癌驱动因子的单原子抑制建立了原理验证,并表明局部原子配位可能提供一种替代传统口袋依赖性抑制的靶点结合模式。
纳米尺度下单个突触囊泡内组胺与GABA的核心-边缘区室化 Fujiwara, K. 2026-08-28 PDF 经典突触传递理论认为氨基酸类神经递质和单胺类储存在不同的囊泡群体中。在此,我们提供了双重递质组织的结构证据,表明组胺和GABA在单个突触囊泡内被空间分隔为核心和边缘区域。利用工程化的戊二醛-NaBH4免疫电镜平台,对2,195个囊泡的定量分析揭示了一种此前未被识别的纳米尺度结构,其中组胺相关信号集中在囊泡核心(95.1%),而GABA则分布于外周边缘。光学显微镜进一步显示,组胺和GABA在中枢及外周组织(包括交感神经节和肾上腺髓质)中具有广泛的对应关系。这种囊泡内分隔挑战了氨基酸和单胺储存于不同囊泡类别的传统观点,并揭示化学性质不同的递质可以在单个囊泡腔内占据有序区域。这一结构可能为GABA能和组胺能信号传导的不同生理模式提供结构基础,将纳米尺度囊泡组织与其在时间作用上的既定差异联系起来。
少突胶质细胞富集脑类器官揭示唐氏综合征中少突胶质细胞成熟受损及神经网络活动改变 Marti, M. B. 2026-08-28 PDF 唐氏综合征(DS)患者表现出发育迟缓、智力障碍、大脑过早老化以及阿尔茨海默样神经退行性变风险增加。尽管出生后和成年DS大脑的神经病理学已被广泛描述,但21三体如何改变早期人类神经和胶质发育仍不清楚。在此,我们使用源自三体和整倍体iPSC的富集少突胶质细胞脑类器官,来定义21三体在早期大脑发育过程中的细胞、功能和分子后果。三体类器官表现出早期生长延迟、少突胶质细胞规格减少以及少突胶质细胞成熟受损,导致髓鞘形成减少。这些缺陷伴随着星形胶质细胞输出增加和神经元成熟延迟。在功能层面,三体类器官显示出升高的自发网络活动,但未能对药理学刺激产生正常的协调反应,这与异常神经回路发育一致。批量RNA测序揭示最强的转录组失调发生在早期神经和胶质规格阶段。总之,这些发现表明21三体破坏了早期发育阶段,并确立了富集少突胶质细胞脑类器官作为研究DS中白质和网络功能障碍发育起源的人类模型。
食物网的功能稳健性:一个包含关键物种集合与集群影响的动态生物量框架 Qu, X. 2026-08-28 PDF 1. 物种丧失不仅可通过次级灭绝侵蚀食物网功能,还可通过生物量重新分配、能量路径弱化和阈值式功能崩溃实现。基于拓扑、连通性和灭绝的常见稳健性指标虽能有效概括结构解体和级联风险,但并非设计用于在单一动态框架内量化连续生物量保留、崩溃相关物种集合及非加性群体效应。2. 我们开发了一个基于动态生物量的框架,用于在渐进物种移除下评估食物网稳健性。该框架引入动态面积稳健性(DAR),量化总生态系统生物量保留的慢速与快速崩溃参考轨迹之间的加权面积。基于这些轨迹,我们操作性地定义最小关键物种集合(MVSS),即移除后首次将生物量驱动至预定义功能崩溃阈值以下的最短快速崩溃前缀物种集合。我们进一步提出簇影响(CI),比较同时移除一组物种的生物量效应与单独移除相同物种的平均效应。3. 我们使用120个涵盖物种丰富度和连通度受控梯度的生态位模型虚拟食物网评估该框架,并在16个经验性溪流食物网上展示其适用性。我们将DAR与基于AUC和次级灭绝的稳健性指标进行比较,并评估DAR、MVSS和CI对关键生物能量参数及参数不确定性的敏感性。4. DAR捕捉了仅与结构和灭绝指标部分一致的基于生物量的稳健性模式,表明动态功能退化提供互补信息。在虚拟食物网中,MVSS子集强烈富集基础物种或基础资源节点,且较小的MVSS比例与快速崩溃轨迹下更强的正CI相关。综合来看,DAR、MVSS和CI提供了一个可复现的框架,用于连接食物网结构、生物量动态、崩溃阈值和非加性物种集合效应,为理论和经验食物网的动态稳健性评估提供实用工具。
微塑料暴露改变了致倦库蚊免疫相关基因表达及幼虫微生物群落多样性 Tchatakoura, A. 2026-08-28 PDF 背景:微塑料已在许多淡水生态系统中被检测到,包括蚊子幼虫发育的静水环境。因此,幼虫暴露于微塑料污染中,这可能影响其生活史特征或微生物群以及免疫基因表达。然而,尽管蚊子作为多种病原体的媒介具有重大公共卫生重要性,这些效应从未在蚊子中测试过。方法:我们将蚊子幼虫从孵化到成虫羽化期间,暴露于四种浓度的聚乙烯微塑料(MPs):0、60、200和600 MPs/mL。每种处理收集四龄幼虫和新羽化的雌性成虫。为研究MPs对基因表达和细菌微生物群的影响,对每个发育阶段的三个生物学重复进行了RNA测序和16S宏条形码分析。结果:微塑料暴露诱导了非单调剂量依赖的转录组响应。在幼虫中,仅有限数量的基因差异表达(每个浓度五到八个),免疫相关基因在低和高浓度下均下调。在雌性成虫中,中间浓度(200 MPs/mL)引发了最强响应,有14个差异表达基因(DEGs)。关于微生物群,微塑料暴露降低了幼虫的细菌多样性,最高浓度下多样性最低。然而,在雌性成虫的微生物群中未检测到显著变化。结论:总体而言,本研究显示雌性成虫受到幼虫期MPs暴露的影响(即免疫相关基因的差异表达),并值得在该领域进行进一步研究。这包括:1)进一步调查MPs对蚊子种群的影响(例如通过多代研究),2)获得更多环境相关性的MPs效应知识(即使用带有生物膜和/或吸附污染物的MPs),以及3)关注MPs对蚊子媒介能力的影响。
雌性尼爾吉里鶲(Eumyias albicaudatus)在索拉天空島的鳴唱與繁殖物候學 Vyas, H. 2026-08-28 PDF 利用鸣唱强度评估繁殖物候,可为了解物种对气候或栖息地变化的响应提供潜在见解。尽管已知雄性雀形目鸟类在繁殖季节会鸣唱复杂歌曲,但几种热带雀形目鸟类的雌性也会鸣唱。尼ilgiri鹟(Eumyias albicaudatus)是印度西高止山脉南部特有的二态性鸣禽。尽管其分布有限,且作为云雾林指示物种具有生态重要性,但对其鸣声行为和繁殖生态学知之甚少。为检查性别特异的鸣声模式差异,我们分析了两对鸟的294个雄性焦点歌曲和102个雌性焦点歌曲。随后,我们利用放置在繁殖对附近的一台全年自动录音机的数据,通过BirdNET分析器研究该物种的鸣唱物候。两性大体上产生相似的歌曲,尽管雄性歌曲包含更多音符且节奏更快。由于两性歌曲高度相似,性别特异检测器失败,但我们能够自动化物种级检测(在置信阈值0.1下F1分数=0.795)。我们发现鸣声活动具有强烈季节性,繁殖季节鸣唱达到高峰,并识别出黎明时的昼夜高峰。需要更多数据来参数化两性间年度鸣声活动的差异。这些检测模式为景观范围内尼ilgiri鹟物候和分布的研究提供了框架。本研究提示,自动检测器可作为评估鸟类鸣唱物候的可靠工具,并为繁殖期提供见解。
利用光学相干断层扫描对群体蓝藻进行三维成像 Sinzato, Y. Z. 2026-08-28 PDF 蓝藻菌落的形态在有害蓝藻水华中起关键作用,影响其垂直迁移、抵抗捕食和光照可利用性。本研究引入光学相干断层扫描(OCT)技术,用于探究蓝藻菌落的三维形态。该技术能够对尺寸达数毫米的菌落进行非侵入性三维成像,提供详细的介观尺度形态特征。细胞内的气体囊泡显著提升了图像质量。我们描述了样品制备和图像采集协议,以及一套图像处理流程,该流程提取介观形态特征并提供菌落的体积可视化。该方法在代表不同蓝藻物种的菌落上进行了测试,同时为自然微囊藻菌落获取了体积图像和测量的介观特征数据集。通过量化不规则菌落形态对其浮升速度和菌落内光照可利用性的影响,我们展示了三维成像的实用性。我们预期OCT将成为监测蓝藻菌落种群和探究菌落形成的关键成像技术,并可能扩展到淡水和海洋环境中的其他群体和聚集生物。
评估柳雷鸟收获的阈值管理:追踪12年间开放与封闭区域。 Willebrand, T. 2026-08-28 PDF 管理者必须在不确定性面前做出决策,尤其是在可用资源有限时。识别特定条件满足或超过时的阈值,有助于潜在的风险缓解。2005年,柳雷鸟的可持续狩猎水平被确定,以避免狩猎努力超过每平方公里3个猎人日。在此,我们通过分析六个区域(形成三对开放/封闭配对)的线样带计数和狩猎数据,评估这些建议,这些区域位于国家管理的柳雷鸟狩猎区。我们开发了三组贝叶斯层次模型:一个静态距离模型和两个动态模型,包括一个机制性风险模型和一个Gompertz现象学模型。成鸟和幼鸟密度显示出显著的年度间变化,且这种变化在六个地点间大体同步,无论狩猎状态如何。狩猎努力参数在两个模型间显示出显著差异。在风险模型中,该参数为正,且几乎确定排除零,但在Gompertz模型中,该参数高度不确定。然而,这两个模型并不矛盾,而是回答了互补的问题,对狩猎信号的敏感性不同:狩猎死亡率在个体层面是附加的,但这种附加死亡率在种群丰度层面被掩盖。因此,狩猎的人口统计成本是真实存在的,可通过生存链量化,但长期受稳定动态的约束。一个固定限额,锚定于监测到的努力和捕获量,并非对适应性管理的粗略替代,而是在通常可得信息下的适当设计。它将是一个预防性工具,基于本研究牢固确立的关系:猎人努力转化为狩猎死亡率。
全球维管植物揭示分类群与生态区之间的持续空白 Maciel, E. A. 2026-08-28 PDF 生物多样性聚合平台如GBIF提供了前所未有的全球生物多样性数据访问途径,但其代表性在空间和分类群上仍不均衡。本研究考察了GBIF上全球维管植物数据的空间与分类结构。对GBIF维管植物数据集应用了六项过滤条件,导致所有记录中的54%被移除。这些过滤条件共同解释了已识别空间问题的90%以上,其中重复记录和缺失坐标构成了大部分变异。较高的发生记录数量与更多的空间问题相关联。记录分布从目到种等更细的分类层级逐渐变得更加均匀。物种、属和科的发生记录时间序列在1800年后急剧增加并持续上升,未见明显稳定趋势。在所覆盖的824个生态区中,73个生态区占所有发生记录的72%。这些生态区遍布各大洲,但高度集中于欧洲,其次是北美洲和大洋洲。分析揭示了四个关键模式:(1)数据量与空间问题呈正相关;(2)少数分类群占记录的大部分比例,而许多分类群仅由相对较少的记录代表;(3)GBIF聚合的发生数据自1800年以来持续增长;(4)记录覆盖在全球生态区中仍高度不均。这些结果凸显了生物多样性数据聚合平台在扩大生物信息获取方面的重大贡献,同时展示了塑造其内容的持续存在的空间和分类偏差。在评估数据完整性和质量以及利用聚合发生记录推断全球生物多样性模式时,应明确考虑这些偏差。
序列结构通过异位基因转换塑造人类等位基因频率 Steyaert, W. 2026-08-28 PDF 群体遗传学对等位基因频率的解释通常始于单一起源假设:即一个变异出现一次,随后受选择、漂变和人口历史的影响。我们在此表明,对于人类变异的相当一部分,这一假设不成立,且失败方式具有可预测性:异位基因转换会代代重新引入相同的核苷酸变化,其速率受基因组架构的两个固定属性——同源模板长度和供体-受体距离——强烈结构化。在gnomAD v4.1的5.34亿个变异中,这种重复输入估计占最稀有变异的4%,以及常见变异的超过15%。来自11,963个三人组的从头突变直接展示了这一过程:在相同变异已普遍存在的位置,突变率精确地升高达28倍,且在长模板的此类案例中,94%的新生等位基因与旁系同源供体匹配。该效应在片段重复区域内最强,但延伸至每条染色体。受影响位置显示连锁不平衡降低,且在常见频率下,已报告的GWAS关联中减少了30-40%。对于人类变异的这一部分,等位基因频率由基因组序列架构编码,而非仅由群体遗传过程决定。

medRxiv

标题 作者 发布日期 PDF链接 摘要
HFpEF中的异质性治疗效应:区分随机试验中的药物特异性反应与预后表型 Santana, C. 2026-08-28 PDF 背景:射血分数保留的心力衰竭(HFpEF)是一种异质性综合征,包含多种病理生理表型。HFpEF试验大多纳入多样化人群并报告平均治疗效果,结果持续为中性,这可能掩盖了特定亚组中的药物特异性获益。为解决这一问题,我们采用一种基于交互作用的方法,纳入治疗与变量间的交互作用,以揭示药物特异性反应。方法:我们利用四项HFpEF临床试验(TOPCAT、RELAX、NEAT-HFpEF、INDIE-HFpEF),开发了一个包含两种互补方法的框架。第一种采用预后应答者模型,评估常规应答者定义是否反映治疗特异性获益,或仅捕捉治疗组和安慰剂组共有的有利临床轨迹。第二种采用基于交互作用的个体治疗效果(ITE)建模,识别可改变治疗效果的基线变量,从而区分药物特异性反应与预后表型。结果:尽管预后应答者模型显示出良好的区分能力,进一步分析提示其主要捕捉了治疗组和安慰剂组共有的有利临床轨迹相关的预后信号。相比之下,ITE模型在各试验中识别出不同的、药物特异性的效应修饰因子(螺内酯(TOPCAT)为心肾炎症性,单硝酸异山梨酯(NEAT-HFpEF)为一氧化氮介导的抗炎性,无机亚硝酸盐(INDIE-HFpEF)为后负荷降低性,西地那非(RELAX)为抗容量超负荷性)。每个ITE模型仅在其自身试验中表现出显著性,提示药物特异性信号。结论:所提出的方法识别出机制特异性的效应修饰因子,并揭示了治疗反应中具有临床意义的异质性,而传统基于最小临床重要差异(MCID)的方法无法捕捉到这一点。尽管属于探索性研究,这些发现支持HFpEF中的表型指导治疗,并主张采用表型知情的试验设计,以增强治疗效果检测和治疗靶向性。
三国跨国的性别特异性饮食炎症与代谢综合征:基于观察性及支持性遗传证据的炎症通路跨国IPD协调研究(饮食归因成分界限于OR=1.001-1.013) Huang, S. 2026-08-28 PDF 摘要 背景:膳食炎症指数(DII)与代谢综合征(MetS)相关,但支持性别特异性效应及跨国验证的因果证据仍有限。方法:我们整合了来自美国NHANES、韩国KNHANES和墨西哥ENSANUT的56,475名成人个体参与者数据,采用基于调查加权的性别分层逻辑回归分析。通过三种互补方法评估炎症通路:基于CRP的孟德尔随机化(主要分析:84个女性匹配工具变量;敏感性分析:56个SNP性别重叠子集)、探索性直接饮食MR,以及代理差距分解。各国人群归因分数评估了跨文化的DII构念效度。结果:观察性分析显示,三个国家中均存在稳健的女性特异性DII-MetS关联(OR=1.15,P<0.0001;Q5对比Q1 OR=1.56),而男性中无显著关联(性别交互P<0.0001;RERI P>0.05)。基于CRP的MR提供了保守支持:主要84-SNP集产生衰减估计(IVW OR=1.03,P=0.31),而多效性稳健的MR-RAPS方法显示适度信号(OR=1.03-1.05,P≤0.01)。探索性直接饮食MR显示方向一致的效应(女性OR=0.91,P=0.10)。各国PAF揭示了构念效度梯度:美国女性为20.2%,而韩国(-8.0%)和墨西哥(-33.1%)为负值。正式三角验证(注意到部分证据线依赖性)得出Fisher合并P=4.4e-8。结论:促炎饮食在三个国家中与MetS表现出一致的女性特异性关联。基于CRP的MR为炎症通路假说提供了保守的遗传支持(MR-RAPS OR=1.03-1.05)。关键发现是20项DII在非西方饮食背景下的构念效度失败,强调需开发人群特异性炎症指标。乘性性别交互显著而加性交互不显著,提示人群层面的饮食指导可能捕捉到潜在获益。需开展试验以确立因果关系。关键词:膳食炎症指数;代谢综合征;孟德尔随机化;性别差异;跨国;构念效度
模拟呼吸道疾病暴发对美国农业劳动力的影响 Bardsley, K. 2026-08-28 PDF 背景:新发呼吸道疾病暴发对食品生产系统构成重大威胁。农业工人面临健康差距,这加剧了他们对呼吸道病原体的易感性,然而对工人健康和食品生产的影响仍知之甚少。方法:我们开发了一个家庭结构的易感-感染-恢复(SIR)传播模型,以比较六个地区农业工人与美国普通人群之间的疾病动态。我们模拟了多种流行病学情景下的暴发,并评估了加利福尼亚州三种劳动密集型作物(橙子、结球生菜、草莓)在不同收获季节性下的生产力损失。结果:我们显示,对于基线繁殖数R0 = 2.0,农业工人的峰值疾病患病率在各地区比普通人群高1.41-1.69倍,最终暴发规模高1.29-1.42倍。家庭结构占疾病差距的54%-68%。峰值生产力损失在各作物间为0.50%-0.63%,转化为数百万美元的潜在收入损失。在更高传播性和严重性下(R0 = 3且假设所有感染均有症状),损失高出2.4倍。结论:家庭拥挤可能导致农业工人中不成比例的呼吸道疾病负担,且因疫苗接种和肥胖差距而加剧,这凸显了在农业部门制定有针对性的暴发准备和缓解策略的必要性,以维持食品系统韧性并支持这些社区中的公共卫生。
脑电图功能连接作为自闭症患者适应性功能的预后生物标志物 Mehra, C. 2026-08-28 PDF 许多自闭症患者在适应性功能方面面临挑战,影响教育、就业和独立生活目标。自闭症患者的适应性功能结果差异显著,这使得规划未来需求变得困难。在此,我们采用发展敏感的方法,研究了皮质-皮质功能连接——自闭症中一个核心的神经生物学差异特征——是否能预测自闭症患者适应性功能的纵向变化。通过使用脑电图对150名自闭症和159名非自闭症参与者(年龄6-31岁)进行研究,我们探讨了平均度和小世界指数(网络组织)是否能预测19个月内适应性功能的纵向变化。我们发现,小世界指数显著预测了自闭症患者在整个年龄范围内的适应性功能变化。预测性能在自闭症青少年(15-24岁)中最佳,其中平均度和小世界指数分别解释了结果中21%和30%的额外方差,优于智力测量和自闭症特征。在分类二元(改善与未改善)结果时,包含平均度的模型在15-24岁年龄组中的AUC为0.84 [95% CI: 0.71-0.97],而包含小世界指数的模型在6-31岁年龄范围内的AUC为0.76 [95% CI: 0.63-0.89]。这两个指标均表现出预后生物标志物所需的特性:高重测信度以及与基础生物学的趋同性(与脑容量相关基因的遗传变异显著关联)。因此,我们首次证明了脑电图衍生的功能连接指标有望作为自闭症患者适应性功能的预后生物标志物。潜在的精准医学应用包括在临床试验中对参与者进行分层,以及在临床环境中识别功能下降风险个体。
2013年至2018年美国商业保险结核病患者医疗费用预测因素 Ilavarasan, V. 2026-08-28 PDF 背景:美国大多数人有商业健康保险,但结核病(TB)护理费用一直聚焦于公共部门。目的:量化美国商业保险结核病患者12个月的全因医疗费用,并识别支出预测因素。设计/设置:使用Merative(TM)MarketScan(R)商业索赔数据库(2013年至2018年)进行的回顾性队列研究。参与者:18岁及以上患有结核病的成年人。主要结局指标:从诊断日期起计算12个月的全因医疗费用(门诊、住院、药房)。使用Gamma广义线性模型估计调整后费用比(aCR)。结果:我们纳入了303名诊断为结核病的个体,中位年龄46岁,158名(52%)为男性,16名(5%)感染HIV,12名(4%)患有乙型肝炎(HBV),13名(4%)有药物使用障碍。平均12个月总费用为32,404美元(中位数8,075美元;标准差78,829美元)。与无合并症者相比,有任何合并症(HIV、HBV、丙型肝炎(HCV)、酒精使用障碍、药物使用障碍或Charlson评分>0)者的12个月中位费用显著更高(11,930美元[四分位距4,194至36,073美元]对比3,385美元[四分位距1,506至8,609美元];p<0.001)。HIV合并感染和药物使用障碍是最强的独立预测因素。HIV合并感染与4.7倍更高的费用相关(aCR 4.70,p<.001),主要由药房支出驱动(aCR 16.4)。药物使用障碍与3.2倍更高的费用相关(aCR 2.62,p=.03)。合并症负担是连续的独立预测因素(每Charlson点aCR 1.36,p<.001)。结论:商业保险结核病患者的医疗费用较高,且合并症(包括HIV合并感染和药物使用障碍)会进一步增加费用。改善筛查、护理协调以及结核病和高风险合并症的管理可带来显著的成本节约。
家庭肺功能测定与FeNO检测能否改善哮喘诊断?一项可行性研究 Wang, R. 2026-08-28 PDF 引言:哮喘误诊较为常见。尽管时间变异性是哮喘的标志性特征,但诊断主要依赖单次临床测量。我们评估了家庭肺量测定和呼出气一氧化氮分数(FeNO)检测的可行性和潜在诊断价值。方法:有症状、未经治疗且全科医生怀疑哮喘的成人接受了常规诊断测试,包括支气管舒张试验、诊室内FeNO、血嗜酸性粒细胞计数和支气管激发试验(BCT)。参与者还进行了为期两周的家庭肺量测定和FeNO测量。参考标准(哮喘/非哮喘)由至少两名哮喘专家的专家组根据临床病史和常规测试结果确定;家庭肺量测定和家庭FeNO测量(指标测试)对专家组设盲。结果:在51名招募的参与者中,38名由专家组确认或排除哮喘。家庭测量从37名(73%)参与者获得1058次肺量测定记录,从39名(76%)参与者获得848次FeNO记录。在完成任何家庭测量的参与者中,家庭肺量测定的中位(IQR)依从性为66.7(58.6-97.6)%,家庭FeNO为78.5(51.8-103.6)%。在有诊断结果的参与者中(家庭FeNO:n=32;家庭肺量测定:n=28),拟议的家庭测试指标在≥90%特异性下表现出高敏感性,优于日间峰值呼气流速。将家庭测试纳入BTS/NICE/SIGN 2024诊断路径可将对BCT的依赖减少65%。健康影响数据的收集可行,经济范围评估表明具有潜在的价值。结论:家庭肺量测定和FeNO检测用于诊断哮喘可行,并显示出改善哮喘诊断的潜力。这些发现支持通过充分把握度的诊断准确性研究进行进一步评估。
气道影像组学(RadAr):常规CT成像中用于疾病表征的多尺度气道表型分析 Mutha, P. 2026-08-28 PDF 目的:气道重塑是多种呼吸系统疾病的共同特征,但目前的CT工具对气道树的表征能力有限。我们提出气道影像组学(RadAr),一种从常规胸部CT中自动进行多尺度气道表型分析的框架。方法:RadAr提取多尺度、可解释的气道测量指标,涵盖管腔尺寸、锥形度、结构扭曲及整体形态,并提供交互式网页门户用于分析和可视化。该框架在四个场景中进行了评估:纤维化间质性肺病(fILD;N=147)的63周死亡率预测、COVID-19严重程度预测(N=1164)、进行性肺纤维化(PPF;N=9)的结构-功能关联以及儿童囊性纤维化(CF;N=11)的结构-炎症标志物关联。无监督聚类在fILD和COVID-19队列中识别出气道表型。结果:在fILD中,下叶结构扭曲与死亡率相关(平衡准确度0.654)。在COVID-19中,严重疾病与管腔扩张独立相关(AUC 0.719,比值比2.32,p=0.017)。在PPF中,气道表型与用力肺活量({rho}=0.83)、中呼气流量({rho}=0.87)及{superscript 1}{superscript 2}Xe MRI肺泡气体交换损伤({rho}=0.70)相关。在儿童CF中,锥形度降低和圆柱度增加与既往急性加重及支气管肺泡灌洗中性粒细胞增多相关({rho}=-0.64至-0.78)。从广泛、锥形气道树到稀疏、扩张、厚壁、迂曲的气道树,识别出五种表型,且COVID-19严重程度和fILD死亡率在此谱系中递增。结论:RadAr识别出可解释的、疾病特异性的气道特征,这些特征与成人及儿童限制性、阻塞性和混合性肺疾病中的功能和结局相关。它提供了一个可扩展的框架,可能支持肺部疾病的诊断、风险分层和纵向监测。
计算机视觉在神经外科实时像素级解剖分割中的应用:首次人体临床评估与迭代开发(IDEAL阶段1) Khan, D. Z. 2026-08-28 PDF 引言:精准的解剖导航是安全进行内镜垂体手术的基础,这是一项高风险操作,具有陡峭的学习曲线。传统导航系统往往依赖干扰手术流程的探针或静态术前影像,而计算机视觉人工智能(CVAI)的进步现在能够直接从实时手术视频中实现动态、像素级解剖分割。我们团队此前已开展一系列临床前人机交互研究以优化系统设计,并结合数字及高保真物理模拟,证明AI辅助在提升整体性能、培训和安全性方面的益处4-8。在此基础上,本研究首次将实时像素级CVAI解剖分割应用于神经外科手术室,旨在评估可行性并迭代改进系统。方法:在DECIDE-AI和IDEAL框架指导下,本单中心评估包括初始概念验证阶段(n=6),针对内镜经蝶垂体手术。AI模型采用基于DINOv3的视觉变换器架构,通过高性能边缘计算单元部署,实现低延迟、实时推理,无需依赖云基础设施。可行性和功能性通过结构化问卷、前瞻性观察及对内镜手术视频流和更广泛手术室环境的盲法回顾性审查进行评估。通过验证过的人因调查,持续的多方利益相关者反馈推动了病例间的迭代技术改进。结果:共纳入八名垂体腺瘤患者。CVAI系统在六例中成功部署,显示出可接受的实时像素级鞍区分割准确性。两例因单一复发性系统重启错误,在术前部署失败。病例间的迭代改进由我们的经验和手术团队反馈驱动,导致额外解剖结构分割(如颈内动脉)的整合、通过扩展训练数据集增强模型准确性以及硬件固件升级。多方调查显示手术团队对系统可行性、可用性和可接受性满意。前瞻性观察和回顾性视频审查均确认无不良事件发生,包括对主刀医生无明显干扰,且无AI相关临床并发症。结论:这项首次人体早期临床评估证明了在高风险神经外科手术中,基于实时像素级CVAI的解剖导航的可行性和迭代开发。未来工作将包括更大规模的单中心病例系列(IDEAL阶段2a),涉及更多手术团队,以进一步迭代系统并探索其对安全性、培训和工作流程的影响。随着底层AI模型的改进并与其他术中导航技术集成,此类工具很可能成为术中手术决策支持系统的基石。
政策相关的因果方法评估危地马拉甘蔗工人职业性热暴露和空气颗粒物暴露对急性肾功能的影响 Dye-Robinson, A. 2026-08-28 PDF 背景:不明原因慢性肾脏病在中低收入国家日益成为健康问题。反复急性肾损伤被认为在慢性疾病的机制通路中起作用。虽然职业性热应激被认定为农业工人肾功能障碍的潜在促成因素,但热应激、核心体温(Tc)与肾功能之间的因果关系仍不明确。方法:这是一项在危地马拉进行的观察性研究,跟踪了148名男性甘蔗工人,跨越两个为期六个月的收获季。热应激通过热指数(HI)和Tc(使用可摄入的遥测温度药丸)测量。颗粒物(PM)暴露通过个人呼吸区采样器测量,配备尺寸选择性入口,用于收集5微米以下颗粒(PM5)。肾功能通过估计肾小球滤过率(eGFR)从班前到班后的变化来衡量。应用了两种双重稳健分析:描述肾功能在每种暴露观测范围内变化的暴露-反应曲线,以及估计在HI、Tc和PM实际减少情况下肾功能变化的修正暴露政策。结果:平均每日HI为37.4摄氏度(标准差:2.0),每班平均Tc增加1.16摄氏度(标准差:0.48)。HI和Tc均与工作班次期间eGFR下降相关。在HI为34摄氏度时,估计平均eGFR下降约2.5 mL/min/1.73 m²,且无统计学显著性,而在40摄氏度时,下降约10 mL/min/1.73 m²,且具有统计学显著性。模拟政策将HI暴露减少5%可改善eGFR变化2.94 mL/min/1.73 m²(95%置信区间:0.96,4.91)。未检测到PM暴露与eGFR下降之间的统计学显著关联。结论:减少工作日热暴露可能缓解急性肾功能下降。这些发现支持制定旨在减少外部热暴露和内部热应激的政策干预措施,以保护肾脏健康。需要更多研究来调查其他环境因素(包括PM暴露)的潜在贡献。
产前酒精暴露胎盘中神经元基因的变化与六岁时神经心理学特征相关 Rämö, K. 2026-08-28 PDF 产前酒精暴露(PAE)扰乱胚胎发育,并导致可变胎儿酒精谱系障碍(FASD)表型,其特征为神经发育和形态学缺陷。我们通过全基因组DNA甲基化(DNAm)微阵列和基因表达(3'mRNA测序)分析,在87例PAE、77例未暴露对照组和11例仅吸烟暴露胎盘中研究了PAE对胎盘基因调控的影响。在涉及突触功能的基因中发现了显著改变,包括兴奋性和抑制性神经传递,以及先前与注意力缺陷/多动障碍(ADHD)、自闭症谱系障碍、精神分裂症和成瘾相关的基因。当将胎盘分子改变与同一批儿童在六岁时评估的神经心理和形态学表型进行比较时,观察到DNAm和基因表达与头围、认知表现、ADHD和形态学评分之间存在众多关联。与表型相关的基因包括NR2F1、GPHN、GLI3和FRZB,它们分别参与神经发生和皮层模式形成、GABA受体的突触后聚集、大脑和颅面发育以及Wnt信号传导的调节。由于这些改变在胎盘中检测到,该组织不仅能够识别表型特异性FASD候选基因,还可能为复杂神经发育和形态学障碍背后的发育机制提供独特视角。