2026-07-21 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 视觉相似性的多重感知:一种文本提示的图像感知度量 | Sheng-Yu Wang | 2026-07-20 | 人类视觉相似性判断具有上下文依赖性。例如,两张图像可能在形状上相似但颜色不同。然而,现有的感知相似性度量将这些细微差异压缩为单一标量值,无法针对特定方面进行条件化处理。为弥补这一不足,我们引入了一个大规模人类相似性判断数据集,该数据集基于图像三元组构建,每个三元组在多个自由形式的语义相似性维度上进行了标注。对前沿视觉语言模型(VLM)的基准测试显示,这些模型与人类标注者的共识之间存在显著性能差距。利用我们的数据,我们微调了一个VLM,生成了文本提示图像感知相似性(TPIPS)度量,该度量能根据指定的文本提示捕捉视觉相似性的多重含义。实验证明,TPIPS与人类感知的一致性更高,且能可靠地泛化到训练分布之外。最后,我们展示了TPIPS在文本引导检索、组合搜索以及生成模型细粒度评估中的新能力。我们的代码、数据和训练模型已开源在 https://peterwang512.github.io/TPIPS。 | |
| 补丁策略:通过密集视觉表征实现高效具身控制 | Gaoyue Zhou | 2026-07-20 | 来自Vision Transformers(ViTs)的预训练密集视觉特征虽然强大,但在机器人学习中尚未得到充分利用。现代机器人策略要么将每次观测压缩为单个全局标记,要么依赖从头训练的视觉骨干网络,这既牺牲了细粒度空间细节,也失去了大规模视觉预训练的优势。虽然存在像大型视觉-语言-动作模型(VLAs)那样处理密集补丁特征的策略,但它们往往笨重且缓慢,继承了十亿参数视觉-语言模型(VLM)骨干的全部计算成本。我们通过Patch Policy填补了这一空白——这是一种极简架构扩展,使基于Transformer的策略能够直接消耗预训练的密集补丁标记,而无需完整VLM的计算开销。其核心是块因果注意力掩码,它在保持标准策略时间因果性的同时,让模型能够关注每次观测中的多个补丁标记及其他状态信息。Patch Policy轻量、快速且高效。在四个模拟环境和三个真实世界环境套件中,我们的方法相比使用最先进全局池化表征的策略实现了40%的相对改进。此外,它在仅使用约0.7%参数量的情况下,超越了微调后的OpenVLA-OFT达18%。我们相信Patch Policy为机器人社区提供了一条便捷利用视觉表征学习持续进步的管道,同时不会牺牲高频反应控制所需的训练效率或推理速度。视频可访问https://patch-policy.github.io查看。 | |
| 自动发现没有普遍优越的约束装置 | Akshat Gupta | 2026-07-20 | 诸如OpenEvolve和TTT-Discover等自主发现系统常被用作通用型搜索框架。然而在实践中,这些复合系统将档案管理、父代选择、探索策略和预算分配等多个设计选择整合为单一方案。由于发现过程成本高昂且具有内在随机性,现有框架常因独立试验次数过少而难以区分关键方法改进与运行间方差。我们系统解构了OpenEvolve式进化搜索和TTT-Discover搜索框架的组成模块,通过超过310万次大语言模型调用和重复试验统计分析,在12个模型-问题组合上系统评估了30个预算匹配的搜索框架。结果表明发现框架存在泛化问题:没有固定框架能在所有评估的模型-问题组合中稳定胜出,且OpenEvolve变体普遍逊于更简单的替代方案。因此,框架选择更应被视为超参数而非通用方案,需针对具体问题和底层模型进行定制。我们还发现早期发现进展可预测最终性能,并据此提出预算匹配的自适应分配实验:启动多个框架,剪枝表现较弱的局部运行,将算力重新分配给更强的幸存者,其表现优于随机采样固定框架和非自适应框架集成。这些结果共同推动从固定框架选择转向由早期性能引导的在线自适应策略。我们发布所有运行池(包括每个模型-问题组合的基线零分布)作为可复用的统计基础设施,供未来框架提案使用。 | |
| 重要的不是你说什么,而是你怎么说:评估大语言模型对信念表达的反应 | Kevin Du | 2026-07-20 | 用户经常向大型语言模型(LLMs)表达其信念。在某些情况下,LLM应将这类语境信念视为真实信息;而在其他情况下,则应坚持其先验知识。值得注意的是,用户的信念表达(EoBs)可采用多种语言形式——通过预设、证据标记、确定性标记或不同语气——每种形式对LLM的说服力可能不同。我们提出了一种类型学框架,系统评估不同EoBs如何影响模型在遵循语境与坚持先验知识之间的选择。该类型学基于四个语言学维度:形式、证据性、认知立场和语气,涵盖17种细分类别。通过将这些EoBs与世界知识事实配对,我们生成了受控的EoB-查询对,以隔离语言变异的影响。利用该基准,我们评估了16个在架构(Llama3、Qwen3、Gemma3)、规模(1B-30B参数)和训练阶段(基础模型vs指令模型)上存在差异的LLMs。我们识别出这些维度上响应行为的显著差异,例如,较大模型和指令模型比小模型和基础模型更不倾向于遵循语境。此外,我们发现某些特定EoBs在统计上显著地比其他EoBs更一致地影响语言模型。我们的研究揭示了语言框架如何系统性地影响LLM语境整合的模式,对提示工程和模型鲁棒性具有启示意义。 | |
| 现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化方法 | Yi Tang | 2026-07-20 | 现代视觉语言模型(VLMs)显著提升了图像生成与编辑能力,使得跨模型和分布外场景下的像素级图像篡改检测日益重要且充满挑战。本研究针对ChatGPT、Gemini、Qwen-Image等现代VLM的像素级图像篡改检测开展域泛化研究,旨在学习能适应多样化VLM生成篡改分布的鲁棒定位模型。我们提出一个简洁高效的域泛化训练框架,基于两项实用策略构建。首先,引入平衡小批量采样方案,在每个小批量中策略性地采样篡改图像与真实图像,防止优化过程偏向篡改伪影或干净图像先验,避免训练崩溃,确保每次优化步骤获得恰当的采样梯度信号。其次,采用简单的后期注入策略:检测器先在大型基础数据上训练至稳定收敛,再引入少量来自新兴VLM分布的新增支撑数据,在避免过拟合有限新域的同时提升适应性。这些组件共同为提升现代VLM的像素级篡改定位与OOD鲁棒性提供了简洁而强大的方案。尽管概念简单,我们的框架在GPT-Images-2.0、Gemini-3.1、FLUX.2和Seedream 4.5等OOD VLM上,平均gIoU和cIoU分别相对提升26.1%和26.8%,大幅超越此前最优方法PIXAR。代码已开源:https://github.com/VILA-Lab/PIXAR-DG | |
| 压力下的逻辑判断:利用学习软前缀诊断三段论稳定性 | Brian K Chen | 2026-07-20 | 为测试正确逻辑判断如何响应习得语境,我们在一个精确标注的三段论推理基准测试前添加软前缀,同时保持模型固定。软前缀是不透明的连续向量,因此我们通过它们在逻辑形式和接口的受控变化中诱导的行为来表征它们。通过研究哪些前缀成功及其效果如何泛化,我们描述了习得语境压力如何覆盖正确判断并暴露模型逻辑稳定性的局限。在Qwen3.6-35B-A3B MoE、Qwen3-8B和Gemma 4 31B上,习得前缀重定向了许多正确答案,并在未见形式和接口变化中保持有效。在Qwen3.6 MoE和Gemma的重复测试中,它们在所有16个模型-方向-分割比较中优于配对随机控制,差距为37到99个百分点。Qwen3.6 MoE在措辞和提示变化中的翻转率保持在72%到90%之间,而Gemma有效性前缀的翻转率保持在54%到56%,匹配随机前缀则低于1%。诊断测试表明,主要效应是对一种答案含义的广泛偏好,而非固定符号强制或可在任务间可靠转移的逻辑操作。这种偏好的形式因模型而异。在两个Qwen模型中,简单得分模型通常能预测哪些判断会翻转,但无法预测其边际移动幅度,而Gemma的整体响应则更接近这些模型的近似。这些结果表明,成功软前缀的主要行为效应是广泛的答案偏好,而剩余响应则揭示了逻辑稳定性中显著的模型特异性差异。 | |
| FlowMimic:基于像素对扭曲流场的无遮罩视觉编辑与生成,用于在线视频编辑数据生成及模态模仿 | Dingyun Zhang | 2026-07-20 | 遵循视觉研究的主流方向,我们探索在单一模型中整合视频与图像模态的生成与编辑能力。当前收集视频编辑数据的方法通常依赖耗时费力的人工流程——涉及对象掩码标注、通过I2V模型和ControlNet类引导引入误差的配对合成、以及基于VLM的质量过滤或优化——且任务扩展性有限。因此,编辑任务的多样性仍远低于图像编辑模型。我们开发了一种像素对时间扭曲流场,可直接从图像编辑样本实时生成对应的视频编辑样本,并在多个层级的视频编辑任务中证明模型仅需此类数据即可学习视频编辑。我们将图像模态视为视频模态的特殊形式,据此设计模态模仿生成损失与模态模仿编辑损失,通过相互模仿使两种模态的能力及输出分布相对对齐。此外,基于语言的视觉编辑需要理解编辑指令与参考视觉内容、定位参考视觉内容中对应指令的区域、并仅修改该区域。现有方法主要依赖外部辅助,如微调额外MLLM或在推理时显式提供掩码序列作为辅助输入。我们则期望模型内化这一能力,为此引入感知相关任务(如指代分割)及对应的编辑区域感知隐层损失与注意力损失。 | |
| 不规则时间序列上的因果发现 | Martim Penim | 2026-07-20 | 因果发现方法在时序系统中表现出色,但通常依赖规则且离散的滞后结构,这限制了其对规则采样数据的适用性。然而,许多实际任务需要处理不规则采样的事件流,例如传感器数据流、医疗健康数据和金融交易。本研究提出对PCMCI+(一种处理规则多变量时间序列因果发现的先进方法)进行扩展,使其能够处理不规则时间序列。我们的方法不再通过固定滞后依赖关系建模因果关系,而是通过预定义时间窗口聚合因果影响。我们在不同信噪比条件下,基于已知因果结构的合成不规则事件流上评估该方法,结果表明该方法能持续恢复潜在因果图,并在不规则采样数据上显著优于标准PCMCI+。 | |
| 向量搜索作为最近邻匹配:基于RAG的因果推断策略学习 | Masahiro Kato | 2026-07-20 | 我们提出基于检索增强生成(RAG)策略学习的一步法与两步法。在潜在结果框架下构建基于RAG的行动选择机制。两步法中,向量检索在嵌入空间中提取行动相关的邻近证据,生成器估计条件期望结果或其对比值,再通过插件规则选择行动。该框架将行动特定向量检索与因果推断中的最近邻匹配建立关联。我们将两步法的遗憾值分解为候选生成遗憾与候选内选择遗憾,并利用最近邻估计器与Transformer的预测误差保证对后者进行约束。由于一步法的中间计算过程不可观测,我们直接将其作为策略进行评估。 | |
| GigaPath-Flash与GigaTIME-Flash:面向全切片及肿瘤微环境分析的高效病理学基础模型 | Naoto Usuyama | 2026-07-20 | 基础模型已成为计算病理学领域的核心驱动力,通过从大规模组织病理学数据中学习可迁移表征,有望革新癌症诊断、预后判断及治疗方案选择。当前病理学基础模型的发展格局已涵盖多样化的数据来源、架构体系及下游应用场景。然而,现有预训练模型大多仅支持图像切片级操作,采用限制性许可协议,且计算成本高昂,这严重制约了其在全切片临床与科研场景中的大规模应用。为此,我们推出GigaPath-Flash与GigaTIME-Flash——面向全切片病理AI与空间蛋白质组学预测的高效模型。GigaPath-Flash采用2200万参数的ViT-S切片编码器与2100万参数的LongNet全切片编码器组合架构,两者均基于大规模真实世界组织病理学数据预训练。其轻量化切片编码器通过知识蒸馏技术从十亿参数级GigaPath(ViT-g)教师模型获得,并作为两个模型的共享组件。GigaPath-Flash在保持GigaPath平均全切片性能97%的同时,计算量降低50倍。GigaTIME-Flash在此基础上扩展,可直接从常规H&E染色图像预测肿瘤免疫微环境,其预测质量超越原始基于CNN的GigaTIME模型,运行速度提升6倍,GPU内存占用减少8倍。与GigaPath和GigaTIME共同构成采用Apache-2.0开源协议、基于大规模真实临床数据预训练的开放权重模型家族。通过完整发布所有模型与权重,我们为计算病理学、免疫肿瘤学及精准医疗领域提供可便捷获取的基础工具组件。 |
bioRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 一种混合机器学习和酶约束代谢模型,用于从头预测蛋白质组重新分配 | Motamedian, E. | 2026-07-21 | 异源蛋白在微生物细胞工厂中的高表达常因有限细胞蛋白质组的重新分配而引发严重负担。传统基于约束的模型难以在不依赖条件特异性组学数据的情况下从头预测这些资源变化。为弥补这一不足,我们开发了混合转录-翻译(HyTT)框架,通过强制80S核糖体完整性约束,将多元自适应回归样条(MARS)与酶约束代谢模型相结合。HyTT被构建为混合整数线性规划问题,通过二分搜索法在数学上耦合宏观空间边界与微观的序列衍生翻译成本。针对稳态恒化器定量蛋白质组学数据的验证表明,HyTT在预测酿酒酵母全系统资源(再)分配方面优于其他模型。该框架从头运行时,将蛋白质丰度的预测精度提升至传统模型的两倍(皮尔逊相关系数r=0.501),成功将最小必需蛋白质组与细胞储备库分离。关键的是,HyTT能自主捕捉对代谢工程至关重要的复杂应激反应。在模拟15%重组蛋白负荷时,该框架准确预测了系统性生长抑制、核糖体蛋白质组比例下降以及乙醇产量激增,与Crabtree效应一致。系统层面分析揭示,细胞通过非均匀代谢重路由适应受限的蛋白质组容量:下调呼吸复合体以支持高周转率的糖酵解酶,并依赖核糖体旁系同源物切换以最小化序列特异性组装成本。最终,HyTT为解码动态资源再分配提供了计算敏捷、序列驱动的平台,成为无需条件特异性多组学输入即可导航代谢权衡、指导理性菌株设计的强大预测工具。 | |
| 光遗传学调控线粒体功能以调节细胞死亡 | Yang, R.-Z. | 2026-07-21 | 细胞死亡是涉及生理和病理状态(包括神经退行性疾病和癌症)的关键过程。本研究探索利用光遗传学技术,通过光敏蛋白诱导细胞死亡。通过使用光敏蛋白调控线粒体功能,我们研究了三种不同策略:1)通过Gloeobacter rhodopsin介导的碱化作用抑制氧化磷酸化;2)利用反向质子泵视蛋白(RPPR)和阴离子传导通道视蛋白诱导线粒体去极化;3)使用线粒体靶向miniSOG产生活性氧(ROS)。我们的研究结果凸显了光遗传学方法诱导细胞死亡的潜力,为治疗异常细胞存活相关疾病提供了有前景的途径。 | |
| 通过摄影测量引导采样揭示优势珊瑚单种林内的空间基因型模式。 | van Hulten, D. | 2026-07-21 | 局部和全球性压力因素正导致具有竞争力的造礁珊瑚数量减少,而耐压性、杂草型物种则日益繁盛。在这些类群中,快速的无性繁殖策略促进了现有基因型在小空间尺度上的增殖,可能导致形成单一物种的"地毯状"群落。这种繁殖策略引发了对未来珊瑚礁种内多样性和恢复力的担忧。这些空间优势杂草型珊瑚的遗传结构仍不明确,部分原因是密集聚集的群体缺乏清晰边界,阻碍了标准采样方法的应用。我们采用摄影测量引导的空间显式采样方法,评估了库拉索岛三个礁区中日益占优势的石珊瑚Madracis auretenra的基因型多样性和基因分布。M. auretenra的覆盖率在不同礁区和礁带间差异显著(4.1-26.2%)。对以1米间隔采集的678个样本进行全基因组基因分型,鉴定出两个遗传差异显著的谱系,分别占样本的90%和10%,其基因型多样性(基因体与分株比Ng/N)分别为0.287和0.481。单一物种群落(n=20)通常包含多个基因型,偶尔甚至包含两个谱系,但通常由单一基因型主导(平均65.5%,最低42.3%)。模拟采样表明,结合单群落、斑块和孤立群体可最大化恢复应用中捕获的基因型多样性。我们的结果表明,摄影测量引导采样为单群落形成珊瑚的群体遗传学研究提供了有效且无偏的框架,同时揭示了这种在加勒比海南部日益占优势的物种中存在的显著基因型多样性。 | |
| 追踪“海中大熊猫”:珠江口极度濒危黄唇鱼eDNA监测的物种特异性qPCR检测方法 | Liao, Y. | 2026-07-21 | 黄唇鱼(Bahaba taipingensis,石首鱼科)是中国极度濒危的国家一级保护海洋鱼类。为支持保护与增殖放流工作,亟需可靠的非侵入性监测工具。我们开发并验证了三种基于TaqMan探针的qPCR检测方法,分别靶向线粒体12S rRNA、ND5和控制区(D-loop)位点,用于黄唇鱼的物种特异性检测。引物-探针组基于完整线粒体基因组设计,通过GenBank数据库进行计算机模拟评估,并利用黄唇鱼及近缘石首鱼类的组织DNA、阳性环境DNA样本进行体外验证;通过合成靶标DNA的梯度稀释实验量化灵敏度。三种检测方法均表现出高特异性和稳定的扩增效率;其中12S rRNA检测法(Bhb-12S)因低拷贝灵敏度更优且副产物最少,被选用于野外筛查。我们将Bhb-12S检测法应用于2025年香港西部23个采样点的414份海水样本,在9月样本中检测到黄唇鱼环境DNA(每升0.71-2.85拷贝,均值2.05),阳性结果经Sanger测序确认。总体而言,这些经过验证的qPCR检测方法为黄唇鱼非侵入性监测提供了可靠的分子工具,将有助于珠江口及邻近海域的保护规划、增殖放流评估及长期生物多样性监测。 | |
| 一个大规模众包标注的印度动物群声学数据集 | Ramesh, V. | 2026-07-21 | 全球生物多样性丧失的速度要求我们在较大地理尺度上采取保护行动并进行监测。声学监测与深度学习相结合的保护技术,如今使我们能够同时跨时空监测野生动物。然而,对于热带地区相当一部分生物多样性,我们尚无法依赖自动识别方法,因为缺乏稳健训练深度学习算法的声学模板。本文采用了一种新颖的参与式方法,联合研究人员、保护实践者和自然爱好者,为印度生物多样性创建了一个独特的众包、开放获取的跨分类群声学注释数据集。该数据集包含518个物种的3311分钟强标注数据(物种发声的边界框或注释)和2504分钟弱标注数据(指示音频文件中存在某物种但缺乏边界框),覆盖印度36个邦和中央直辖区中的25个。我们提供了元数据和数据处理代码,并强调了参与式方法在生物多样性监测中的优势。 | |
| 白色念珠菌TLO基因家族的旁系同源基因形成具有不完全冗余的相互连接功能网络。 | Simonton, E. | 2026-07-21 | 基因复制通常无法为生物体带来选择性优势,导致其从群体中被清除。在极少数情况下,若复制既不产生适应性代价,又能提升适应性,则可通过重复复制过程形成基因家族。尽管对基因复制功能已有详细研究,但关于重复复制如何影响旁系同源基因冗余性、可能限制新旁系同源基因或新功能产生的研究仍十分有限。本研究针对白色念珠菌端粒相关(TLO)基因家族14个成员,构建了单基因缺失突变体库,以检测谱系特异性扩张中旁系同源基因在分子与生物学功能上的冗余性。Tlo蛋白作为中介体转录调控复合体的可互换亚基,具有改变基因表达及多种细胞应答的潜力。在缺失单个TLO基因的菌株中,约80%的表型检测显示冗余性是最常见结果。然而,所有14个旁系同源基因的突变体在碳源利用至体内毒力等表型中均表现出非冗余功能。单TLO突变体的基因表达分析呈现相似冗余趋势,且单个TLO缺失显著影响菌丝形成、黏附、氧化还原反应及细胞表面转运蛋白活性相关基因。值得注意的是,旁系同源基因间的序列差异与单TLO突变体表型改变频率呈正相关,表明随着进化距离增加,非冗余功能逐渐获得。缺失两个TLO基因的双突变体同时产生正向与负向协同表型,提示旁系同源基因间存在普遍的交叉调控或协同调节。本研究共同揭示了新近产生的旁系同源基因在保留与其他家族成员冗余性的同时,仍能获得非冗余功能,从而形成高度互联的功能网络。 | |
| Legumain(天冬酰胺内肽酶)调节肺纤维化中的细胞外基质动态变化 | SAIDI, A. | 2026-07-21 | 肺纤维化的特征在于成纤维细胞向肌成纤维细胞转化(FMT)驱动的细胞外基质(ECM)沉积以及蛋白水解平衡的改变。尽管已有多项研究证实半胱氨酸蛋白酶的作用,但组织蛋白酶V(CatV)和豆荚蛋白(LGMN)的具体贡献仍鲜有探索。特发性肺纤维化患者的肺组织标本和支气管肺泡灌洗液中,LGMN、CatV及其双重抑制剂胱抑素M/E(CysM/E)均显著升高。TGFβ1通过Smad3通路触发CysM/E表达、LGMN转录、胞内成熟、酶活性及pro-LGMN分泌,而在发生肌分化的肺成纤维细胞(CCD-19Lu和原代HPF细胞)中CatV表达下调。LGMN或CatV的基因沉默以及LGMN的药理抑制导致纤连蛋白和弹性蛋白积累,表明这两种蛋白酶均参与ECM重塑。LGMN可切割纤连蛋白,而CatV主要调控弹性蛋白水平。相反,广谱抑制剂胱抑素C(hCC)显著减少弹性蛋白和纤连蛋白降解,而CysM/E作用较弱,主要影响弹性蛋白转换。LGMN抑制可短暂延迟成纤维细胞伤口闭合,通过纤连蛋白重塑在组织修复中建立功能作用。LGMN和CatV均不影响α-SMA表达,这与参与FMT的CatB不同。综上,LGMN被确定为基质重塑而非肌分化的效应因子,与CatV协同作用。在调控纤维化进展的蛋白水解网络中,本研究揭示了胱抑素调控的LGMN/CatV协同作用参与ECM转换和细胞迁移。这些结果也为针对肺纤维化ECM转换的潜在治疗性蛋白酶策略提供了新视角。 | |
| 临床级血小板源性生物材料在神经元损伤临床前模型中缓解线粒体功能障碍。 | Gupta, K. | 2026-07-21 | 血小板衍生生物材料正成为再生医学和神经修复领域极具前景的无细胞治疗平台。其中,从临床级同种异体血小板浓缩物制备的人血小板裂解液(HPPL)和血小板衍生细胞外囊泡(PEVs)提供了两种互补的生物材料形式:一种富含可溶性营养因子的裂解液,以及一种富含生物活性物质的囊泡制剂。鉴于线粒体功能障碍和氧化还原失衡是神经退行性疾病的标志,我们研究了这些血小板衍生生物材料是否能保护细胞免受鱼藤酮诱导的线粒体损伤。HPPL和PEVs从临床级血小板浓缩物中经生物加工制备,并对其蛋白质含量、抗氧化能力、囊泡形态、粒径分布、浓度以及血小板和细胞外囊泡标志物进行了表征。分化的N2A和SH-SY5Y神经元细胞在暴露于鱼藤酮(5μM)前用5% v/v的HPPL或PEVs预处理,而斑马鱼胚胎在暴露于鱼藤酮(200 nM)前接受20 μg/mL的HPPL或PEVs处理。两种生物材料均恢复了ATP生成,减少了活性氧(ROS),保护了线粒体膜电位和超微结构,并提高了神经元存活率。它们还使线粒体生物发生和动态的关键标志物恢复正常,包括过氧化物酶体增殖物激活受体γ共激活因子-1α(PGC-1α)、线粒体融合蛋白1(MFN1)和动力相关蛋白1(DRP1)。蛋白质组学分析进一步显示,HPPL和PEVs中富含线粒体相关的抗氧化和代谢蛋白,并揭示了预处理后鱼藤酮损伤细胞中氧化磷酸化、三羧酸循环相关通路、抗氧化防御和线粒体动态的恢复。在斑马鱼胚胎中,两种生物材料均提高了存活率和孵化率,减少了发育异常和氧化应激,并保护了线粒体超微结构。这些发现将HPPL和PEVs确定为具有互补线粒体保护活性的血小板衍生生物材料,支持其作为可扩展的无细胞生物治疗平台用于神经退行性疾病的发展。 | |
| 用于组织重塑多参数分析的高通量3D微组织平台。 | Vasan, A. | 2026-07-21 | 细胞外基质(ECM)重塑与力生成是组织形态发生和修复的核心驱动力,但目前仍缺乏可规模化定量研究这些动态力学过程的方法。我们提出了一种高通量筛选平台,将工程化三维(3D)微组织整合到标准化96孔板中。通过引入稳健的模具浇铸制造工艺和逐层表面修饰策略,确保组织长期稳定并防止脱落(组织形成成功率95%;可稳定培养超过10天)。该系统可通过相差显微成像同步纵向量化组织闭合、组织收缩力和组织压实度。配套的计算数据分析工具通过确定性计算确保可重复性,并将数据提取速度较人工标注提升80倍。利用药理化合物实验,我们证实组织闭合动力学、力生成和压实度是ECM驱动组织重塑的独立变量,挑战了传统收缩实验的固有假设。此外,与临床药物反应数据的基准测试表明,该3D平台(Kendall τ-b=0.72,p=0.045,n=8/10)比传统二维划痕实验(Kendall τ-b=0.52,p=0.25,n=4/10)更符合临床结果。综上,本研究建立了适用于三维系统组织重塑动力学功能筛选与定量评估的可规模化检测方法。 | |
| ProtSyntax:一种用于解码翻译后修饰语法与功能的蛋白质大语言模型 | Lin, Y. | 2026-07-21 | 翻译后修饰(PTMs)通过残基化学性质、序列上下文、三维微环境与修饰状态之间的依赖关系调控蛋白质功能,然而大多数预测模型独立建模修饰位点,未能将修饰倾向性与功能后果相关联。本文提出ProtSyntax——一种以PTM为中心的蛋白质语言模型,该模型基于覆盖40类PTM的425万条训练样本,并在激酶特异性、PTM串扰及酶动力学方面进行监督学习。ProtSyntax采用稀疏混合专家架构,融合双向长程建模与几何门控注意力机制,并通过自适应多目标学习将残基级PTM语法与蛋白质级功能耦合。在40个PTM位点基准测试中,相较于最优基线模型,ProtSyntax的平均马修斯相关系数(MCC)和平均精确率(AP)分别提升12.7%和10.7%。该模型还能区分真实位点与结构不兼容的基序诱饵、迁移至稀有PTM、恢复串扰关系、关联PTM扰动与酶动力学变化,并识别疾病相关的PTM异常。综上,ProtSyntax为解码蛋白质组中PTM调控提供了可解释框架。 |
medRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 更年期的血液蛋白质组学映射到大脑衰老和痴呆风险 | Wood Alexander, M. | 2026-07-21 | 更年期是生物衰老过程中的一个标志性事件,与后期神经退行性疾病风险相关。我们利用多个队列的蛋白质组学数据,识别更年期背后的生物学变化及其与大脑衰老的关联。在80名严格分期(STRAW+10标准)的绝经前、围绝经期和绝经后女性中,通过血清NULISAseq蛋白质组学分析发现,自然绝经表现为炎症、突触、代谢和阿尔茨海默病相关生物学过程的失调,这些变化与激素水平的关联性比与年龄的关联性更强。在年龄匹配的绝经前/围绝经期与绝经后女性(N=2,814)中,使用血浆Olink蛋白质组学进行的验证分析复现了观察到的蛋白质组变化,并揭示了更年期相关的更广泛炎症和分解代谢过程上调,以及包括大脑衰老在内的器官和细胞加速衰老。在四个独立老年女性队列(平均年龄60.7至72.1岁,总N=11,925)中,更年期相关的蛋白质组升高始终与较差的认知结局相关。更年期的分子特征可为中年女性大脑健康的生物标志物或治疗靶点提供参考。 | |
| 超越强度:疼痛分布塑造了有临床疼痛和无临床疼痛个体的就医与治疗信念 | Frankenstein, T. | 2026-07-21 | 疼痛通常以感觉术语描述,但其空间特征(定位与分布)却很少被量化。我们探究了关于疼痛分布的民间信念是否会影响寻求医疗护理的理论决策及治疗偏好。在一项横断面调查中(N=503;49%报告存在疼痛),参与者完成了思想实验,其中视觉呈现的疼痛分布模式(小、中、大)与疼痛强度(数字评分量表:2、5、8/10)被系统性地组合变化。针对每种场景,他们评估了(i)寻求专业帮助的可能性及(ii)服用镇痛药物的可能性。参与者还完成了一项空间-强度权衡任务,需在固定减少20%疼痛强度与可变减少疼痛分布(20-80%)之间做出选择。反向版本则对比了固定减少80%疼痛分布与可变减少疼痛强度。随着疼痛分布增大,寻求专业帮助和服用镇痛药物的可能性显著增加(p<0.001),其变化梯度与疼痛强度观察到的梯度一致。在空间-强度权衡任务中,参与者的选择呈现类S形函数(p<0.001):1%的强度减少被视为约等于3%的分布减少,表明对疼痛分布存在系统性估值。这一比值在经历疼痛的个体中低于无痛个体。此外,61%的参与者认为疼痛分布应与强度一同纳入疼痛管理的常规考量。结果表明,疼痛分布不仅是琐碎的描述性指标,更是影响医疗决策信念的重要决定因素。将空间指标纳入临床评估与研究,或能更准确捕捉个体对疼痛严重程度的隐性评价。 | |
| 多变量回归模型的开发与外部验证:用于急诊科成人菌血症的预测 | Samuels, T. H. | 2026-07-21 | 背景:菌血症与不良预后相关,但诊断金标准——外周血培养——需要长达24小时才能获得临床可操作的结果,这阻碍了疑似感染患者的早期管理决策。单一预测指标和现有脓毒症风险评分区分能力较差,且很少有基于多变量的菌血症模型在英国人群中得到充分验证。方法:我们基于2019年至2024年间伦敦大学学院医院(UCLH)33,874次住院事件的回顾性队列,采用反向AIC准则筛选预先定义的候选预测因子(这些因子在入院后数小时内即可常规获取),构建了逻辑回归模型。连续型预测因子采用限制性三次样条建模,缺失数据通过多重插补处理。模型性能通过内部-外部交叉验证和预测不稳定性分析进行评估,随后在UCLH 2024年保留数据中进行时间验证,并在牛津郡感染研究数据库(IORD)53,669次住院事件中进行外部验证。结果:UCLH和IORD队列中菌血症发生率分别为5.2%和8.9%。模型保留了20个预测因子,涵盖人口统计学、合并症、生命体征和血液检测指标。模型区分能力在开发时间段内保持稳定(合并c统计量0.82,95%CI 0.81至0.84),并在时间验证(0.83,0.79至0.87)和外部验证(0.83,0.82至0.83)中得以维持,外部验证中校准度极佳(校准斜率1.08(1.05至1.11);大样本校准值0.01(-0.02至0.04))。该模型优于单一预测因子、现有风险评分和重建的比较模型,并在决策曲线分析中显示出更优的净获益。模型性能在年龄、性别、种族和社会经济亚组中保持一致,但当血培养采样时间超过入院后6小时时性能下降,且因疑似感染部位不同而存在差异。结论:该模型利用入院后数小时内即可获得的常规收集数据准确预测菌血症,并在大型独立外部验证队列中保持性能。它提供了一种可推广、临床可解释的工具,用于支持疑似感染患者的早期决策,但需进一步研究确定最佳实施阈值。 | |
| 体力活动与2型糖尿病风险:肥胖与年龄在剂量反应中的异质性 | liu, j. | 2026-07-21 | 背景 严重精神障碍患者是糖尿病及其并发症的高危人群。缺乏运动和久坐行为是2型糖尿病(T2DM)共病的共同行为风险因素。然而,体力活动(PA)对T2DM的保护作用是否受肥胖和年龄影响,及其具体剂量-反应关系尚不明确。方法 本研究利用2017-2020年美国国家健康与营养调查(NHANES)中5042名成年人的横断面数据,采用加权多变量逻辑回归和限制性立方样条(RCS)模型分析PA与T2DM风险的关系,并评估BMI和年龄的潜在效应修饰作用。结果 调整混杂因素后,较高水平的PA与较低的糖尿病风险独立相关。RCS剂量-反应分析显示显著的效应修饰:PA的保护作用呈现明显的"BMI梯度",在正常体重人群中最强,超重人群中减弱,肥胖人群中消失。同时观察到"年龄分层"现象,保护作用在中年人群中最强,青年人群中呈边缘显著趋势,老年人群中无显著关联。结论 本研究证实PA对T2DM的保护作用受肥胖和年龄共同修饰。未来预防策略应从普适性建议转向基于BMI和年龄的精准分层指导,这对精神障碍患者的整合照护具有重要意义。 | |
| 索马里与疟疾诊断和青蒿素部分耐药性相关的基因突变出现:一项基因组监测研究 | Arale, A. M. | 2026-07-21 | 基于富组氨酸蛋白2(HRP2)的快速诊断检测(RDT)是非洲疟疾病例管理的核心手段,但当恶性疟原虫缺乏pfhrp2或pfhrp3基因时,该检测会失效。厄立特里亚、埃塞俄比亚和吉布提已报告广泛基因缺失,但索马里此前缺乏系统性数据。2023年5月至10月,我们在索马里7个地区的8家医疗机构收集了7148份疑似疟疾患者的干血斑(DBS)样本。现场进行了HRP2/全乳酸脱氢酶(LDH)RDT检测和显微镜检查,并从301份RDT阳性及173份RDT阴性DBS样本中提取DNA。采用靶向pfldh、pfhrp2和pfhrp3的多重定量PCR检测,通过ΔCt差值推断混合感染,识别缺乏pfhrp2或pfhrp3扩增的pfldh阳性样本中的基因缺失。在474份分析样本中,301份(4.2%,95% CI 3.7-4.7)为RDT或显微镜阳性,159份(33.5%)经qPCR确认为pfldh阳性。其中6份(3.8%,95% CI 1.4-8.1)携带pfhrp2缺失,59份(37.1%,95% CI 29.6-45.1)携带pfhrp3缺失。11例感染(6.9%,95% CI 3.5-12.1)出现RDT结果不一致(HRP-/LDH+或RDT阴性但pfldh阳性)。缺失在Dolow、Luq和Bosaso地区最为常见。单一分离株携带pfk13 R622I突变,确认索马里Gedo地区Dolow首次出现青蒿素部分耐药相关突变。索马里导致RDT假阴性结果的pfhrp2/3缺失率仍较低,其置信区间与更换RDT的5%政策阈值重叠,表明存在不确定性,需更大规模评估。Pfhrp3缺失广泛存在,削弱了基于HRP2检测的诊断冗余性。多数携带缺失的寄生虫仍可通过全LDH检测线检出,降低了即时临床风险,但导致恶性疟原虫被系统性误判为非恶性疟原虫感染。这些发现支持继续使用HRP2/Pan-LDH RDT,但需关注高风险区域,并强调需定期开展扩大分子监测以追踪流行趋势,从而及时调整未来诊断政策。 | |
| 多组学分析揭示衰弱、慢性疼痛和类风湿关节炎之间的双向遗传联系及趋同的炎症-神经元特征 | Flint, J. P. | 2026-07-21 | 摘要 背景:衰弱反映了生理储备能力下降及对应激源的易感性增加,是衰老的关键生物学标志。然而,衰弱与慢性炎症状态之间的分子及因果机制仍不明确。方法:我们整合孟德尔随机化、配对全基因组关联分析和表观遗传-蛋白质预测,解析衰弱、慢性疼痛和类风湿性关节炎之间的双向生物学通路。结果:在九个遗传定义的衰弱表型中——包括六个领域特异性因子、一个一般性衰弱因子及两个累积指数(衰弱指数和Fried衰弱评分)——孟德尔随机化揭示了慢性疼痛和类风湿性关节炎对衰弱的广泛因果效应。慢性疼痛的遗传易感性显著增加了累积衰弱指标(衰弱指数和Fried衰弱评分)及残疾相关衰弱领域(F6)的严重程度,其中对衰弱指数的影响最强(β=0.70,p=7.9×10⁻⁵²),而累积衰弱也增加了疼痛风险(β=0.37,p=2.6×10⁻¹³),支持双向反馈模型。类风湿性关节炎表现出更选择性效应,增加了累积衰弱(衰弱指数和Fried衰弱评分)及残疾相关衰弱(F6),而一般性衰弱因子增加了类风湿性关节炎易感性(OR=4.59,p=9.5×10⁻⁸)。值得注意的是,多病共存相关衰弱领域对类风湿性关节炎风险呈反向效应(OR=0.65,p=0.0078),提示晚期衰弱状态下的免疫适应或耗竭。配对全基因组关联分析和精细定位揭示了连接炎症、代谢及神经结构通路的共享因果位点——SLC39A8、NLGN1、IL2RA、ERBB3和MAGI3——凸显神经免疫和突触过程作为衰老的汇聚通路。表观遗传-蛋白质组学分析进一步识别出两个对立轴:炎症和补体蛋白(CRP、C5、CCL18、STC1)与衰弱正相关,而神经元粘附和细胞外基质蛋白(NCAM1、CNTN4、NTRK3、ADAMTS13)则赋予韧性。结论:这些发现将衰弱重新定义为炎症与结构维持之间的生物学动态界面,其中对立分子通路塑造了脆弱性与韧性。这一整合框架凸显衰弱既是生物标志物也是潜在干预靶点,将炎症失调与功能性衰老的可调控轨迹联系起来。 | |
| 在糖尿病预防项目结果研究中实施国家阿尔茨海默病协调中心统一数据集(v3) | Doherty, L. | 2026-07-21 | 引言:糖尿病预防计划(DPP)是一项旨在预防糖尿病前期成人发展为2型糖尿病(T2D)的随机临床试验。DPP结局研究(DPPOS)是该队列的30年随访研究,重点关注T2D、糖尿病前期及相关并发症。认知评估始于2009年,并于2022年扩展至检查幸存队列的认知障碍,包括阿尔茨海默病(AD)及AD相关痴呆(ADRD)。为支持这些目标,DPPOS于2022年实施了国家阿尔茨海默病协调中心统一数据集第3版(NACC-UDSv3)——即阿尔茨海默病研究中心使用的标准化框架,以实现与NACC的数据共享。这些表格与DPPOS中实施的认知测试互为补充。我们旨在将NACC-UDSv3整合至现有纵向DPPOS框架中,同时保持其结构完整性,并开发自动化报告以简化认知结局判定流程。 方法:将16份NACC-UDSv3数据表中的项目与DPPOS已收集项目进行比对,整合重叠相似项目,补充缺失的NACC-UDSv3项目,并创建与NACC-UDSv3协调统一的数据集。采用MIDAS(乔治华盛顿大学多模态集成数据采集系统)将表格适配为电子数据采集(EDC)格式。自动化报告整合当前及既往神经心理学评分以支持判定。在DPPOS-AD/ADRD研究首轮中,通过MIDAS实施的协调统一DPPOS与NACC-UDSv3数据,成功完成了1561例认知判定。 讨论:DPPOS-AD/ADRD项目证明,NACC-UDSv3可成功整合至非专为AD/ADRD研究设计的长期纵向队列中。数据协调统一、电子采集及自动化判定流程可为其他希望纳入NACC-UDSv3以符合国家AD/ADRD研究标准的队列提供实用框架。 | |
| 孟德尔随机化研究中暴露与结局的可遗传混杂 | Sanderson, E. | 2026-07-21 | 孟德尔随机化(MR)利用遗传变异推断暴露因素对结局的因果效应,其前提假设是这些变异仅通过暴露因素影响结局。然而,与暴露和结局的可遗传混杂因素相关的遗传工具变量可能违反这一假设,破坏基因-环境等价性并导致MR效应估计偏倚。随着全基因组关联研究样本量的增加,效应量较小的遗传工具变量被识别为与性状相关。本研究通过模拟实验和评估C反应蛋白对2型糖尿病影响的应用实例,证明效应量较小的变异更易受可遗传混杂因素影响,导致常见MR方法产生偏倚的因果估计。这种偏倚方向与线性回归中观察到的暴露与结局混杂关联方向一致,但通常幅度更大,且在多类常用MR估计方法中方向一致,可能导致对结果产生误导性信心。研究表明,通过多变量MR纳入已知或疑似可遗传混杂因素,或应用Steiger过滤可减轻这种偏倚,而某些旨在处理相关多效性的方法有时无法消除该偏倚。这些发现强调了在MR分析中评估和校正可遗传混杂因素对提高因果推断可靠性的重要性。 | |
| 用于改进血培养检测靶向性的机器学习模型 | Forrest-Hammond, R. W. | 2026-07-21 | 背景 血流感染是导致死亡的主要原因,但主要检测方法血培养的阳性率低(<10%),且周转时间为24-48小时。许多血培养取自感染风险低的患者,而部分血流感染被延迟诊断或完全漏诊。我们旨在开发并外部验证机器学习模型,以改善血培养检测的针对性。方法 在这项回顾性队列研究中,我们使用了2016年1月1日至2025年3月17日期间,来自大型多院区NHS信托机构(牛津大学医院;牛津郡感染研究数据库)在培养采集时常规收集的临床和实验室数据。纳入所有成人和儿童的血培养。使用时间分割(2024年1月1日前训练,之后为保留测试集)训练XGBoost模型,预测病原性血培养阳性。外部验证使用伦敦大学学院医院急诊科数据(2019年5月1日至2024年4月30日)。额外分析考察了将血培养重新分配至最高风险未入院患者。结果 共纳入294,064份培养(阳性率5.6%)。在时间保留测试集(n=46,339)中,AUROC(受试者工作特征曲线下面积)为0.853(95% CI 0.846-0.860),在急诊科患者中升至0.876,模型校准良好(斜率1.046)。外部验证(n=37,326)中,AUROC为0.847(95% CI 0.839-0.856),校准度保持。在模拟的资源中性重新分配中,用最高风险的未检测急诊入院替代10,000份最低风险送检培养,可额外获得627份阳性培养(产量相对增加28.3%)。当限制于培养采集时可获得的数据时,性能下降(AUROC 0.769,95% CI 0.760-0.779)。解释 基于广泛可用、常规收集数据构建的外部验证且校准良好的机器学习模型,可在不增加检测量的情况下提高血培养产量,支持NHS各院区资源中性的诊断管理。 | |
| 血浆pTau217作为路易体病临床进展的预后、监测和风险分层生物标志物 | Lorkiewicz, S. A. | 2026-07-21 | 背景与目的:虽然血浆磷酸化tau-217(pTau217)能检测路易体病(LBD)中伴随的阿尔茨海默病(AD)神经病理改变,但其与长期临床结局的关系仍不明确。本研究旨在评估血浆pTau217作为LBD认知与功能衰退预后、风险分层及监测生物标志物的价值。方法:本前瞻性纵向研究纳入2015-2023年入组的斯坦福阿尔茨海默病研究中心参与者,包含血浆pTau217数据及LBD谱系、AD谱系或健康对照(HC)的临床诊断。为评估预后和监测效用,分别采用线性混合效应模型检验血浆pTau217基线水平及纵向变化(2-5年)与日常功能(临床痴呆评定量表-总分[CDR-SB])、整体认知(蒙特利尔认知评估[MoCA])及5项领域特异性认知指标的纵向变化(2-8年)的关联。风险分层方面,基于淀粉样蛋白PET衍生的LBD特异性截断值定义基线血浆pTau217状态,通过独立线性混合效应模型和生存模型分析异常水平参与者是否表现出更快的临床进展。结果:共纳入501名参与者(平均[SD]年龄=71.1[8.5]岁;51.5%为女性),包括LBD组(n=131)、AD组(n=133)和HC组(n=237)。在LBD中,较高的基线血浆pTau217与更快的CDR-SB升高(β=0.30;95%CI:[0.14,0.45];p<0.001)、MoCA下降(β=-0.35;95%CI:[-0.57,-0.13];p=0.002)及认知指标下降(所有p≤0.028)相关。与pTau217正常参与者相比,基线pTau217异常者CDR-SB年增长速度快0.85分(95%CI:[0.56,1.15];p<0.001),MoCA年下降速度快0.87分(95%CI:-1.38,-0.37;p=0.001),认知指标下降更快(所有p≤0.018),且诊断进展为轻度认知障碍或痴呆的风险增加三倍(HR=3.41;95%CI:[1.60,7.28];p=0.002)。更快的纵向pTau217升高与更快的CDR-SB升高相关(β=0.24;95%CI:[0.10,0.38];p=0.003)。讨论:血浆pTau217是LBD临床进展中具有前景的预后、风险分层及监测生物标志物,凸显其在混合病理群体临床实践及试验中的应用价值。 |