2026-07-04 每日论文
| 来源 | 独立页面 |
|---|---|
| arXiv | arXiv |
| bioRxiv | bioRxiv |
| medRxiv | medRxiv |
arXiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| WorldDirector:构建具有持久动态记忆的可控世界模拟器 | Hanlin Wang | 2026-07-02 | 我们提出WorldDirector,一种高可控性的视频世界模型框架,专为持久动态物体记忆与无限制视角探索设计。不同于现有将物理动态与像素渲染纠缠、依赖连续视觉观测维持运动的世界模型,我们的框架明确解耦语义运动编排与视觉生成。通过利用大语言模型协调3D轨迹与相机运动,进而将这些编排轨迹作为视频生成的控制信号,我们的方法确保了严格的物理逻辑与外观稳定性——即使动态实体在长时间脱离视野后重新进入场景,也能成功保留其精确视觉身份。实验结果表明,该方法支持以空前的可控性与持久动态物体记忆能力合成复杂且长时的事件。项目页面:https://worlddirector.github.io/ | |
| 对齐是X到4D生成所需的一切 | Qiaowei Miao | 2026-07-02 | 生成扩散模型在多模态控制下合成高质量图像、视频和3D内容方面表现出色。然而,由于构建多样化数据集的高成本和现有方法的有限可扩展性,任意用户定义模态到4D(X到4D)生成仍具挑战性。本文提出Align4D,一个灵活框架,可将任意模态输入转化为连贯的视频-3D对,利用视频引导4D运动,借助3D数据塑造4D几何。Align4D引入三项关键技术:(1)物体距离对齐,分别搜索视频对齐和多视图对齐的物体距离(VAOD/MAOD),以协调4D渲染与视频及多视图扩散模型的先验;(2)运动-几何联合对齐,通过同步视频和3D输入约束已知和未知视图,确保4D生成一致性;(3)异步优化,解耦高斯属性与变形网络训练,提升运动与几何保真度。我们进一步提出X4D数据集,整合提示、图像、视频和3D数据用于基准测试。在X4D和Consistent4D上的实验表明,Align4D在X到4D生成中实现了最先进的质量和一致性。项目页面:https://miaoqiaowei.github.io/Align4D/。 | |
| PointDiT:用于单目几何估计的像素空间扩散 | Haofei Xu | 2026-07-02 | 当前最先进的单图像三维重建方法通常依赖复杂的混合架构和损失函数,或通过将几何信息压缩至潜在空间来利用预训练的潜在扩散模型。本研究表明,此类架构开销与复杂的损失设计并非必要。我们提出一种极简的像素空间扩散Transformer,基于普通ViT构建,直接对原始三维点图块进行操作,并以预训练DINOv3的图像令牌为条件。与现有潜在扩散方法不同,我们从头训练扩散主干网络,无需点图分词器。尽管结构简单,该方法在超越复杂潜在扩散模型的同时,显著简化了混合替代方案。值得注意的是,它能够生成更清晰的几何结构,并在高度模糊区域(如透明物体)中展现出更强的鲁棒性。 | |
| 持久状态AI控制中的分布式攻击 | Josh Hills | 2026-07-02 | 随着AI编程代理的自主性不断增强,它们越来越多地以迭代方式发布代码,代码库在多次会话中持续存在。这种持久性创造了一个新的攻击面:一个偏离目标或遭受提示注入的代理可以将攻击分散到多个拉取请求中,并选择自然掩护最佳的拉取请求来释放其恶意负载。为研究由此产生的动态机制,我们引入了迭代式氛围编程这一AI控制研究场景,旨在安全部署能力强大但可能不可信的AI。在迭代式氛围编程中,编程代理在持久化代码库中通过一系列拉取请求构建软件,同时执行隐蔽的辅助任务。我们的基准测试包含两类任务:命令行工具和Flask网络服务,共20种任务变体。我们使用Claude Sonnet 4.5作为攻击代理,GPT-4o作为监控器。我们将渐进式攻击(将辅助任务分散到多个拉取请求中)与非渐进式攻击(集中在单个拉取请求中)进行比较。没有任何单一监控器能同时有效应对这两种攻击:哪种策略能实现最佳规避(成功执行任务同时避开监控)取决于监控器类型,因此防御者无法用单一监控器同时阻断渐进式和非渐进式攻击。高规避率(>=65%)在不同模型攻击代理后端(Sonnet 4.5、Gemini 3.1 Pro、Kimi K2.5)中普遍存在,证实这是持久状态攻击面的固有属性,而非单一模型的能力特性。在最新监控模型上规避率依然很高,且对于能力更强的模型,渐进式与非渐进式规避之间的差距进一步扩大。我们引入了一种带状态链接追踪器的监控器,可跨拉取请求追踪可疑行为的累积。在两类任务中,该监控器检测渐进式攻击的效果显著优于仅查看累积历史记录的差异监控器。将这种更强监控器与轨迹监控器组合成四监控器集成系统后,渐进式攻击的规避率从最弱标准差异监控器下的93%降至47%。 | |
| LACUNA:评估大语言模型遗忘定位精度的测试平台 | Matteo Boglioni | 2026-07-02 | 大型语言模型会记忆敏感训练数据,包括个人身份信息(PII),这催生了对可靠事后移除方法的迫切需求。遗忘学习已成为一种有前景的解决方案,当前最先进方法通常遵循"先定位、后遗忘"的范式,针对特定模型参数进行操作。然而现有基准仅在输出层面评估遗忘效果,无法判断遗忘是否真正从模型参数中擦除知识,抑或只是掩盖了知识——这种担忧因重浮现攻击的成功而加剧。为填补这一空白,我们提出LACUNA:首个具备真实参数级定位能力的遗忘测试平台。LACUNA通过掩码持续预训练,将合成个体的PII注入基于OLMo的1B和7B模型的预设参数中,从而直接评估遗忘方法是否精准作用于存储知识的权重。我们利用LACUNA对当前最先进的遗忘方法进行基准测试,发现尽管这些方法在输出层面表现优异,但实际定位精度极低且易受重浮现攻击。进一步研究表明,当定位成功时,即使简单的基于梯度的遗忘方法也能实现强力擦除效果并抵御重浮现攻击,这凸显了精准遗忘的重要性。我们开源LACUNA以补充行为评估,推动基于定位的鲁棒遗忘技术进一步发展。 | |
| 程序即权重:一种面向模糊函数的编程范式 | Wentao Zhang | 2026-07-02 | 许多日常编程任务难以通过纯粹的规则实现,例如对重要日志行进行告警、修复格式错误的JSON或按意图对搜索结果排序,这些任务正越来越多地被外包给大型语言模型API,但代价是牺牲本地性、可复现性和成本。我们提出模糊函数编程:将此类函数从自然语言规范编译为紧凑的本地可执行神经工件。我们通过程序即权重(PAW)实例化这一范式,其中基于FuzzyBench(我们发布的包含1000万示例的数据集)训练的40亿参数编译器,为冻结的轻量级解释器生成参数高效适配器。执行PAW程序的6亿参数Qwen3解释器,其性能与直接提示Qwen3-32B相当,但推理内存仅为其约五十分之一,且在MacBook M3上以30 tokens/s的速度运行。PAW将基础模型从每次输入的问题求解器重新定义为工具构建器:每次函数定义时调用一次,生成一个可重复使用的小型工件,后续每次函数应用的调用成本低廉且可离线运行。 | |
| 大型语言模型的在线安全监测 | Mona Schirmer | 2026-07-02 | 尽管经过对齐训练,大语言模型在部署时仍易产生不安全输出。因此,在线监控输出并在无法确保安全性时触发警报至关重要。我们研究了一种简单的实时监控器,通过阈值化处理将外部模型的验证信号转化为警报决策,并利用风险控制校准阈值。在数学推理与红队测试数据集的实验中,我们证明这种简单设计与基于序贯假设检验的先进监控器相比具有同等竞争力。 | |
| ReContext:递归证据重放作为大语言模型的长上下文推理工具 | Yanjun Zhao | 2026-07-02 | 理解和推理长上下文已成为在现实应用中部署大型语言模型(LLM)的关键需求。尽管近期LLM支持越来越长的上下文窗口,但它们往往无法利用输入中已有的相关证据,暴露出上下文访问与有效上下文利用之间的差距。本文提出RECONTEXT(Recursive Evidence Replay as LLM Harness for Long-Context Reasoning),一种无需训练的长上下文推理改进方法。RECONTEXT利用模型内部相关性信号构建查询条件化的证据池,并在最终生成前重放该证据池,同时保留完整的原始上下文。这种递归选择过程将证据组织与答案生成分离,无需训练、外部记忆或上下文剪枝。我们还基于联想记忆提供了理论分析,将上下文表征为记忆存储,问题视为检索线索,注意力视为线索-痕迹关联,重放视为痕迹再激活。在八个128K上下文长度的长上下文数据集上的实验表明,RECONTEXT在Qwen3-4B、Qwen3-8B和Llama3-8B上持续提升证据利用率,并在三个骨干模型上均取得最佳平均排名。代码已开源:https://github.com/Yanjun-Zhao/ReContext。 | |
| 从SRA到Self-Flow:数据增强还是自监督? | Dengyang Jiang | 2026-07-02 | 表示对齐已成为加速扩散变换器训练并提升生成质量的有效方法。近期自对齐方法(如SRA和Self-Flow)通过将扩散模型内部的对齐机制构建为自包含形式,进一步消除了对外部预训练编码器的依赖。然而,从SRA到Self-Flow的改进机制——双时间调度——尚未得到充分检验:Self-Flow将其性能提升归因于不同噪声层级token间的交互作用,其中更干净的token有助于推断噪声更重的token。本研究重新审视这一解释,探究性能提升是否源于沿噪声维度的数据增强。为解耦这些因素,我们引入注意力分离机制,该机制在保持与Self-Flow相同的双时间步输入的同时,阻断分配给不同噪声层级的token间的注意力交互。令人惊讶的是,移除这种交互不仅不会降低性能,甚至可能提升性能,这表明从SRA到Self-Flow的改进主要来自数据增强。此外,我们证明注意力分离本身通过将单张图像分割为多个有效训练部分来扩展训练数据,从而产生增强效果。基于这些发现,我们将自表示对齐与双时间步及注意力分离增强相结合,并在ImageNet上验证了该设计的有效性。 | |
| 当无人注视时,LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现 | Arman Ghaffarizadeh | 2026-07-02 | LLM智能体将越来越多地在具有社会结构的环境中运作,其中角色、受众和关系背景会影响言论的利弊得失。我们研究这种社会结构(在提示中没有任何明确目标的情况下)是否会改变智能体在公开场合的表达内容,相较于同一条件下通过非正式渠道获取的回应。我们引入了一个双通道辩论框架,智能体在此框架中生成公开言论并进入共享历史记录,同时记录非正式回应但不会向其他参与者展示。在10个模型、3个场景以及每个场景的5个变体中,对齐诱导设置使目标智能体产生系统性的公开-非正式分歧,其决策分歧从约3%的基线上升至约40%。这一效应在四项综合分析中保持一致:立场、语义相似性、自然语言推理和调查回应。在某些情况下,非正式回应明确将公开迎合归因于关系压力,例如职业风险或赞助义务。研究结果表明,智能体评估应超越明确目标,检测涌现性目标。我们提出了一个双通道评估框架和补充性行为测量方法,以操作化这一评估。 |
bioRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| iPSC神经退行性疾病计划亨廷顿病同源CAG重复iPSC细胞系 | Salazar, L. | 2026-07-04 | 结构化摘要 研究目的:在KOLF2.1J背景下生成表达HTT蛋白中21、56和79个谷氨酰胺重复序列的iPSC系,以及HTT纯合敲除的iPSC系,作为iPSC神经退行性疾病倡议(iNDI)库中新增的疾病系列。 主要发现:所有iPSC系(包括表达79Q长重复序列或HTT KO的细胞)均能通过既定方案分化为纹状体神经元、皮层神经元、星形胶质细胞和小胶质细胞。描述了各分化过程中的常规质控染色和形态学分析。对分化细胞进行了一系列选定检测:表达扩展重复序列的星形胶质细胞表现出星形胶质细胞蛋白标志物表达改变和形态特征变化,纹状体神经元则显示DARPP-32/CTIP2共定位异常。纹状体神经元的mRNA测序结果显示,与未扩展重复序列相比,79Q和KO系的基因表达变化高度相似。 结论:KOLF2.1J同源CAG重复序列系列可作为研究亨廷顿病机制的资源,并通过iNDI库实现与其他神经退行性疾病的直接比较。 | |
| 运动神经元疾病中的ESCRT机制功能障碍:TSG101、CHMP2B和VPS4a差异调控TDP-43病理、自噬和外泌体生物发生 | Mohamed, L. A. | 2026-07-04 | 运动神经元病(MND)以上下运动神经元的进行性退化为特征,伴随TDP-43的胞质错误定位和过度磷酸化,这些标志性病理改变提示内溶酶体蛋白质稳态失衡。运输所需的内体分选复合物(ESCRT)通路调控多泡体(MVB)形成、溶酶体货物递送和自噬体闭合,但其在人类MND组织中的表达谱及对疾病病理的机制性贡献尚未明确。本研究发现MND患者死后运动皮层和脊髓中ESCRT蛋白存在亚基特异性失调:CHMP2B(ESCRT-III)在两个脑区均显著上调,而TSG101(ESCRT-I)和VPS37A(ESCRT-I)在运动皮层中显著下调,提示ESCRT网络存在区域特异性重塑。在衣霉素诱导的内质网应激模型中(使用NSC-34运动神经元样细胞和原代皮层神经元),TSG101过表达可降低总TDP-43及磷酸化TDP-43水平、抑制mTOR信号并恢复自噬流,而TSG101敲低则加剧TDP-43积累和胞质错误定位。CHMP2B调控选择性调节TDP-43磷酸化而不改变总TDP-43水平,这与独立于整体自噬的酪蛋白激酶1依赖性机制一致。TSG101和VPS4a均为维持神经元CD9四跨膜蛋白在早期内体定位所必需;在内质网应激条件下,两者缺失导致CD9重新分布至晚期内体和溶酶体区室。细胞外囊泡表征揭示功能分化:TSG101是通用外泌体生物发生所必需,而VPS4a ATP酶活性特异性介导病理TDP-43货物装载入EV。动态光散射证实内质网应激和ESCRT调控可产生条件特异性的EV尺寸和多分散性改变。这些发现确立ESCRT功能障碍作为MND发病机制的多层面贡献因素,并识别TSG101、CHMP2B和VPS4a为机制迥异的治疗靶点,值得临床前验证。 | |
| 阿尔茨海默病中空间蛋白质形态的定量分析 | McClatchy, D. | 2026-07-04 | 阿尔茨海默病(AD)的发病机制涉及脑蛋白质组复杂、多因素的改变,而传统的非分馏分析方法可能掩盖这些变化。蛋白质常以空间蛋白形式分布于多个亚细胞区室,但异常蛋白定位对AD发病机制的贡献仍知之甚少。为解决这一问题,我们从13例AD和14例非AD个体的死后海马组织中分离出四个亚细胞组分,并通过TMT-LC-MS定量分析了6,123种蛋白质。尽管75%的蛋白质在多个组分中被检测到,但78%与AD显著相关的改变仅局限于单一组分,表明亚细胞定位是疾病易感性的主要决定因素。不同组分间丰度模式的不一致性揭示了逆转录复合体定位异常、核转运功能障碍及不溶性蛋白积累,其中内体-溶酶体和蛋白质折叠通路受到最持续的干扰。为探究这些扰动如何随疾病进展演变,我们采用QUAD策略测量了APPswePS1delta9小鼠皮层两个组分在2、5和12个月时的蛋白质降解速率。降解速率在不同组分和基因型之间呈现年龄依赖性差异,跨数据集比较识别出六种在最早病理前时间点发生改变的蛋白质,提示囊泡运输和蛋白质稳态破坏是AD的起始特征。这些发现确立了空间蛋白形式作为病理分析的基本单元,并揭示了传统组织整体分析方法无法检测的疾病相关信号。 | |
| SMA beta爆发揭示了儿童预期性运动控制的不同机制 | Manyukhina, V. | 2026-07-04 | 为了产生流畅协调的动作,大脑会生成预期性姿势调节(APA)——一种前馈运动指令,在预测到的姿势干扰发生前进行抵消。尽管APA在生命早期就已出现,但其成熟过程会持续到成年早期,然而关于其潜在的神经机制仍知之甚少。本研究通过自然状态下的双手负荷提举任务,利用脑磁图技术探究了7-12岁儿童的预期性姿势控制。在该任务中,从对侧姿势性前臂提起负荷会导致肘部向上旋转,而这一旋转会被预期性地通过抑制肱二头肌姿势活动来抵消,从而稳定前臂姿势。令人惊讶的是,尽管儿童在抑制时机上表现出更大的变异性且前臂稳定性较差,但预期性抑制的机制与近期在成人中描述的机制一致:它由瞬态振荡性β爆发(19-24 Hz)介导,伴随辅助运动区(SMA)兴奋性降低(以高频伽马(90-130 Hz)功率抑制为指标),并受到来自外侧前额叶和腹侧前运动皮层的定向影响。然而,儿童的爆发频率较低,并且还招募了额外的APA机制:当19-24 Hz爆发与即时SMA抑制和更强的肌肉抑制相关时,较高频率的爆发(24-29 Hz)则与由α活动(8 Hz)介导的延迟(约100毫秒)SMA抑制相关,从而减弱了抑制后的前臂不稳定性。这些结果表明,处于中童期的儿童已具备类似成人的预期性抑制神经机制,同时额外招募了一种补偿机制来应对姿势不精确性,这为理解APA成熟的神经基础及其在神经发育障碍中的改变提供了新见解。 | |
| 当最亮并非最佳:基于镜面高光几何的光源估计 | Morimoto, T. | 2026-07-04 | 色彩恒常性通过减少光照影响,使我们能在不同光照条件下感知稳定的物体颜色。光照颜色的信息可以从白色表面或镜面高光中获取。"最亮即白色"的启发式规则常被用于光照估计模型中以识别光照颜色。本研究测试了一个替代假设:我们利用近端图像中的结构化变化来识别高光区域,即使这些区域并非场景中最亮元素。在计算机渲染场景中,我们操控了"最亮元素"和"高光几何"线索的可靠性,测试其对色彩恒常性任务的影响。每个场景包含一个由多个相同光谱特性的点光源照明的球面。该表面具有均匀光谱反射率,但带有噪声纹理,该纹理通过可变比例因子衰减反射率。我们测试了三种镜面反射程度:零(哑光)、低、中。观察者观看1.5秒动画后判断颜色变化源于光照变化还是材质变化。如预期所示,哑光表面的辨别表现接近随机水平。然而随着镜面反射程度增加,表现显著提升。观察者的表现优于仅依赖最亮元素的理想观察者模型。值得注意的是,当高光区域出现在纹理暗部时,观察者表现进一步提升——尽管"最亮元素"启发式规则会预测表现下降。当高光几何因相位扰乱难以识别时,观察者表现显著下降。这些结果表明,我们并非简单依赖最亮元素,而是利用近端图像中漫反射与镜面反射成分的规律性来解决表面与光照的歧义问题。 | |
| 首个染色体级别基因组组装及突尼斯硬粒小麦(Triticum turgidum subsp. durum)地方品种Chili和Mahmoudi的全面结构特征分析 | GDOURA BEN AMOR, M. | 2026-07-04 | 杜伦小麦(Triticum turgidum subsp. durum)是全球重要的通心粉和库斯库斯生产作物。Chili和Mahmoudi是具有历史意义的突尼斯地方品种,以卓越的籽粒品质、高蛋白质含量以及对干旱地中海气候的适应性而著称,但此前这两个品种均缺乏高质量参考基因组组装。本研究利用公开的PacBio HiFi长读长数据和Illumina Hi-C邻近连接数据(NCBI BioProject PRJNA1420514),采用hifiasm v0.25.0主模式进行组装,并通过YAHS v1.2a.2进行Hi-C支架构建。使用QUAST v5.3.0和BUSCO v5.8.0(胚胎植物_odb10谱系)评估组装质量。Chili基因组组装大小为10.84 Gbp(支架N50为756.2 Mbp,BUSCO完整度为99.4%),Mahmoudi基因组为10.70 Gbp(支架N50为756.8 Mbp,BUSCO完整度为99.3%)。Merqury v1.3确认两者均具有高碱基准确性(QV值分别为68.0和68.3),且k-mer完整度超过98%。通过wfmash进行的独立验证显示,在11,172个染色体与参考序列的比对中,平均比对一致性达98.6%。组装后特征分析涵盖GC含量分布、着丝粒结构、核糖体DNA阵列及结构变异。这两个组装体在连续性上显著超越现有杜伦小麦参考基因组,是首个北非杜伦小麦地方品种的染色体级别基因组资源。自动化Hi-C支架构建产生了少量跨越多条染色体的支架,我们通过基于Svevo v2参考基因组的比对引导拆分方法进行解析,最终每个地方品种获得14条染色体级别的假分子(最大分别为Chili 858.7 Mbp,Mahmoudi 868.1 Mbp)。组装体及假分子数据可通过Zenodo获取(10.5281/zenodo.20366290)。整个工作流程在公共Galaxy Europe平台上可重复执行,证明无需本地高性能计算基础设施即可实现参考级别的植物基因组组装。 | |
| 细胞命运设计中的非平衡扰动动力学 | Peng, Q. | 2026-07-04 | 大规模单细胞扰动测序为构建虚拟细胞提供了前所未有的机会,可用于计算机模拟细胞响应及最优干预的逆向设计。然而,现有扰动响应模型大多将细胞响应视为转录组状态的物质守恒变化,但单细胞扰动测量本质上具有非平衡性:恢复的终点群体既受技术采样影响,也受生物扰动诱导的增殖、凋亡和选择作用塑造。本文提出U-Pert——一种非平衡生成框架,能够从非配对单细胞快照中学习条件依赖和情境依赖的扰动动态。U-Pert联合建模转录组状态转变与细胞数量动态,实现对未知扰动和情境的可扩展稳健正向预测,以及逆向设计筛选满足用户定义转录组或群体水平目标的理想遗传或药物干预方案。在受控模拟、遗传扰动基准测试、sciPlex3药物响应及PBMC细胞因子扰动实验中,U-Pert成功预测未知响应,捕捉分子与丰度双重变化,并完成靶向基因表达程序与细胞类型组成的逆向设计。结果表明,细胞丰度是扰动表型的核心组成部分,为虚拟细胞建模和扰动细胞命运设计提供了质量感知框架。 | |
| 高置信度蛋白质甲基化图谱助力AI驱动甲基化肽段检测 | Wang, S. | 2026-07-04 | 赖氨酸和精氨酸甲基化调控染色质动态、转录及细胞信号传导,然而基于质谱(MS)对该修饰进行高置信度检测和定位仍具挑战。我们采用开放标准化工作流程重新分析了八个公共人类甲基化富集数据集,该流程整合了通过Trans-Proteomic Pipeline进行的数据库搜索,并结合基于诱饵的统计方法独立估算错误定位率(FLR)。由此构建的高置信度人类甲基化图谱包含1,021个蛋白质上的1,828个位点(57个甲基赖氨酸、1,771个甲基精氨酸),并按金、银、铜三个置信等级分类。该位点数量远少于既往研究报告,反映了严格FLR控制的应用,以及我们推测的既往分析中可能存在的高假阳性发现。随后我们利用该资源改进了一种基于深度学习的甲基化肽段检测方法。通过重新分析三个小鼠甲基化富集数据集以扩充训练集,并采用迁移学习对磷酸化蛋白质组学训练的AHLF(肽段碎裂自适应学习)模型进行微调,创建了AHLF-Methylation模型。该模型在人类质谱数据上达到平均ROC-AUC值0.824,在人类-小鼠混合质谱数据上达到0.829。该图谱可通过PTMeXchange和PRIDE获取,经整理的位点证据已整合至UniProt和PeptideAtlas。 | |
| 成人脑细胞类型分辨的microRNA图谱揭示衰老相关特征 | Dubnov, S. | 2026-07-04 | 背景:微小RNA(miRs)在从神经发生到神经系统疾病等多种脑部过程的调控中发挥作用。尽管miRs已被证实参与细胞类型特异性调控,但由于单细胞小RNA测序的技术限制,大多数研究仍基于全组织批量分析。因此,脑部miRs的细胞类型特异性特征仍不明确,限制了我们对其功能的理解。结果:为构建人脑中miRs的全面细胞类型解析图谱,我们从新鲜神经外科手术脑样本中分离出神经元、星形胶质细胞、小胶质细胞和少突胶质细胞,并通过RNA测序分析其小RNA谱系。结果显示miR表达存在显著的细胞类型特异性差异,发现了新型细胞类型特异性miR标志物,并揭示了基因组位点对细胞类型特异性的贡献。我们还表征了链偏好性和isomiR加工的细胞类型特异性模式。此外,我们探索了另一类小非编码RNA——tRNA衍生片段的细胞类型依赖性谱系,发现与胶质细胞相比,神经元中5'-tRNA半分子显著富集。最后,该图谱资源使我们能够识别与脑衰老相关的miR程序,并解析其细胞类型来源。结论:我们证实人脑miRs在表达水平上表现出显著的细胞类型特异性差异,同时链偏好性和isomiR丰度存在较温和的差异。此外,我们的图谱及其配套统计工具为miR细胞类型富集分析及解析人脑中miRs的细胞类型来源提供了公开资源。 | |
| 在Jukes-Cantor模型下系统发育Level-2网络的可识别性 | Englander, A. K. | 2026-07-04 | 我们研究了在分子进化的位点独立模型下,通过分析系统发育网络从序列数据中的可识别性,探讨哪些进化历史可能从足够长的DNA序列中被重建。尽管该领域先前的研究已确立了系统发育树和一级网络(即无重叠网状循环的网络)的可识别性,但对于更复杂的网络结构知之甚少。在本研究中,我们将可识别性结果扩展到包含缠绕网状结构的网络类别。我们的主要结果表明,在Jukes-Cantor模型下,二元半定向二级系统发育网络(若满足无三角形且为强树子条件)具有一般可识别性。我们还强化了现有的一级网络可识别性结果,证明在Jukes-Cantor模型下,网状节点的数量具有一般可识别性。此外,我们提出了更通用的可识别性结果,这些结果不限制网络级别,并适用于Jukes-Cantor模型和Kimura-2-参数模型。具体而言,我们证明任何两个展示不同四叶子树(四重奏)集合的二元半定向网络都是可区分的。这对网络网状成分(blobs)的可识别性具有直接意义。我们证明,网络的树状blob结构(即全局分支结构)是可识别的,同时,对于边不交叉且分类群位于外部的网络,每个blob周围子网络的循环顺序也是可识别的。 |
medRxiv
| 标题 | 作者 | 发布日期 | PDF链接 | 摘要 |
|---|---|---|---|---|
| 家长报告问卷在儿童和青少年回避性/限制性食物摄入障碍大规模在线筛查中的验证 | Friskson, D. | 2026-07-04 | 目的:评估回避性/限制性食物摄入障碍(ARFID)筛查工具效度的研究仍然匮乏。本研究在基于人群的儿童样本中,评估了在线家长报告式ARFID筛查方法的诊断效能与效度。方法:参与者来自瑞典ARFID倡议(ARIES)队列,包含65名6-14岁儿童。家长完成三份筛查问卷(异食癖、ARFID及反刍障碍访谈-ARFID问卷[PARDI-AR-Q]、九项ARFID筛查量表[NIAS]及家长进食障碍检查问卷[PEDE-Q]),随后进行诊断性访谈(PARDI)。计算诊断效能指标(灵敏度、特异度、阳性预测值[PPV]及阴性预测值[NPV]),并通过问卷与访谈维度间的相关性评估聚合效度。结果:联合筛查算法展现出完美的灵敏度和NPV,表明能准确识别所有ARFID病例并排除非病例。特异度较高(0.83),PPV范围为0.91-0.95,在更保守的ARFID标准A4(心理社会功能损害)操作化定义下降至0.78。不同ARFID标准的诊断效能存在差异:医学锚定的标准A1-A3的PPV较低,但标准A4(心理社会功能损害)的PPV较高(0.95)。筛查工具与对应访谈维度间的相关性总体呈中至强相关,支持聚合效度。达到阈值ARFID标准的儿童在筛查中症状严重程度显著高于亚阈值病例。讨论:本研究结果支持在大规模儿科研究中使用多工具家长报告式ARFID筛查方法,并强调心理社会功能损害的核心地位,凸显了该标准标准化操作化的必要性。 | |
| 一种用于结直肠癌早期检测的稳健无细胞RNA方法 | Monteagudo-Mesas, P. | 2026-07-04 | 结直肠癌筛查仍受限于患者依从性及对早期病变的检测灵敏度不足。尽管液体活检已革新癌症诊断技术,但基于cfDNA的方法常因分析物浓度低而难以实现早期检测。本研究提出一种稳健的细胞游离RNA(cfRNA)检测平台用于结直肠癌早期筛查。通过回顾性队列(255例健康对照与250例结直肠癌患者),我们采用基于RUVg归一化策略的优化工作流程,有效去除血小板驱动的转录组噪声。鉴定出富集于关键结直肠癌相关生物学通路(包括炎症、上皮间质转化及代谢失调)的差异表达基因。基于这些特征训练的XGBoost分类器在交叉验证中平均AUC达0.92,验证队列中为0.89,在90%特异性下实现67%灵敏度。值得注意的是,该平台对早期癌症(I期和II期)检测效果尤为显著,在90%特异性下达到73.7%灵敏度。这些发现表明,cfRNA分析可为结直肠癌筛查提供强大的非侵入性正交方法,能够克服DNA检测方法在早期病变中的灵敏度局限。 | |
| 粘蛋白泛基因组中的复杂结构变异、系统发育及疾病关联 | Plender, E. G. | 2026-07-04 | 粘蛋白是大型糖蛋白,为上皮组织提供水合作用和屏障功能。尽管具有遗传异质性,所有粘蛋白都含有一个由可变数目串联重复序列(VNTRs)组成的大外显子。短读长测序限制了我们理解粘蛋白VNTR多样性,并使疾病关联研究面临挑战。我们利用296个长读长定相基因组组装来表征14个粘蛋白家族成员,在572个单倍型中实现了≥97%的准确率。系统发育单倍群分析揭示了显著的结构杂合性,其中MUC4具有最大的等位基因多样性(n=240个不同长度),MUC12具有最大的大小范围(Δ=55,233 bp;23,080个氨基酸)。十个粘蛋白显示出显著的人群分层(pFDR < 0.05)。在MUC4/MUC20位点,我们表征了高阶结构变异,包括复发性倒位、拷贝数变异和基因间转换。优化后的基因分型在10个位点上实现了≥95%的单倍群一致性。我们将此应用于4,637名深度表型化的囊性纤维化患者,发现短MUC1 VNTR与严重疾病之间存在显著关联(p=0.0056),证明了泛基因组在复杂位点基因分型和疾病发现中的实用性。 | |
| 超过5万名慢阻肺及非慢阻肺受试者中肺动脉大小的遗传决定因素 | Foris, V. | 2026-07-04 | 理由:肺动脉(PA)增大是与慢性阻塞性肺疾病(COPD)患者肺动脉高压及死亡率相关的非侵入性影像学生物标志物,但其遗传决定因素尚未完全阐明。目的:在COPD富集人群队列和基于人群的队列中,阐明PA大小的遗传结构。方法:我们利用COPDGene(n=9,418)和ECLIPSE(n=1,859)的全基因组测序数据,以及英国生物银行(n=37,073)的基因型推算数据,对PA直径进行全基因组关联分析。在弗雷明汉心脏研究(FHS;n=3,289)中验证先导变异,将四项研究纳入联合荟萃分析,并通过条件分析识别独立信号。通过编码变异注释、共定位和整合调控证据优先排序候选效应基因。测量与主要结果:我们在39个基因座中识别出44个独立的全基因组显著PA直径信号,包括8个在FHS中验证的变异、FRMD4B、SLC20A2、BORCS7-ASMT和KCNRG附近的新关联,以及条件分析中的5个信号(含ANO1的多重信号)。遗传效应在不同影像学模态和不同COPD负担的队列中保持一致。效应基因优先排序确定了ABCC8、PDGFD、HMCN1、CCNE1和TBX20,涉及血管重塑、发育调控、平滑肌与内皮功能、离子通道信号及细胞外基质组织等通路。与脉压GWAS的共定位分析表明,肺血管生物学与系统性血管生物学存在大量共享因果变异。结论:在这项迄今最大规模的肺血管影像遗传学研究中,PA直径呈现多基因遗传结构,在不同影像学模态和不同COPD负担的队列中保持一致。优先排序的效应基因将罕见变异的肺动脉高压生物学与常见变异的系统性血管生物学联系起来。 | |
| 视网膜全转录组关联研究识别出新的阿尔茨海默病风险基因 | Zhang, Y. | 2026-07-04 | 引言:阿尔茨海默病(AD)是全球痴呆症的主要病因。视网膜与大脑共享分子通路,但目前尚无研究系统性地将视网膜基因表达与AD风险相关联。方法:我们利用两个独立的视网膜eQTL数据集(Strunz等,n=311;EyeGEx,n=406)和一项大型荟萃分析AD全基因组关联研究(GWAS)(Bellenguez等,111,326例病例,677,663例对照)开展转录组全关联研究(TWAS)。通过匹配eQTL面板策略,在独立阿尔茨海默病测序项目(ADSP)的GWAS中进一步验证相关基因。结果:以Bellenguez等研究作为发现队列,我们在两个eQTL面板中鉴定出62个AD相关基因,其中31个在ADSP队列中得到验证。研究结果突显了补体介导的免疫失调共享机制(CD55、CD46、TREM2),并为优先筛选AD发病机制的新型因果驱动因子(包括STYX和LRRC37基因家族)提供了功能性转录组学证据。讨论:视网膜数据捕获了AD核心遗传结构并揭示新型风险基因,凸显视网膜作为痴呆症研究中具有分子信息价值的组织。 | |
| 基于监督对比学习的可穿戴IMU步态信号数字生物标志物发现 | Mohtavipour, S. M. | 2026-07-04 | 可穿戴惯性测量单元(IMU)为临床人群的步态评估提供了实用且客观的方法。尽管已有多种手工设计的步态特征被提出,但这些特征可能无法完全捕捉与不同病理步态模式相关的多维信号特征。本研究提出了一种基于可穿戴IMU信号监督对比表示学习的数字生物标志物——嵌入距离步态生物标志物(EDGB)。我们开发了一个紧凑的多输入卷积神经网络,将原始加速度、角速度及其时间导数编码为32维潜在表征。基于健康、神经疾病和骨科疾病参与者的训练嵌入,计算了类别特异性原型。随后通过每个试验嵌入与学习到的群体原型之间的距离推导出EDGB。该架构在公开的Voisard临床步态数据集上进行了评估,采用受试者层级划分,保留20%的参与者用于测试,以防止重复试验间的数据泄露。在未见过的测试受试者中,该生物标志物区分健康与神经疾病、健康与骨科疾病、神经疾病与骨科疾病步态模式的AUC分别达到90.59%、88.47%和99.50%。该生物标志物还表现出显著的群体效应,临床类别解释了其71%的方差。可靠性分析显示重复试验间具有显著一致性,组内相关系数(ICC 2,1)为0.82,表明大部分变异反映的是受试者间差异而非受试者内试验间波动。 | |
| 小儿心脏手术中的微生物组-炎症轴:解码功能性细菌反应 | Qiu, H. | 2026-07-04 | 背景:儿童心脏手术后肠道损伤仍是一项持续挑战,导致先天性心脏病患儿发病率和死亡率增加,并给医疗系统带来沉重负担。目前尚不清楚儿童心脏手术及体外循环后促炎状态的关键驱动因素。理解先天性心脏病患儿术后肠道组成、肠道屏障功能及全身炎症反应中的关键组分,对改善预后至关重要。 方法:本研究为前瞻性研究,纳入0-5岁接受心脏手术的先天性心脏病患儿(体外循环组)或接受非心脏手术的非先天性心脏病患儿(对照组)。我们收集术前和术后的粪便及血浆样本,评估微生物组、代谢物、肠道屏障功能标志物及炎症细胞因子。同时收集临床变量以评估炎症标志物。通过两组间比较识别特征性标志物,建立独特的生物标志物谱。 结果:共纳入62例患者(体外循环组46例,对照组16例)。体外循环组术前即存在促炎微生物群增加和多样性降低,术后进一步恶化。与对照组相比,体外循环组促炎类花生酸增加,而肠道和心脏保护性短链脂肪酸减少。术后体外循环组促炎细胞因子增加,抗炎细胞因子减少。与对照组相比,体外循环组肠道屏障功能障碍标志物增加。中介分析显示,体外循环组微生物功能转变与PGE2升高和丁酸减少相关,进而与术后细胞因子和临床炎症标志物升高相关。 结论:我们揭示了先天性心脏病患儿心脏手术后独特的肠道微生物及代谢物谱与肠道通透性及全身炎症的关联,凸显该患者群体中独特的微生物组-炎症轴。进一步评估这些特征与因果关系的机制研究,将为改善患儿预后提供潜在干预靶点。 | |
| 识别可从替代治疗策略中获益的实施单位,以加速非洲盘尾丝虫病传播的消除。 | Ramani, A. | 2026-07-04 | 背景:世界卫生组织提出,到2030年应在12个流行国家验证盘尾丝虫病传播阻断(EOT)。在病例集中的撒哈拉以南非洲地区,尼日尔是目前唯一通过验证的国家。尽管实施了数十年的伊维菌素大规模药物分发(MDA),西非和中非的感染仍持续存在。为加速实现2030年及以后的EOT目标,需采用替代治疗策略(ATS)。方法:我们使用EPIONCHO-IBM传播模型,预测从2026年起,在19个撒哈拉以南非洲国家的1634个实施单位中,将微丝蚴流行率降至1%以下所需的年数。模型拟合了1975年、2000年和2018年基于地质统计的微丝蚴流行率数据,并预测至2025年的流行趋势。根据基线流行程度、干预历史、项目执行表现及当前(2025年)MDA频率(每年或每半年一次)对实施单位进行分类。对于当前策略下无法在2030年前达到微丝蚴流行率<1%的实施单位,我们模拟了2026年至2040年的ATS方案(增加治疗频率、提高覆盖率、采用莫西菌素MDA)。结果:在目前每年接受伊维菌素MDA的1486个实施单位中,45%需要ATS。低中度流行单位中,每半年一次伊维菌素的效果与改用每年一次莫西菌素相当;高度流行单位中,采用每半年一次莫西菌素效果更显著。在目前每半年接受伊维菌素MDA的148个单位中,24%可从ATS中获益,改用每半年一次莫西菌素是最优选择。结论:本研究更清晰地揭示了撒哈拉以南非洲地区最可能需要ATS的实施单位特征。在干预历史长的高度流行单位中,根据模型假设可能需要每半年一次莫西菌素MDA,但两种药物对雌性成虫永久性绝育效果存在显著不确定性。旨在实现EOT的国家计划需在方案选择与财政考量间取得平衡。实施研究对于将这些模型预测转化为国家政策决策至关重要,尤其是在不同干预策略产生相似流行病学效益的情况下。需开展重复莫西菌素MDA的经济与流行病学评估以指导决策。 | |
| 在科特迪瓦阿比让,通过家庭和母亲职业性固体燃料使用暴露于颗粒物的儿童中呼吸症状和功能障碍的患病率及决定因素——一项横断面研究 | Pajot, A. | 2026-07-04 | 摘要 背景 来自低收入和中等收入国家的儿童因肺部发育不成熟且靠近家庭污染源,尤其易受空气污染这一主要环境健康风险的影响。本研究旨在探讨通过家庭和母亲职业活动接触生物质燃烧对科特迪瓦阿比让贫困城市地区儿童呼吸健康的影响。 方法 2023年2月至12月,我们对来自使用生物质燃料烹饪(G1组)、从事职业鱼类熏制活动(G2组)或主要使用燃气进行家庭烹饪(G3组)的女性家庭的16岁以下儿童进行了一项横断面观察研究。通过标准化问卷评估报告的呼吸道症状,并通过肺功能测试(肺活量测定和Rint)评估肺功能损伤的存在。使用混合效应回归模型评估研究组与关键协变量对呼吸道症状和肺功能损伤的关联。 结果 在纳入的210名儿童中——119名(56.8%)为女性,中位年龄9岁(6-12岁),G1组82人(39.0%),G2组47人(22.4%),G3组81人(38.6%)——15人(7.1%)在过去12个月内报告喘息,82人(39.0%)报告夜间干咳,9人(4.9%)出现呼吸困难,5人(2.7%)在临床检查中有胸痛,报告呼吸道症状的儿童总体比例为43.8%(92/210)。在接受肺功能测试的176名儿童中,59人(33.5%)检测到肺功能损伤,包括G1组34人(45.9%),G2组8人(22.2%),G3组17人(25.8%)(p = 0.011)。研究组与呼吸道症状相关(G1 vs G3;aOR 3.82,95% CI 1.68-8.68;p < 0.001),也与肺功能损伤相关(p = 0.042)。女孩发生肺功能损伤的风险高于男孩(aOR 2.69,95% CI 1.24-5.80;p = 0.012)。母亲使用木炭或木材作为烹饪燃料的儿童出现呼吸道症状的几率更高(OR 2.61,95% CI 1.22-5.58;p = 0.013),但与未暴露儿童相比,未发现与肺功能损伤的关联(p = 0.459)。 结论 生活在贫困地区的儿童中,呼吸道症状和肺功能损伤非常普遍,尤其是当母亲使用木材或木炭烹饪时。迫切需要针对母亲进行有针对性的意识提升,并采取更广泛的干预措施减少贫困城市地区的家庭空气污染,以保护长期呼吸健康。 | |
| 专家评审的结直肠增生性息肉中FAPα阳性成纤维细胞可识别异时性腺瘤风险增加的患者:一项回顾性队列研究 | Fenie, N. | 2026-07-04 | 目的:锯齿状病变是结直肠癌的重要诱因,但常规处理小型远端增生性息肉时通常认为其风险较低。然而,监测指南对增生性息肉与无蒂锯齿状病变的界定存在不确定性,并建议对大型锯齿状病变缩短监测间隔。本研究旨在验证经专家复核的增生性息肉中,基质成纤维细胞表达的成纤维细胞活化蛋白α是否可作为后续肿瘤发生的风险分层指标。方法与结果:在单中心历史队列中,对64例患者的福尔马林固定石蜡包埋结肠组织(正常结肠10例;增生性息肉39例;低级别管状腺瘤6例;高级别管状腺瘤4例;腺癌5例)进行成纤维细胞活化蛋白α免疫组化检测(Abcam ab53066,1:200)。由两名盲法评估者在1000倍放大视野下随机选取20个区域,定量分析成纤维细胞活化蛋白α阳性基质成纤维细胞(组内相关系数0.93)。在39例经专家复核的初始增生性息肉患者中,通过结肠镜随访评估异时性腺瘤的发生情况(定义为与初始增生性息肉位于相同结肠区域:近端为升结肠,远端为降结肠)。每2年进行一次结肠镜随访,最长随访10年。ROC分析确定最佳阈值为≥9个成纤维细胞活化蛋白α阳性成纤维细胞(AUC 0.8658;灵敏度81.25%,特异度87.93%)。成纤维细胞活化蛋白α高表达状态(占增生性息肉的44%)与无肿瘤生存期缩短显著相关(log-rank p=0.0012):5年无肿瘤生存率41%对比成纤维细胞活化蛋白α无/低表达组的91%。多变量Cox回归分析显示,成纤维细胞活化蛋白α高表达状态仍是异时性腺瘤的独立危险因素(HR 4.5,95% CI 1.2-16.8,p=0.022)。结论:经专家复核的结直肠增生性息肉中,成纤维细胞活化蛋白α阳性成纤维细胞可识别异时性腺瘤的高风险亚组,提示基质活化标志物可作为可行的病理锚定分层工具。 |