跳转至

2026-10-06 每日论文

来源 独立页面
arXiv arXiv
bioRxiv bioRxiv
medRxiv medRxiv

arXiv

标题 作者 发布日期 PDF链接 摘要
世界模型在物理学中的最后考试 Mingju Gao 2026-10-06 PDF 视频世界模型能够生成视觉上逼真但物理上不一致的序列,这引发了人们对其在具身人工智能系统中用于预测和规划的可靠性的担忧。现有评估通常依赖基于模型的判断或参考视频,而直接的物理测试则主要聚焦于力学。我们提出了“世界模型物理终极考试”,这是一个基于测量的基准,用于评估视频世界模型中的物理一致性。该基准包含40项受控任务,涵盖力学、光学、流体、热学与相变现象、电磁学以及表面张力。每项任务将一张初始图像和一个生成提示与预定义的物理标准配对,从而能够在无需参考视频的情况下对可观测的物理关系进行可解释的测试。其评估器将任务可观测性筛选与任务特定的定量物理测量相结合。在1,280个视频上对八个视频生成模型进行的实验揭示了持续存在的物理不一致性以及任务之间的显著差异,最佳模型的总体得分为100分中的57.76分。对具有已知物理关系的合成视频进行评估,为测量模块在受控条件下的有效性提供了证据。在任务内排名和成对比较中,该评估器与人类判断的一致性也高于直接的视觉语言模型基线。通过将跨物理领域的覆盖范围与基于可测量证据的得分以及明确的测量局限性相结合,该基准为诊断物理不一致性并追踪朝着物理一致的视频世界模型所取得的进展提供了可解释的基础。
从单张图像构建罗马 Jiraphon Yenphraphai 2026-10-06 PDF 单图像场景生成旨在从单张图像生成完整的三维场景网格,包括相机未观测到的表面。尽管预训练的三维物体生成器编码了强大的形状先验,但它们主要针对固定规范体积中的孤立物体设计,并且由于户外场景的多样化三维数据相当有限,这些生成器大多聚焦于室内场景。在本工作中,我们提出了一种方法,重新设计这种以物体为中心的生成器,例如Trellis 2,使其能够同时适用于室内和户外场景,同时保留其先验。我们通过以下方式实现这一目标:(a) 将场景划分为相对于相机距离进行缩放的自适应块;近处的块具有较小的尺寸以保持更精细的细节,而远处的结构,例如建筑物,则由大块覆盖;(b) 使生成器通过提升图像特征并让模型感知自由空间、观测表面和未观测区域,来捕捉显式的二维-三维对应关系;(c) 合成约4,000个户外场景以扩展训练数据,因为现有的场景数据集大多是室内的。在Tanks and Temples、ScanNet++以及野外图像上的实验表明,我们的方法在室内和户外场景中的几何精度和感知质量方面均优于所有基线方法。
QF3:基于过滤Q梯度的快速流强化学习 Chung Min Kim 2026-10-06 PDF 流策略已成为从演示中学习机器人行为的标准策略类别,但强化学习对于改进预训练流策略或通过交互从头学习流策略仍然至关重要。我们提出了 QF3(带过滤 Q 梯度的快速流强化学习),一种在线离策略强化学习算法,它通过流匹配加上评论家的动作梯度来训练流策略,该梯度通过流输出的一步预测进行反向传播。为了将更新保持在评论家和该预测可靠的范围内,QF3 仅将评论家梯度应用于保持接近回放动作的动作维度。据我们所知,QF3 是首个从头训练人形机器人运动策略并将其零样本迁移到硬件的离策略流强化学习方法。结合高通量离策略训练方案,它训练人形机器人运动和运动跟踪策略的墙钟时间比 FPO++(一种最近的在线策略流强化学习方法)快 10 倍。我们进一步将 QF3 应用于在 ABC-Sim 和 Robomimic 任务上微调预训练的基于流的操作策略。这些结果表明,QF3 既能从头学习机器人策略,也能改进从演示中获得的策略。网站:https://qf3-rl.github.io/
共形预测集量化信息增益:一个理论视角 Kevin Zhang 2026-10-06 PDF 共形预测是一种流行的不确定性量化工具,它输出具有有限样本覆盖保证的预测集。虽然预测集大小常被用作不确定性的启发式度量,但这种解释的信息论基础仍然鲜为人知。在这项工作中,我们利用针对集合值预测量身定制的熵的决策论推广,提供了这样的基础。特别地,我们引入了一族基于共形预测集大小和覆盖率的广义信息度量。值得注意的是,香农互信息可以用这些度量给出精确的积分表示。然后我们表明,在标准分类设置中,额外信息带来的共形集大小缩减 (i) 被夹在该族中依赖于校准的成员之间,并且 (ii) 服从数据处理不等式,二者均在有限样本校准和模型误差项的意义下成立。总之,我们的结果在形式上将共形预测与经典信息论量联系起来,并证明了使用集合大小缩减作为信息增益度量的合理性。在实证方面,我们在 11 种分类设置中验证了我们的理论,并表明在贪心特征选择实验中,集合大小缩减和香农互信息可以对特征给出不同的排序。
PEARS:基于物理先验引导的高效自适应,通过失败推理与扩散引导实现触觉操作 Kun Song 2026-10-06 PDF 预训练机器人策略在部署过程中遇到分布外(OOD)条件时,性能可能会大幅下降,这促使人们通过真实世界交互进行后训练。然而,基于强化学习(RL)的后训练通常需要大量环境交互,这一负担在操作任务中尤为显著,因为每次试验可能缓慢、昂贵甚至具有破坏性。因此,我们提出 PEARS,一种物理先验引导的混合 RL 框架,用于在触觉反馈下对预训练策略进行样本高效的在线适应。在每个回合之后,其物理引导力推理(PFR)模块利用视觉语言模型(VLM)中编码的物理先验,从视觉结果和触觉交互历史中诊断失败,并更新适合任务的接触力边界。随后,一个高频混合力-位置控制器在接触过程中执行这些边界。作为补充,触觉条件扩散引导强化学习调整冻结流匹配策略的潜在噪声,以纠正自由空间运动和接触时机中的错误,而无需更新基础模型。在仿真中,PEARS 相比最强的逐任务基线将成功率提高了 12.4 至 37.4 个百分点。PEARS 还将达到某一成功阈值所需的交互回合数相比最快的基线减少了最多 53.2%。在真实世界实验中,PEARS 在白板擦除任务上达到 95% 的成功率,在移液管液体吸取任务上达到 90% 的成功率。这些结果表明,将 PFR 模块与策略引导相结合,可以加速适应,同时减少代价高昂的交互。项目网站见 https://song-kun.github.io/pears。
4D-HOF:用于前馈4D交互重建的手-物体流匹配 Shiqi Li 2026-10-06 PDF 现有的4D手-物体重建方法通常依赖于代价高昂的逐序列优化,而生成式方法一般从随机噪声合成交互,这可能导致交互预测不稳定。我们提出4D-HOF,一种前馈框架,能够从视觉基础模型产生的粗略但信息丰富的估计中重建4D手-物体交互。具体而言,我们学习一个条件流匹配模型,将基础模型导出的手-物体状态输运至交互流形,使模型能够以前馈方式校正平移、旋转和对齐中的误差。我们生成式表述的一个关键优势在于,它自然支持在输运过程中进行测试时引导。我们无需在重建后应用单独的事后优化,而是利用物理交互约束和观测到的2D证据直接引导演化中的生成状态,使重建作为生成过程本身的一部分得到细化。通过在不同数据集上训练生成模型,4D-HOF能够稳健地泛化到具有挑战性的野外场景。在域外基准上的实验表明,4D-HOF达到了最先进的性能,能够产生更稳定、更准确的4D手-物体重建。
IdeaAnchor:教LLM将文献转化为研究思路 Ziyu Chen 2026-10-06 PDF 科学研究通常始于综合一组相关论文中的思想,以识别空白并制定新方向。然而,训练语言模型执行这种基于文献的思想生成仍然具有挑战性,因为基于提示或反馈的现有方法缺乏关于论文应如何被综合的结构化监督。我们提出IdeaAnchor,一种训练LLM使用结构化规范作为特权信号来执行研究思想生成的范式。每个IdeaAnchor实例编码了每篇输入论文应如何被综合为一个成功思想,包括它们的功能角色、关系和目标综合标准。我们通过从已发表论文中挖掘实例来构建这一范式,捕捉真实思想如何从先前文献中涌现。然后,我们通过演示、自蒸馏和强化学习训练模型,并在推理时通过检索进一步增强生成。实验表明思想生成质量持续提升。我们的分析揭示了一种功能分解:基于锚点的训练增强创造性综合,检索增强细节阐述,而两者结合产生最佳性能。
DepthWorld:用于机器人操作的3D世界模型 Jai Bardhan 2026-10-06 PDF 世界模型为机器人领域提供了一种数据驱动的传统模拟器替代方案,其应用涵盖策略评估、改进与规划。所有这些用途都依赖于忠实的3D几何,然而当前基于视频的世界模型仅使用RGB进行训练,生成的推演逐帧看似正确,却无法组合成一致的3D世界。弥合这一差距需要在两个方面取得进展:面向操作的大规模3D监督,以及一种能够吸收这些监督而不破坏强大预训练视频先验的架构。我们提出了一种标定流水线,将学习到的立体深度与联合因子图相结合,汇集从同一物理机器人收集的所有回合,以恢复其共享运动学参数以及每个场景的外参。将其应用于DROID数据集,得到了DROID-3D,这是一个标定后的3D数据集,提供密集的度量深度和重新标定的多视角外参(在90%的回合中,外部相机的重投影误差小于0.7像素)。随后我们训练了DepthWorld,这是一个基于Stable Video Diffusion的世界模型,通过空间潜在分块联合预测多视角RGB和深度,同时保持预训练的变分自编码器(VAE)不变。在相同训练预算下,深度监督使RGB预测本身相比仅使用RGB的相同基线提升了+1.48 dB PSNR,同时为下游几何推理生成准确的度量深度。
ALIVE:面向首帧引导视频编辑的交互对齐物体插入 Zhenghong Zhou 2026-10-06 PDF 当前的视频编辑器可以插入物体,但往往难以让这些物体参与诸如被拿起或被操控等交互。我们提出了ALIVE,一个通过源视频内容进行连贯交互,使插入的物体“活起来”的框架,它仅使用编辑后的首帧和一个只命名所添加物体的指令。我们整理了35800个编辑对,将3D渲染、模型生成和真实世界视频与来自ROSE的通用编辑对相结合。每个编辑对在目标物体是否存在上有所不同,同时保持周围动作不变,从而教会编辑器协调的物体行为和源内容保持。我们进一步训练了一个视觉语言模型(VLM),以从相同的输入中预测交互引导。我们引入了ALIVE-interaction基准,使用统一的基于VLM的协议来评估交互保真度、源内容保持和视觉连贯性,并在通用视频物体插入基准上进行评估。在没有VLM引导的情况下,ALIVE在两个基准上分别将Overall较最强的已评估基线提高了43.9%和4.4%。VLM预测的引导在没有额外用户输入的情况下,进一步将ALIVE-interaction分数提高了0.95分。
Sherpa:教LLM自适应地教学 Weixian Xu 2026-10-06 PDF 大型语言模型已成为越来越有能力的问题解决者,但能够解决问题并不等同于能够教授问题。现有的将大语言模型训练为教师的方法依赖于演示、偏好数据或预先定义的教学标准,这些标准规定了什么是好的教学。然而,这些信号往往并不基于个体学生的学习成果,而有效的教学策略在不同学习者之间可能差异很大。为解决这一问题,我们提出了 Sherpa,一个多轮强化学习框架,它以大语言模型实例化多种学生原型,并以不同的学习偏好为条件,训练一个教师模型,通过直接最大化他们的学习成果来调整其教学。使用 Sherpa 训练的教师大语言模型使受教学生在所有原型上的表现平均提高了 20.5 个百分点。在 MathTutorBench 的评估下,Sherpa 将整体教学评分从 52.5% 提升至 79.2%,表明教学回应更好。我们的人类研究表明,在 79.6% 的成对比较中,训练后的教师比基础模型更受偏好。总之,Sherpa 训练大语言模型教师适应多样化的模拟学生,并更好地与人类教师保持一致,为 AI 导师教授真实学生铺平了道路。

bioRxiv

标题 作者 发布日期 PDF链接 摘要
自然视听加工中的两种皮层机制 Pushpita, S. N. 2026-10-06 PDF 理解人脑如何处理自然视听信息仍然是认知神经科学的核心挑战。进展受限于对复杂视听刺激建模的困难;因此,先前的工作在很大程度上依赖于简短的、受控的或单模态刺激,使得支持真实世界理解的皮层机制表征不足。尽管近期人工智能的进展使得能够从自然主义刺激中提取高维、时间分辨的特征,但皮层区域如何随时间展开动态地优先处理听觉和视觉信息仍 largely 未被探索。利用电影观看期间收集的大规模 fMRI 数据,我们开发了两种互补的基于预测的方法来绘制皮层上逐时刻的感觉处理:一种检测一个模态比另一个模态更好地预测某区域的持续时段,识别出在有意义的时间段内切换其所编码模态的区域;而另一种识别两个模态都能很好地预测该区域的时段,揭示平衡的视听表征。总之,这些分析揭示了视听处理的两种皮层模式:两个模态切换“弓形”(一个围绕类别选择性视觉皮层的后部弓形和一个横跨背外侧额叶皮层的前部弓形)以及一个联合表征两个模态的箭状轴(从外侧枕叶延伸到颞叶皮层)。我们进一步表明,切换不是由非优势模态中低层信息的减少所驱动,而是由该信息的皮层编码减少所驱动,表明主动的感觉重加权。模态优势也不能简单地由优势模态传达某区域偏好的概念来解释;切换区域不仅仅追踪表达这些概念的模态。总之,这些系统表明了一种皮层架构,在自然主义理解过程中自适应地重加权感觉输入,同时维持平衡的多模态表征。
直接CDK1结合是甲萘威诱导的遗传毒性细胞周期阻滞的基础 Piyush, R. 2026-10-06 PDF Carbaryl是一种广泛使用的氨基甲酸酯类农药,流行病学研究已将其与暴露人群中的遗传毒性和致癌结局相关联,包括多个组织部位的癌症风险升高,以及在一些农业社区中病因不明的慢性肾小管间质性肾病(CKDu)。然而,这些关联背后的细胞机制,以及Carbaryl是否在不同组织中以一致方式发挥作用,仍不清楚。通过对一组来自不同物种和谱系的细胞系进行筛选,我们发现Carbaryl选择性地在肾小管上皮细胞系(IMCD3)中引发显著的、剂量依赖性的细胞毒性和细胞周期阻滞,并在较小程度上影响宫颈上皮细胞系(HeLa),而成纤维细胞系(NIH3T3)未受影响。在IMCD3细胞中,Carbaryl通过直接结合DNA并由此造成DNA损伤,诱导S期和G2/M期阻滞,触发不依赖活性氧的Bcl-2介导的晚期凋亡,并驱动不可逆的有丝分裂阻滞。分子动力学模拟、细胞热位移实验和激酶活性测定共同指向CDK1是Carbaryl的直接靶点:Carbaryl使CDK1活性位点失稳并抑制其催化活性,而CDK2则以一种相反的、刚性化模式被结合,且不产生功能性后果。这种不对称性为所观察到的S期和G2/M期联合阻滞提供了连贯的机制基础。总之,这些发现确立了Carbaryl是一种具有组织选择性效力的遗传毒性、细胞周期干扰剂,直接作用于CDK1,并为解释其与暴露人群中肾脏及其他组织病理学之间已报道的关联提供了基于细胞的机制框架。
起始密码子上下文调控翻译偶联的mRNA降解及人类寄生虫利什曼原虫中的协调表达 SANTI, A. M. M. 2026-10-06 PDF 在缺乏基于启动子的经典转录调控的情况下,利什曼原虫进化出了适应性基因表达的替代调控机制,包括通过差异性mRNA周转实现转录后控制。尽管这一机制在利什曼原虫中被认为至关重要,但这些寄生虫中转录本稳定性的基本方面仍有待阐明,例如翻译起始介导的mRNA降解的作用。我们通过研究起始密码子上下文(Kozak序列)在杜氏利什曼原虫基因表达中的作用,填补了这一重要空白。对锥虫基因组中Kozak序列的定位揭示了在属和亚属水平上核苷酸偏好的重要差异,表明其具有重要的顺式调控功能。在同一物种内,仅有少部分可能的Kozak序列与若干起始密码子相关联,进一步支持了它们在表达控制中的作用。表达EGFP且受不同Kozak变体控制的转基因杜氏利什曼原虫株确实证明,起始密码子的核苷酸上下文直接调节蛋白质表达和mRNA稳定性,这与mRNA向重多聚核糖体募集的增加相关。寄生虫暴露于翻译抑制剂环己酰亚胺可恢复由弱Kozak序列驱动的EGFP表达,揭示了mRNA稳定性与Kozak介导的可翻译性之间的直接联系。对转录或翻译延伸被阻滞的寄生虫进行RNA-seq分析,揭示了富集于GO术语RNA修饰和假尿苷合成的转录本,它们是翻译依赖性mRNA周转的关键靶标。这些转录本分离为具有不同Kozak特征的功能簇,进一步表明Kozak序列组成定义了利什曼原虫中受Kozak调控的调节子。在这一调控框架内,-3位核苷酸被确定为驱动转录本丰度差异的关键位置决定因素。我们的工作揭示了翻译起始偶联的mRNA降解在利什曼原虫基因表达调控中的关键作用,为寄生虫适应性增加了一个此前未被充分认识到的转录后调控层面。
加拿大西部作物生产与设计的大产量模型 Ubbens, J. 2026-10-06 PDF 随着气候的变化、病害压力以及其他生产威胁的加剧,确保作物生产者能够良好地保护和优化产量至关重要。在这项工作中,我们提出了LYM-1,这是首个用于预测加拿大大草原地区产量表现的大规模、多作物模型。这得益于一个包含超过470万条产量观测数据的大型数据集,涵盖10种不同作物类型,分布于23个生长年份。利用天气和土壤属性的额外数据源,使模型能够推理遗传、环境和管理之间复杂的相互作用,这些相互作用是产量的基础。训练后的模型不仅在预测留出数据方面有效,还揭示了具有科学和农学意义的效应,例如太阳辐射与氮吸收之间的相互作用。我们表明,LYM-1中使用的架构和训练方法使其能够在某些模型输入未指定的不完整查询下进行推理,同时在预测性能上优于流行的线性和机器学习模型。
生物素操控的配体捕获实现了活细胞中蛋白质和细胞器的动态空间重分布 Beyers, W. C. 2026-10-06 PDF 通过化学生物学工具控制蛋白质定位对于机制探究、功能扰动和治疗开发至关重要。尽管现有工具涵盖了广泛的应用,但没有任何单一方法能够同时实现对目标蛋白质(POI)的可诱导捕获、可控释放和可视化。为填补这一空白,我们开发了生物素操控配体捕获系统(BOLT),该系统将HaloTag融合的POI与链霉亲和素捕获器相结合。脱硫生物素偶联的Janelia Fluor HaloTag配体能够实现POI的可视化、捕获和生物素操控释放。我们展示了BOLT在同步分泌货物释放、微管引导的细胞器运动和搭车运输以及异位定位核转录因子方面的能力。重要的是,脉冲追踪BOLT进一步揭示了内源性高尔基体酶的双向内质网-高尔基体运输,并利用不同的HTL区分了回收酶群与新合成酶群。总之,BOLT提供了一个一体化平台,可在兼容HaloTag的系统中探究亚细胞定位如何调控蛋白质功能。
突触密度成像与自闭症中的表现相关,但与自我报告无关 Naples, A. J. 2026-10-06 PDF 自闭症是一种常见的神经发育状况,具有相当大的个体间差异,且生物学病因未知。成人自闭症的诊断依赖于对表现的测量(例如,临床医生对社交行为的评分、认知的标准化评估)以及自闭症特征的自我报告。我们此前的工作揭示了自闭症中临床医生对社交功能的评分与通过[11C]UCB-J PET测得的突触密度体内测量值之间存在强关联(Matuskey等,2025)。然而,目前尚不清楚自闭症表型的这些测量方面如何反映其背后的生物学机制。在此,我们在12名自闭症成人的样本中,通过将突触密度成像与一系列表现测量(如认知和面孔识别)相关联,并与自我报告测量进行对比,来探讨这一问题。我们的结果识别出这些测量类型之间的分离,即突触密度与表现测量强烈相关,但与自我报告几乎无关联。这些发现表明,尽管自我报告和表现测量在表征自闭症表型时共享方差,但在映射到 underlying biology 时二者出现分歧。结果表明,较高的突触密度可能反映了一种促进多种任务中社交和认知表现的一般机制。这些数据还表明,在捕捉自闭症中脑-行为对应关系时,表现测量和自我报告测量不可互换,这一发现可指导未来生物标志物研究和临床研究中的测量选择。
精神分裂症谱系障碍中的丘脑连接异常与阴性症状 Kunitoki, K. 2026-10-06 PDF 背景与假设 精神分裂症谱系障碍(SSD)中的阴性症状与不良功能结局和生活质量下降相关;然而,有效的治疗仍然有限。需要更好地理解其潜在脑机制,以开发更好的治疗方法。神经影像学研究提示多个脑网络与阴性症状有关,但研究结果仍具有异质性,这可能反映了症状和脑网络的多维性。需要更大规模、更系统的剖析,以识别阴性症状背后的关键枢纽。研究设计 分析了394名参与者(210名SSD患者,184名健康对照[HC])的结构MRI数据,以识别既表现出SSD-HC差异,又与简明阴性症状量表(BNSS)所测阴性症状相关的皮层厚度和皮层下体积。符合这两项标准的区域被选为种子区,用于143名SSD患者的静息态功能连接分析,以检验其与阴性症状及其亚域的关联。研究结果 丘脑是唯一一个既在SSD中表现出显著结构异常,又与BNSS总分相关的区域(p-FDR<0.05)。随后检查了功能网络定义的丘脑亚区。若干丘脑连接减低与阴性症状显著对应,涉及与皮层默认模式网络、躯体感觉网络、内侧颞叶网络和背侧注意网络相关的丘脑亚区(p=0.001,校正后<0.05)。情感迟钝表现出最广泛的丘脑连接改变,涉及纹状体、小脑和颞顶交界/颞上沟(TPJ-STS)。丘脑与TPJ-STS之间的连接减低也与总体阴性症状和快感缺失相关。结论 本研究确定丘脑是SSD中与阴性症状相关功能障碍的核心枢纽,并强调特定的丘脑亚网络可作为基于环路的干预措施的潜在靶点。
聚集型和弥散型感觉皮层-纹状体连接定义了互补的中间神经元回路 Contadini, J. 2026-10-06 PDF 在纹状体中,中间神经元紧密控制输出神经元即纹状体投射神经元(SPN)的活动。在这些纹状体中间神经元中,表达小清蛋白(PV)和表达生长抑素(SOM)的细胞表现出明显不同的电生理和解剖学特性,提示它们以不同方式整合入纹状体回路,并对SPN形成不同形式的前馈抑制。然而,目前尚不清楚这些差异是否已在皮质纹状体连接层面出现,以及它们是否塑造了与皮质输入至SPN的特定相互作用。在此,我们研究了初级和次级躯体感觉区(S1和S2)向纹状体PV和SOM中间神经元及SPN投射的空间组织。结合解剖学示踪和功能性回路映射,我们表征了皮质纹状体连接的关键特征,包括输入数量、来源、间距、重叠和强度。我们发现,在单个细胞和群体水平上,输入间距和强度是区分PV和SOM中间神经元的主要特征。相比之下,S1和S2之间的连接差异主要体现在输入数量和层状组织上。我们的发现提示了中间神经元与SPN连接之间两种潜在的相互作用模式:一种模式中,PV中间神经元接收以大型簇状结构组织的S1输入,这些输入与邻近SPN的输入密集重叠,为潜在的神经元组装提供了解剖学基础。另一种模式中,SOM中间神经元也接收丰富的皮质输入,但这些输入稀疏地散布于S1和S2,且与SPN的输入重叠很少,可能通过输入交叉相互作用塑造这些细胞的整合。这些皮质纹状体 wiring 的细胞类型原则可能支持不同形式的纹状体计算。
学习源权重以进行目标位置估计:比较固定权重与输入依赖规则 Kobayashi, J. 2026-10-06 PDF 估计物体的位置需要结合不确定的测量值。当测量误差发生变化时,先前校准得出的权重可能变得不再适用。我们研究了从含噪参考测量中学习是否能改善位置估计,以及根据当前输入计算权重是否比在整个评估过程中使用一组学习到的固定权重带来更大改进。在仿真中,我们生成了目标的位置含噪测量值,目标在每个试次内保持固定。每种双输入方法将当前测量值与三个初始测量值的均值相结合。测量精度降低和附加测量偏移仅在初始化之后施加。估计器未获得当前或先前的真实目标位置。我们在四种误差条件下各重复了坐标校准、训练、验证和独立评估100次。在测量精度降低和时间相关性条件下,重新校准和固定权重学习解释了相对于先前提供的权重的大部分改进。在偶发大测量误差的情况下,依赖于输入的加权相对于学习到的固定权重将均方误差降低了4.05%,并对带有附加偏移的测量值赋予了较低的平均权重。在独立误差和当前精度降低的条件下,其额外收益低于0.5%,而在时间相关性条件下,固定权重的平均误差略低。使用较长观测历史的方法在若干条件下表现更好。敏感性分析表明,共享坐标偏差和相关参考误差限制了对物理精度的结论。结果表明了在这些测量模型内重新校准、依赖于输入的加权和观测历史的收益与局限。
SroA将SigS依赖性应激信号与金黄色葡萄球菌的代谢重塑联系起来 Alqahtani, S. A. 2026-10-06 PDF 金黄色葡萄球菌在定植和感染过程中会遇到多种环境条件,包括营养物质可用性的波动、氧化应激和氧气限制。适应这些环境需要调控系统将应激反应与代谢生理协调起来。胞外功能σ因子SigS有助于金黄色葡萄球菌的应激适应和毒力,并直接激活sroAB操纵子的表达,该操纵子编码小蛋白SroA和SroB。先前的工作表明SroA参与sigS表达的反馈调节,但SroA更广泛的生理作用仍不清楚。为进一步明确SroA的调控功能,我们在金黄色葡萄球菌中诱导过表达sroA后进行了RNA测序。转录组分析鉴定出与硝酸盐呼吸、核苷酸生物合成、应激反应和营养获取相关的基因表达发生变化。Northern印迹和定量RT-PCR分析证实,SroA过表达后narG和narJ转录本受到抑制。与这些转录变化一致,在补充葡萄糖和硝酸盐的化学限定培养基中,SroA过表达损害了硝酸盐还原,并在厌氧条件下产生了适度但显著的生长劣势。除抑制硝酸盐呼吸基因外,SroA过表达还降低了参与从头嘌呤和嘧啶生物合成的基因表达,而与应激反应和营养获取相关的转录本,包括sosA和pstS,则增加。总之,这些发现支持SroA在调节硝酸盐呼吸相关途径以及在支持厌氧呼吸的条件下影响生长方面的作用,从而将SigS依赖性应激信号与金黄色葡萄球菌的代谢适应联系起来。

medRxiv

标题 作者 发布日期 PDF链接 摘要
端粒维持是在脂肪肉瘤去分化过程中获得的,而遗传上较长的端粒与脂肪肉瘤风险相关 Pan, M. 2026-10-06 PDF 目的肉瘤亚型如何利用端粒酶与端粒替代延长(ALT)机制,以及由此产生的后果,目前尚未完全明确。方法我们分析了AACR Project GENIE v20.0中来自19个中心、共11,792例接受测序的肉瘤患者。端粒酶激活定义为TERT启动子突变、扩增或重排,ATRX/DAXX失活作为ALT的替代指标,且仅在检测覆盖相应位点时进行评估。研究结果在The Cancer Genome Atlas(TCGA)中检测TERT表达,在MSK-IMPACT 50K中检测总生存期(OS),并在独立的Foundation Medicine队列中进行验证。在FinnGen中进行孟德尔随机化(MR)以检测胚系端粒长度。结果端粒酶激活(8.8%)与ATRX/DAXX缺失(8.0%)在各亚型中互斥(比值比[OR],0.52;95% CI,0.29至0.92),并按组织学类型分离。在MDM2扩增的去分化脂肪肉瘤(DDLPS)中,端粒酶通过TERT扩增(17.2%)或重排(2.7%)激活,从未通过启动子突变(0/261),也从未与ATRX/DAXX缺失共存(0/49;P = .011)。TERT扩增的肿瘤表达TERT(TCGA;P = .002),且扩增主要为局灶性。端粒维持改变在DDLPS中占28.0%,而在高分化脂肪肉瘤中占8.7%(P < .001),并预测DDLPS中更短的OS(风险比,2.04;95% CI,1.23至3.39;P = .005)。在GENIE中,ATRX/DAXX缺失在子宫平滑肌肉瘤中比子宫外平滑肌肉瘤更常见(校正OR,1.96),在独立队列中亦然(OR,1.95;两者P < .001)。遗传学上较长的端粒与脂肪肉瘤相关(每SD的OR,4.10;95% CI,2.15至7.81)。结论肉瘤端粒维持具有组织学特异性且互斥。在脂肪肉瘤中,端粒维持是在去分化过程中通过局灶性TERT扩增或ALT获得,并可识别出生存较差的DDLPS。背景摘要O_ST_ABS关键目标C_ST_ABS每种肉瘤亚型使用哪种端粒维持机制,以及它在进展过程中的何时获得?已产生的知识在11,792例接受测序的肉瘤中,端粒酶激活与ATRX/DAXX缺失互斥,并按组织学类型分离。去分化脂肪肉瘤通过TERT扩增或重排而非启动子突变激活端粒酶,其获得端粒维持改变的比例约为高分化脂肪肉瘤的三倍,且这些改变可识别出总生存期较短的DDLPS。孟德尔随机化将遗传学上较长的端粒与脂肪肉瘤易感性联系起来。相关性端粒维持状态是DDLPS中候选的预后生物标志物,也是按机制匹配评估端粒酶靶向治疗和ALT靶向治疗的理由。
监测人工智能生成医疗文档编辑的框架 Garcia-Agundez, A. 2026-10-06 PDF 目的:开发并评估一个用于刻画临床医生对人工智能(AI)生成文档进行编辑的框架,并评估其在卫生系统层面监测AI scribes的可行性。材料与方法:我们分析了在单一学术卫生系统中使用AI scribe的门诊就诊记录,考察病历中的现病史(HPI)和评估与计划(A&P)部分。我们从三个维度刻画编辑:基于Levenshtein距离的词汇编辑强度、BERTScore嵌入编辑强度,以及基于删除和添加的UMLS概念的临床编辑强度。我们以临床医生作为金标准,分析临床编辑强度作为具有临床意义编辑衡量指标的阳性预测值(PPV),考察各维度之间的相关性,并设计指数加权移动平均控制图以监测临床医生编辑行为的纵向变化。结果:共纳入268,379次就诊(267,654份HPI,267,594份A&P)。临床编辑强度≥1对具有临床意义编辑的PPV为88.9%。词汇编辑强度与嵌入编辑强度高度相关(Spearman ρ 0.95),而临床编辑强度与两者的相关性较弱(ρ 0.77-0.81)。纵向监测检测到与系统范围推广相吻合的变化。讨论:临床医生对A&P的编辑程度高于HPI,可能反映出对涉及临床决策内容的更多关注。超过三分之一的章节涉及临床概念变化,临床编辑强度能够识别具有临床意义的编辑,同时提供与词汇编辑指标互补的信息。结论:临床医生编辑可以通过互补的编辑维度进行大规模刻画,为人类-AI文档流程的部署后监测提供可扩展的信号。
更简单并不总是更好:系统发育动力学的模型误设与深度学习校正 XIE, R. 2026-10-06 PDF 系统动力学填补了流行病学与病原体遗传数据之间的空白。生灭(BD)模型及其扩展用于从时间标定的病原体系统发育树中推断平均继发感染数R和感染持续时间d。此外,更复杂的模型增加了额外参数,如平均潜伏期长度、感染人群中超级传播者的比例,或接触追踪后检测加速的程度。然而,这些额外参数带来了重要的计算代价:虽然最简单的BD模型具有闭式解,但其扩展模型没有,需要数值方法进行似然计算。这导致计算时间增加和潜在的数值误差。因此,BD模型仍然是研究人员在真实数据集分析中的首选,甚至常常在存在更复杂流行病学特征的情况下也被应用。我们通过模拟研究了模型误设如何影响系统动力学框架中R和d的推断。我们表明,使用未考虑各种流行病学特征的模型会导致偏差。特别是,最简单的BD估计量在存在超级传播、潜伏期或接触追踪时倾向于低估R,从公共卫生角度来看这可能具有危险性。相比之下,基于深度学习的复杂模型估计量——考虑了多种流行病学因素——在我们的模拟中,无论数据中是否存在这些因素,均表现良好。这推动了使用复杂的流行病学现实估计量的必要性,其设计最近因深度学习而成为可能。
自动化短信干预在超重或肥胖产后女性体重管理中的有效性(支持妈妈S(SMS)):一项英国全国性、多中心、双臂、平行组、随机对照试验。 Gallagher, D. 2026-10-06 PDF 目的 检验通过自动短信传递的产后行为干预在减轻体重方面的有效性。设计 两项平行组、多中心、随机对照试验。设置 通过医疗和社区途径(包括社交媒体)从英国五个地区(贝尔法斯特、布拉德福德、斯特灵、伦敦和卡迪夫)招募。参与者 892名产后6周至24个月、年龄18岁及以上、体重指数25 kg/m²或以上的多样化女性样本,于2022年5月至2023年5月入组:445人被随机分配到干预组,447人被分配到活性对照组(比较组)。干预 为期12个月的完全自动化短信,嵌入行为改变技术及双向消息组件,通过针对饮食、身体活动和体重管理行为,支持产后时期的体重减轻和体重减轻维持。对照组接受为期12个月根据儿童年龄定制的儿童健康与发育短信。主要结局指标 主要结局为12个月时(干预结束时)以千克为单位的体重。6个月和12个月时记录的次要结局为体重变化(6个月时)、体重指数、体重增加超过5 kg的女性比例、腰围、自我报告的饮食摄入、身体活动和婴儿喂养实践。结果 674名(75.6%)参与者被纳入主要分析。干预组与活性对照组之间的校正平均体重变化未发现差异(-0.1 kg(95%置信区间 -1.0至0.8,P=0.84))。敏感性分析未改变这些结果。与对照组相比,干预组在12个月时Fat and Fibre Barometer评分有小幅改善(校正平均差0.09,95% CI:0.04至0.14;P<0.001),且干预组在12个月时身体活动评分(International Physical Activity Questionnaire Short Form)较对照组增加(校正平均差405.3总MET分钟/周,95% CI:141.3至669.3;P=0.003)。在12个月时,干预组婴儿比对照组婴儿摄入更多鸡蛋(校正平均差0.47份/周,95% CI:0.14至0.81;P=0.01)、豆类/扁豆(校正平均差0.40份/周,95% CI:0.09至0.71;P=0.01)和坚果(校正平均差0.35份/周,95% CI:0.06至0.64;P=0.02)。结论 为期12个月、通过短信传递的自动化、互动式行为体重管理干预并未支持产后女性体重减轻,但确实对饮食、身体活动和婴儿喂养行为产生了积极影响。试验注册 ISRCTN Registry ISRCTN16299220
优化抗生素使用的AWaRe质量指标开发 Heath, A. 2026-10-06 PDF 背景:世界卫生组织AWaRe(可广泛使用/谨慎使用/保留使用)手册就初级保健和医院环境中抗生素的最佳使用提供了详细指导,旨在提高抗生素使用质量。目标:基于世界卫生组织AWaRe体系,制定适当且可行的质量指标(QIs)模型集,使其可在初级保健、医院和一般医疗系统环境中广泛实施,以支持抗生素的最佳使用。方法:对范围综述中的指标进行修订,使其聚焦于AWaRe手册中的临床感染。分别采用全球德尔菲技术和RAND/UCLA适宜性方法各两轮,评估其在全国和全球层面的适当性和可行性。在每种方法的第一轮中,专家组成员对清晰度进行评分,并提出修订或新指标。本研究报告第二轮结果。随后对指标进行审查,以根据世界卫生组织手册的抗生素选择建议、疾病负担和阳性测量,制定优先清单。结果:AWaRe质量指标涵盖了AWaRe手册中列出的常见初级保健和医院感染,以及一般患者和人群层面的指标。德尔菲技术第二轮纳入了102项质量指标(初级保健:46项;医院:39项;一般:17项),RAND/UCLA方法第二轮纳入了136项指标(初级保健:56项;医院:60项;一般:20项)。 prioritisation过程产生了20项核心指标(初级保健:10项,医院:8项,一般:2项)。结论:AWaRe质量指标已被推导出来,以支持抗生素的最佳使用,并为抗菌药物管理项目提供信息。
五种风险分层工具在撒哈拉以南非洲PediCAP试验数据中对儿童肺炎的效能与WHO评分比较 Nalwanga, D. 2026-10-06 PDF 目的 儿童肺炎的风险分层工具可能有助于在资源匮乏环境中识别死亡风险最高的儿童。然而,其相对于WHO儿童疾病综合管理(IMCI)标准和危险体征的附加价值仍不确定。我们利用一项多国非洲临床试验的数据,比较了已发表的儿童肺炎风险评分与WHO-IMCI标准及WHO危险体征的表现。设计 对一项多国随机对照试验的二次分析。地点 莫桑比克、南非、乌干达、赞比亚和津巴布韦的13家医院。参与者 PediCAP试验中年龄2-59个月、无HIV感染、因WHO定义的严重社区获得性肺炎住院的儿童。主要和次要结局指标 主要结局为院内死亡。次要结局为住院期间或出院后7天内死亡,以及探索性结局第28天再入院或死亡。采用受试者工作特征曲线下面积(ROC-AUC)评估区分度。结果 在1052名儿童中,18名(1.7%)在院内死亡,22名(2.1%)在住院期间或出院后7天内死亡。在1010名有第28天随访的儿童中,63名(6.2%)在第28天前死亡或再入院。院内死亡的ROC-AUC点估计值约为0.73至0.87。WHO危险体征的点估计值低于其他评分,尽管置信区间大幅重叠,且没有任何评分显示出明确的优越性。对于住院期间或出院后7天内死亡,观察到类似结果。相比之下,所有方法对探索性结局28天再入院或死亡的区分度均有限(ROC-AUC约为0.54-0.57)。结论 在这个因严重肺炎住院的多国儿童队列中,没有任何评分在死亡预测方面显示出明确的优越性,尽管不能排除存在适度差异。已发表的风险评分和WHO-IMCI标准表现大致相似。这些发现表明,在资源匮乏环境中,加强WHO临床标准的实施可能至少与引入额外的风险分层工具同等重要。
一种神经健康的模态不变测量方法 Sanchez Colon, L. A. 2026-10-06 PDF 用单一指标量化神经健康仍是一项重大挑战。在此,我们报告一种基于静息脑内信号衍生能量相关空间分布的生理标志物。我们假设健康大脑中的能量组织接近一种熵最大化、稳态调节的状态,其特征包括五个属性:对数正态能量分布、平衡的空间分配、区域间的统计独立性、低能量方差以及时间稳定性。这些属性共同定义了一种能量学特征,神经健康指数(NHI)将其概括为单一评分,可从(头皮/颅内)脑电图、脑磁图或功能磁共振成像计算得出。在涵盖神经、精神、神经发育和神经退行性疾病的808名参与者中,NHI在内部和外部验证中以超过95%的灵敏度和特异度区分健康人群与临床人群,随疾病严重程度变化,追踪药物治疗暴露,并可推广至未见过的诊断。这些发现支持NHI作为一种疾病无关、模态不变的候选生物标志物,用于疾病分层和治疗监测。
可改变阿尔茨海默病风险因素的遗传易感性性别差异 Sharma, R. U. 2026-10-06 PDF 引言:阿尔茨海默病(AD)在风险、临床进展和生物标志物特征方面存在性别差异,但可改变风险因素的遗传易感性是否对女性和男性的AD易感性产生不同贡献仍不清楚。我们评估了几种可改变痴呆风险因素与AD之间的遗传关系在女性和男性之间是否存在差异。方法:我们整合了可改变风险因素的多基因风险评分(PRS)、全基因组遗传相关性以及两样本孟德尔随机化(MR)分析。在阿尔茨海默病遗传学联盟(n=27,751)中评估了PRS与AD诊断的关联,并在健康与衰老脑研究-健康差异项目中评估了PRS与AD血浆生物标志物的关联(n=2,307-2,737,取决于生物标志物)。主要分析评估了女性和男性特异性关联,并比较了性别特异性估计值。结果:教育程度和体力活动的PRS与两性AD均相关。教育程度、总胆固醇和LDL胆固醇的PRS性别差异为名义显著,但经FDR校正后均不再显著。遗传相关性显示,社交隔离、体力活动、LDL胆固醇和脉压存在FDR显著的性别差异。MR在性别分层内识别出FDR显著的关联;较高的HDL胆固醇与女性较低的AD风险相关,而较高的总胆固醇和2型糖尿病分别与男性较低和较高的AD风险相关。敏感性分析提供了不一致的支持,且经FDR校正后,MR估计值中无性别差异保持显著。在HABS-HD中,经FDR校正后,2型糖尿病PRS与男性较高的NfL相关,BMI PRS与较高的pTau181相关,复合PRS与男性较高的NfL相关。讨论:可改变痴呆风险因素与AD的关系因性别而异的证据有限,且取决于所检测的遗传指标。全基因组遗传重叠的性别差异未在PRS或MR中一致体现,表明共享遗传结构不一定转化为性别特异性遗传易感性或因果效应。
社会和行为风险因素与持续性注意的年龄相关差异有关:基于All of Us数据集的横断面GradCPT分析 Coresh-Chiappori, N. M. 2026-10-06 PDF 背景 注意控制能力随正常衰老而下降,但可改变的生活方式因素在加速这一下降过程中的作用,尚未在大型、多样化人群中得到充分描述。我们研究了四种可改变风险因素(吸烟强度、酒精暴饮、社会满意度和血压)与来自All of Us研究计划的13,866名成年人的持续注意表现之间的关联。方法 使用渐变起始持续操作任务(GradCPT)评估认知表现。通过对四项GradCPT指标进行主成分分析得出综合认知效率评分:d'(知觉敏感性)、反应标准、中位反应时和反应时变异性。使用多元线性回归检验认知效率与各风险因素之间的关联,并对年龄、性别和种族/族裔进行了调整。效应量以认知衰老的年龄等效年数表示(年龄等效年数=风险因素的回归系数除以年龄的回归系数),以助于临床解读。结果 GradCPT表现随年龄增长而逐步下降(p<0.001)。社会满意度 emerged 为最强的生活方式预测因素:与高社会满意度相比,低社会满意度与约5.8个额外的认知衰老年龄等效年数相关。吸烟呈现剂量-反应模式,重度吸烟者(>20支/天)与从不吸烟者相比表现出约5年的年龄等效缺陷。2期高血压显示出适度但非显著的负相关。暴饮显示出有限且显著的关联,可能因幸存者偏倚和戒酒者偏倚而复杂化。对联合暴露的Bootstrap分析显示,风险因素的组合,特别是涉及低社会满意度的组合,产生的认知缺陷大于加性模型下的预期。结论 这些发现支持生活方式相关认知脆弱性的交互模型而非纯粹加性模型,并强调GradCPT可作为非临床人群中基于注意的认知风险的亚临床测量工具。关键词 认知衰老,持续注意,GradCPT,可改变风险因素,社会隔离,吸烟,高血压,All of Us研究计划
印度针对有不良童年经历青少年的校本创伤知情照护与社会情感学习干预:一项采用单臂准实验评估的序贯混合方法研究方案 Bharti, B. 2026-10-06 PDF 背景 不良童年经历是贯穿整个生命历程的精神障碍、健康风险行为和非传染性疾病的主要决定因素,但来自印度的证据仍然有限。本研究旨在估计印度青少年中不良童年经历的患病率和模式,考察其与心理健康和非传染性疾病风险因素的关联,并评估一项文化适应的校本干预措施,该措施整合了创伤知情照护和社会情感学习。方法 将在印度昌迪加尔和莫哈利的16所公立和私立学校中,对约1,632名青少年开展一项序贯混合方法研究。第一阶段是一项横断面调查,涵盖不良童年经历、心理健康、感知压力、睡眠、屏幕时间以及非传染性疾病的行为和生物学风险因素。第二阶段包括与学生、家长、教师、辅导员和心理健康专业人员的焦点小组讨论和关键知情人访谈,以指导干预措施的开发。在第三阶段,两个阶段的研究结果将指导干预措施的开发,采用ADDIE(分析、设计、开发、实施和评估)教学设计框架。在第四阶段,报告有ACE暴露的青少年将参与一项由受过培训的心理学家在8-12周内实施的校本干预,包括创伤知情社会情感学习课程、针对高风险青少年的个体咨询课程(至少六次)、全校范围的认识活动以及家长 sensitization。有效性将采用准实验前后设计进行评估。主要结局将是通过长处和困难问卷(SDQ)测量的情绪和行为困难的变化。次要结局将包括抑郁症状(患者健康问卷-9)、感知压力、睡眠质量、学校功能以及非传染性疾病的行为风险因素的变化。招募于2026年4月开始并正在进行;数据收集预计于2028年6月完成,目前尚未产生任何结果。