跳转至

2026-08-07 每日论文

来源 独立页面
arXiv arXiv
bioRxiv bioRxiv
medRxiv medRxiv

arXiv

标题 作者 发布日期 PDF链接 摘要
通过选择性上下文偏好优化学习何时信任 Xian Sun 2026-08-06 PDF 语言模型越来越多地根据外部信号来调整其答案,而一个单一的误导性信号就能将正确答案变为错误。显而易见的补救措施——训练模型抵抗此类信号——隐藏着一种失败模式:一个忽略所有上下文的模型看似稳健,但在上下文值得信赖时却毫无用处。我们将此问题重新定义为选择性信任,并引入MIST,这是一个人工标注的基准,在四种匹配条件下(干净、误导、正确上下文、无关上下文)呈现每个推理项,同时引入SC2W,这是一个配对指标,统计误导性信号将干净正确的答案翻转为错误的频率。通过一项全面的基准研究,我们观察到这种易感性是普遍存在的。随后,我们提出SCOPE,它挖掘干净正确/误导错误的失败案例,并优化标准直接偏好优化(DPO)目标,该目标基于在所有四种条件下均衡匹配的偏好对,而非仅基于误导项。我们的方法显著降低了流行开源模型上的SC2W,同时在添加的上下文干净、正确或无关时保持准确性。通过这项工作,我们认为模型应依据选择性信任来评判,而非仅凭抵抗力。
DyPES-VLA:学习共享动力学先验与具身特定控制以实现跨具身操作 Junfeng Li 2026-08-06 PDF 视觉-语言-动作(VLA)模型已成为机器人操作的有力范式,但为异构机器人本体训练单一通用策略仍是一个开放问题。现有方法存在两个主要局限。首先,它们未能充分利用跨多样视觉和交互数据共享的动态先验,限制了跨本体迁移。其次,它们需要大量手动预处理,将特定本体的动作转换为通用格式。为克服这些局限,我们提出DyPES-VLA,一种学习共享动态先验和特定本体控制的跨本体VLA。首先,我们通过在跨本体数据上以未来预测目标训练视觉-语言模型(VLM)来学习共享动态先验,驱动共享查询表示捕捉物体运动、接触及交互引发的场景变化。其次,一个特定本体的专家混合(MoE)动作头将这些共享动态先验直接转换为每个本体原生动作空间中的可执行控制,无需手动预对齐异构动作为通用格式。该动作头共享注意力层以捕捉常见的时间动作结构,而其特定本体的前馈专家则解决不同本体的独特运动学约束和控制语义。作为通用策略,我们的方法在仿真和真实世界评估中达到最先进性能,在LIBERO上取得98.0%成功率,在RoboCasa-GR1上为59.25%,在RoboTwin 2.0上为89.02%。
工具调用的苦涩教训 Ishan Patel 2026-08-06 PDF 工具使用将LLM转变为超越其训练数据行动的智能体,而对于具备代码能力的模型,程序化工具调用通过用自然链式与并行化的脚本替代僵化的JSON调用,进一步扩展了这一能力。然而,在现有基准上,针对当前及先前模型世代,在真实世界任务条件下,对作为代码的工具进行系统性评估尚未开展。在本工作中,我们在BFCL v4上对14种语言模型,实证比较了程序化工具调用(PTC)与原生JSON工具调用。在程序化工具调用范式中,工具以类型化的Python存根形式暴露,模型通过代码调用它们,执行和结果在单一智能体回合中处理。在BFCL v4上,程序化工具调用在14种模型中的11种上匹配或超越了原生JSON工具调用,其中GPT-5.6系列相比JSON工具调用基线提升了10.6%。此外,在并行扇出条件下,它在14种模型中的13种上匹配或优于基线,并在上下文退化条件下保持稳定,而基线平均退化2.3%。我们的结果表明,程序化工具调用是JSON工具调用的可行且稳健的替代方案,其性能随发布世代的模型能力而跟踪提升。
追踪心脏:心力衰竭特征工程的一种证据关联流水线 Soorya Ram Shimgekar 2026-08-06 PDF 电子健康记录(EHR)特征工程是临床研究和人工智能中的主要瓶颈,占数据科学家工作量的39-45%。这一问题在心力衰竭中尤为突出,该病影响约670万美国成年人,需要将碎片化的EHR数据与疾病特异性、基于指南的临床推理相结合。现有的基于规则和基于大语言模型(LLM)的方法仅提供部分自动化,且可维护性和证据可追溯性有限。我们开发了Nimblemind多智能体系统(nMAS),这是一个基于证据、以评分标准为支撑的自动化心力衰竭特征工程流水线,并在来自九个EHR源表的500条虚拟患者记录上进行了评估。nMAS生成了132个结构化特征和70个按评分标准评分的聚合特征,验证了结构完整性、评分标准合规性和来源可追溯性,并由受限LLM进行审计。加入聚合特征后,HFrEF表型分类的留出集AUROC从0.895提升至0.963,HFpEF从0.870提升至0.910,独立的基于LLM的评分标准评估对证据支持和方法学合理性的评分为最高分的81.5%。这些结果证明了针对复杂心血管EHR数据的自动化、可审计特征工程的可行性,但评估仅限于单机构队列,仍需外部验证。
探究移动购物应用中的人工智能数字主权:以尼日利亚为例 George Grispos 2026-08-06 PDF 电子商务移动应用在尼日利亚的普及正在扩大,既带来了机遇也带来了风险,包括欺诈和用户对数字技术控制力的减弱,引发了对数字主权的担忧。本研究探讨了尼日利亚移动应用中的人工智能(AI)如何影响数字主权,并通过平台透明度作为用户意识和控制力的关键指标进行考察。采用解释性方法,本研究将选定安卓应用的取证分析与情境文档分析相结合,以识别AI功能并评估披露实践。研究结果显示,AI在应用中广泛实施,但对其使用的透明度仍然有限。对尼日利亚的社会经济分析进一步表明,对消费者数字平台的依赖日益增加,AI意识中等,互动模式不均衡。通过提供关于AI透明度和平台实践的实证证据,本研究增进了对个体数字主权的理解,并强调了在AI驱动的数字环境中保护用户控制力所面临的挑战。
一种最优的不可知PAC算法 Markus Engelund Mathiasen 2026-08-06 PDF 设$H\subseteq{-1,+1}^X$为有限VC维$d\ge1$的类别。记$L$为二元风险,$L^=\min_{h\in H}L(h)$,我们构造一个学习器,实现统计最优的风险界:从大小为$n$的i.i.d.样本出发,对每个$0<δ\le 1/2$,以至少$1-δ$的概率有[ L(\widehat h) \le L^+ 7\cdot10^8\left( \sqrt{\frac{L^(d+\log(1/δ))}{n}} +\frac{d+\log(1/δ)}{n} \right). ] 这解决了在任意固定$L^$下,agnostic PAC学习的样本复杂度问题,其常数与Devroye、Györfi和Lugosi [A Probabilistic Theory of Pattern Recognition, Springer, 1996]的下界匹配。
AV-AIVAT:在不完美信息博弈中,以74倍更低成本实现带认证的随时有效停止的智能体评估 Boning Li 2026-08-06 PDF 判断两个智能体孰强孰弱,意味着持续对局直到技巧胜过运气,而每局对局都耗费资金、模型推理或专家时间。由于所需对局数未知,固定预算评估要么在结果已定后继续支付,要么在智能体尚无法区分时提前停止,而采用普通置信区间的朴素可选停止会破坏既定显著性水平。我们使此类评估在证据充分时即刻停止,且保证不变。行动知情价值评估工具(AIVAT)通过条件均值零修正降低不完美信息博弈中的方差,在跨越71,439手配对单挑无限注德州扑克(HUNL)的15种LLM智能体配置中,中位数降低54倍,但未说明何时停止。我们将AIVAT与连续监测的置信序列(CSs)结合,形成任意有效AIVAT(AV-AIVAT),其在线价值模型仅从过往对局学习,因此没有对局会修正自身。在名义95%水平及±1大盲注的目标精度下,原始结果在渐近CS(AsympCS)下停止所需手数中位数是AIVAT修正结果的74倍。精确有限样本认证使用经验-伯恩斯坦CS(EB-CS),这需要对修正后收益进行独立论证的界。我们为Leduc德州扑克结构性建立此界,并刻画由CS的赌注上限和该界设定的宽度下限,该下限决定方差收益中有多少转化为更早停止;描述性HUNL EB-CS运行显示停止时间比中位数为1.37倍。AV-AIVAT将方差缩减转化为高效、可审计的早期停止,同时将渐近筛选与精确认证分离,因此评估可在证据充分时即刻停止,并向第三方提供在停止时刻重新核查结论所需的一切。
低频陷阱:视频语言模型在简单事件记录上的失败 Sarvesh Baskar 2026-08-06 PDF 真实世界视频基准提供了广泛的覆盖范围,但其固定片段将事件数量、速率、持续时间和视觉复杂性纠缠在一起,使得故障模式难以隔离。现有程序化基准虽提供更好的控制,但仅对最终答案评分,而非对照可执行真值审计报告的事件。为弥合这一差距,我们引入基于轨迹的参数化剖析,用于三个受控视频任务中的事件计数:弹球墙壁接触、视觉闪烁和类别状态转换。在2,190个视频中,我们变化事件数量N和频率F,同时保持渲染固定。每个视频包含一个可执行事件轨迹,用于能力表面估计和时间戳级评估。我们的结果揭示了分阶段的时间故障。在80%可靠性阈值下,Gemini 3.6 Flash可靠地计数持久状态转换,最多12个事件,频率为0.5和1.0 Hz,但对瞬态闪烁事件未显示可靠的正确计数区域。因此,事件表示决定了模型是否最初访问证据——这一限制随着计数和频率增加而加剧。在高计数、高频率区域,仅0.2%的最终计数正确,模型仅恢复18.1%的真实事件。为测试视觉访问是否为主要瓶颈,我们增加采样率。尽管这使弹球准确率从19.6%提升至29.3%,报告序列与真值一致的时间仅占3.7%。因此,额外帧可能抬高最终分数而不产生忠实的事件恢复。不同提示策略带来同样有限的增益,真实世界视频评估也显示成功集中于低事件计数。最终,基于轨迹的剖析将视频评估从聚合准确率指标转变为详细诊断,揭示时间推理失败之处。
资源化权威:一种面向已部署AI代理参与式治理的机制设计模型 Praphul Chandra 2026-08-06 PDF 我们为一个已部署AI代理的持续参与式治理提出了一个正式的机制设计模型。该机制基于这样的原则:治理应通过资源分配来控制AI代理,从而通过计算预算使授权自我执行。该机制旨在确立安全AI范式,即计算是有效的治理杠杆。我们将我们的工作定位为部署者之上的合规性或公共资源覆盖层。一个治理周期是一个扩展形式博弈,其中经过验证的人类利益相关者依次到达,并在提供或拒绝市场上以治理货币贡献,这种货币刻意与代理的计算资源区分开来。一个资金聚合器将原始贡献转化为广度加权的有效支持——一个带有滞回效应的双阈值门将净支持转换为二元授权,通过受外生认证安全上限约束的耦合映射,释放计量计算预算——在硬件中实现为签名计算许可证,从而使决策自我执行。我们刻画了该机制能够治理的代理类别,并将被治理代理对治理选民的操纵视为核心开放问题。我们还引入了若干挑战,以应对被治理代理对治理选民的操纵。
CalibForge:面向可学习终端任务扩展的对抗性求解器校准 Fanzhe Meng 2026-08-06 PDF 训练终端代理需要可执行且可验证的任务,这些任务不仅需要可解,还要对学习而言具有适当的挑战性。可执行验证确立了可行性,但并未揭示任务相对于给定求解器设置的行为。在本文中,我们提出CalibForge,一个自主的终端任务合成系统,该系统利用已验证的求解器行为,通过对抗性求解器校准来修订候选任务。多求解器校准针对异构求解器池内的分歧,而对比求解器校准则针对指定的强通过/弱失败关系;两者都将基于已证明可解性的求解器相对可学习区域操作化。使用CalibForge,我们构建了5,431个校准后的终端任务。我们的消融实验表明,这两种策略比仅进行编写和验证或仅使用单一求解器反馈提供了更有效的监督。在完整集合上训练的模型在Terminal-Bench 2.0上达到32.58%和47.57%的准确率。相对于对应基础模型的最大改进在Terminal-Bench 2.0上达到24.71个百分点,在SWE-bench Pro上达到27.68个百分点,在Doc2Repo上达到30.04个百分点。这些结果共同支持将求解器相对可学习性作为构建有效且可迁移的代理训练数据的实用目标。

bioRxiv

标题 作者 发布日期 PDF链接 摘要
常染色体显性阿尔茨海默病通过内嗅皮层罕见变异的寡基因调控产生韧性的机制 El-Amri, Y. 2026-08-07 PDF 两名PSEN1 E280A携带者表现出对常染色体显性阿尔茨海默病(ADAD)的极端保护,痴呆发病延迟超过二十年。其中一位男性,携带RELN-COLBOS保护性变异的杂合子,其内嗅皮层神经元密度增加(1)。我们对受保护与未受保护的PSEN1 E280A病例、散发性阿尔茨海默病及非痴呆对照组的内嗅皮层进行了深度表型分析和基因分型研究。我们使用了单核和空间转录组学、全基因组测序以及候选基因型相关表达变化(GAEC)分析。结果显示,男性RELN-COLBOS患者具有独特的神经元和少突胶质细胞群体。独特的RELN阳性抑制性中间神经元富集于皮层第一层,而独特的丰富ADAMTSL1阳性兴奋性神经元分布于第二/三层和第五层a区。这些神经元和成熟的有髓鞘少突胶质细胞受益于LRP6受体表达增加,该受体作为RELN-COLBOS编码的突变Reelin蛋白的非经典受体发挥作用。最后,GAEC和通路富集分析表明,其他突变增强了男性RELN-COLBOS患者中少突胶质细胞内的RELN-COLBOS效应,这解释了他与妹妹(一位未表现出明显ADAD保护的RELN-COLBOS携带者)之间的表型差异。我们的发现表明,PSEN1 E280A表型的极端偏差更可能归因于寡基因效应,包括同时发生的突变,涉及如ITGA2等基因,参与单一分子通路,如整合素/黏着斑通路,作为阿尔茨海默病(AD)的潜在疾病修饰因子。
漂移与选择在单代中的全基因组效应 Sgarlata, G. M. 2026-08-07 PDF 遗传漂变与选择在进化变化中的相对重要性一直备受争议。这一争论主要聚焦于长时间尺度(例如数十万代),而短期进化变化的问题相对未得到充分探讨。我们对选择在短时间尺度上对遗传变化影响的认识,通常基于识别少数具有大选择优势位点的等位基因频率重大变化。然而,选择往往作用于多基因性状,其短期响应由许多位点上的等位基因频率微小变化所塑造,这些变化难以与遗传漂变区分。在此,我们通过利用与选择等位基因具有更强遗传相关性(LD)的等位基因预期表现出比遗传漂变下更大的等位基因频率变化方差这一概念,量化了单代内多基因选择的基因组范围效应。我们推导出将位点间LD变异与连锁选择和遗传漂变引起的等位基因频率变化方差相关联的表达式,并利用这一理论来量化连锁选择对单代等位基因频率变化的贡献。为展示我们的方法,我们使用适应度代理表型分解了英国生物银行中的基因组范围等位基因频率变化。我们表明,选择做出了虽小但显著的贡献,而遗传漂变构成了等位基因频率变化的大部分。我们的框架可应用于其他拥有后代数量或连续世代等位基因频率数据的生物体,从而能够在广泛物种中研究多基因选择的短期基因组范围效应。
蝙蝠冬眠地点的社会性传播知识 Ripperger, S. P. 2026-08-07 PDF 在全球温带地区,蝙蝠每年冬季长途迁徙至冬眠地点聚集。一个长期存在的假说认为,每一代新蝙蝠从年长个体那里学习这些地点(称为冬眠场所)的位置,但缺乏清晰且有力的证据来证明这种知识的社会性传播。在此,我们汇编了1985年至2023年间对13,852只大鼠耳蝠(Myotis myotis)的30,882次观察记录,这些蝙蝠在夏季栖息地、冬季冬眠场所或两者处被标记并观察。我们的分析揭示了四条证据链,表明大耳鼠耳蝠利用在夏季栖息地获得的社会信息来寻找合适的冬眠场所。首先,与独立移动的零模型相比,初次冬眠的幼年蝙蝠更可能与其夏季出生群体的成年个体共享首个冬眠场所。其次,成年蝙蝠在多个冬季间也更可能共同转换至同一冬眠场所,而非独立移动所预期。第三,夏季共同栖息于同一地点的蝙蝠更可能在冬季共享不同的冬眠场所:夏季被观察到在一起,将一对蝙蝠冬季被观察到在一起的概率从5%提升至12%。最后,高分辨率追踪揭示了夏季期间飞往冬眠场所的串联飞行实例,表明幼年蝙蝠可以在冬眠前数月从经验丰富的成年蝙蝠那里学习。综合来看,我们的发现表明,母性群体充当信息中心,雌性蝙蝠在其漫长一生中从中获取适宜冬眠地点的知识。
别构约束对可诱导阻遏蛋白重连的影响 Lewis, M. 2026-08-07 PDF 转基因表达的精确化学控制是合成生物学、哺乳动物细胞工程和基因治疗的核心。尽管四环素响应系统被广泛使用,但将诱导型阻遏物转化为稳健的共阻遏型调节器仍然困难。设计用于响应配体激活DNA结合的系统常表现出高基础表达、弱开关效应和有限动态范围,表明调节极性受底层变构自由能景观约束。在此,我们结合热力学建模与匹配的哺乳动物报告基因检测,探讨诱导型与共阻遏型调节之间的根本区别。利用启动子占据框架,我们描述了配体结合如何在DNA结合能力胜任与不胜任的构象之间重新分配调节器,以控制转录输出。诱导型阻遏物如TetR通过降低操纵子占据来激活转录,而共阻遏型系统必须增加操纵子占据以抑制转录,这施加了根本不同的能量需求。对TetR衍生和PurR衍生调节器的实验比较支持了这一热力学解释。基于TetR的系统产生强配体依赖性诱导,而反向TetR变体表现出较弱的共阻遏行为和更高的残留表达。相比之下,天然共阻遏调节器PurR响应次黄嘌呤,通过配体稳定DNA结合,且PurR--VP16产生的配体依赖性转录激活强于反向TetR。综合来看,这些结果表明调节性能取决于配体结合如何高效地重新分配构象状态,并提示天然共阻遏支架可能为工程化配体激活转录控制提供更优基础。
产后自主神经发育预测青少年心理社会结局 Schmausser, M. 2026-08-07 PDF 背景:自主神经系统(ANS)的成熟被认为在情绪调节及后续心理社会功能发展中起着关键作用。然而,将早期自主神经发育与长期结果联系起来的纵向证据仍然有限。本研究采用纵向设计,探讨了出生相关因素、早期自主神经活动与发育过程中心理社会结果之间的相互作用。方法:样本包括101名参与者,从出生两周追踪至14岁,并在2周、6周、3个月、14个月和14岁时评估心率(HR)和迷走神经介导的心率变异性(vmHRV)。使用线性模型检验出生相关因素与早期HR和vmHRV之间的关联,以及前14个月HR和vmHRV轨迹是否预测5岁和14岁时的心理社会结果。结果:多种出生相关因素显著预测了出生后两周的HR和vmHRV。此外,婴儿期vmHRV随年龄增长的平坦化增加和HR下降减弱,仅在男性中预测了14岁时母亲报告的心理社会困难增加,而在5岁时或女性中未观察到此类效应。结论:这些发现强调了早期自主神经成熟在塑造后续心理社会功能中的重要性,且对青少年期结果的影响仅在男性中观察到。早期ANS轨迹可能代表神经发育结果的有意义预测因子,突显其在性别特异性方式下早期识别后续心理社会风险的潜在相关性。
安全第一:蛋白质设计工具的输入筛选 Palmer, P. 2026-08-07 PDF 随着生物AI模型日益强大,需要实用的生物安全方法来支持有益应用,同时降低滥用风险。基于序列相似性的筛查方法已不足以保障生物AI模型的安全,因为这些模型能设计具有新序列和新结构的分子。因此,需要一种考虑功能的筛查方法。为满足这一需求,我们提出了一种针对AI驱动的蛋白结合剂设计工具的新筛查方法。我们的框架筛查蛋白结合靶标,重点关注人类蛋白质组,而非结合剂分子本身。我们构建了一个包含14,541个潜在有害蛋白质变体靶标的数据库(占人类蛋白质组所有蛋白质变体的7.1%),并按生物安全风险级别分类。为识别结构和功能特征,我们使用基于嵌入的筛查方法,采用ESM-C蛋白质语言模型进行评估。ESM-C在检测已知靶标变体方面实现了高准确率(F1分数>97%),性能与BLASTP相当。然而,ESM-C在捕捉功能关系方面更为有效,能区分良性突变和有害突变,而BLASTP无法做到。为表征筛查对生物科学研究的影响,我们测量了不同蛋白质数据集中的标记率。按发表频率加权的哺乳动物蛋白质标记率显著(人类为23%,小鼠为20%),而与人类亲缘关系较远的生物体标记率极低(细菌、真菌、植物和病毒均<1.1%)。在商业相关靶标中,63%的抗体专利靶标被归类为双重用途,这反映治疗性重要蛋白质往往执行关键生物学功能。为在不给科学研究与创新带来过度负担的情况下识别和标记来自蛋白结合剂设计工具的风险用户请求,必须部署这一筛查方法,以解决我们分析中显示的关注靶标与治疗靶标之间的重叠问题——可能需与分级可信访问框架协同实施。这一新方法为生物AI模型提供了相称的安全保障基础,既降低滥用风险,又保留其对合法研究的益处,并展示了可推广至其他蛋白质设计工具和生物AI模型的具体原理验证。
早期精神病中自杀与非自杀性自伤背后的异常情绪调节与奖赏网络连接 An, C. L. 2026-08-07 PDF 背景:早期精神病(EP)个体自杀风险升高,自杀是诊断后前五年内的主要死因。非自杀性自伤(NSSI)显著预测自杀行为,但自伤研究常排除精神病患者。我们调查了有终生NSSI或自杀未遂(SA)史且伴或不伴EP的参与者中情绪调节和奖赏网络区域的有效连接。方法:获取23名EP个体和34名非临床对照(NCC)的静息态fMRI数据。我们估计了自伤文献中涉及区域的有效连接模型:中扣带皮层(MCC)、后扣带皮层(PCC)、尾状核、壳核、后上颞回(STG)、眶额皮层(OFC)和岛叶。共有3个模型表征不同分组:诊断(NCC vs. EP);NSSI(存在[+],n=21 vs. 缺失[-],n=36);以及SA(存在[+],n=21 vs. 缺失[-],n=36)。结果:EP与STG到PCC及岛叶到壳核连接增强相关。NSSI+(n=7 NCC,14 EP)相对于NSSI-(n=27 NCC,9 EP)具有增强的PCC到岛叶滞后连接和增强的同时双侧壳核活动。NSSI与岛叶到壳核滞后活动正相关(p=0.016)。SA和NSSI与PCC到尾状核连接减弱相关。结论:NSSI与情绪调节区域内连接增强及情绪调节和奖赏网络间连接中断相关,这种中断由STG和纹状体调节。发现与更广泛的自伤文献一致,支持使用其他疾病中的类似干预措施来应对EP中的自伤行为。
HSF1控制建立丘脑-纹状体轴突突触结构并维持认知灵活性的转录程序。 Rozema, N. B. 2026-08-07 PDF 认知灵活性(CF)在衰老过程中下降,并在亨廷顿病(HD)等神经退行性疾病中进一步受损,然而这些缺陷背后的分子机制仍知之甚少。丘脑-纹状体(T-S)突触对CF至关重要,我们此前已鉴定热休克因子1(HSF1)为HD中T-S密度的调节因子。然而,HSF1如何调控T-S突触以及它是否调节认知灵活性(CF)仍不清楚。在此,我们结合HSF1 ChIP-seq、转录组学、突触蛋白质组学、靶向遗传操作和行为分析,研究HSF1如何调控T-S突触和CF。我们发现HSF1直接控制一个调控突触后结构和肌动蛋白细胞骨架动力学的转录程序,这些过程在衰老和HD中被破坏。HSF1的缺失导致T-S轴突突触处肌动蛋白斑块的选择性不稳定,并损害CF下降。我们的结果强调了HSF1在纹状体神经回路调控中的新功能,对认知灵活性的神经生物学具有重要启示。
当外部需求与内部需求竞争时,注意力的动态优先分配 Gresch, D. 2026-08-07 PDF 注意力使得与任务相关的信息能够被优先处理,无论是来自外部世界的刺激还是作为内部表征维持的内容。尽管注意力机制在感知和工作记忆领域已被广泛研究,但日常认知常常同时面临来自这两个领域的竞争性需求。在这种跨领域需求下,注意力如何分配仍知之甚少。在本研究中,参与者在工作记忆显示与后续感知显示之间执行了一项结合感知和工作记忆的任务,其中出现了一个信息性线索。在大多数试验中,该线索同时指示两个需要优先处理的项目:要么是两个已编码的工作记忆项目,要么是两个即将出现的感知项目(领域内注意力),或者每个领域各一个项目(跨领域注意力)。结合行为测量与脑电图,我们得以刻画跨领域分配注意力相对于领域内分配注意力如何影响表现和神经活动。行为上,我们观察到显著的不对称性:感知表现在跨领域注意力下优于领域内注意力,而工作记忆表现则呈现相反模式。与这种行为失衡相呼应,时间分辨解码揭示了感知和工作记忆中跨领域与领域内竞争的不同模式,表明即使在同时参与时,外部和内部注意力在神经上也是可分离的。这种领域间的竞争也体现在空间注意力定向的神经标记中:虽然在跨领域注意力期间最初受损,但定向逐渐偏向外部信息而非内部信息。综合来看,这些发现表明,当感知和工作记忆竞争时,注意力并非均匀分配。相反,跨领域注意力构成一种独特的注意力状态,具有其自身的优先处理动态和神经表征。
教导他人能够揭示概念认知地图中的隐藏结构 Wu, X. 2026-08-07 PDF 概念知识在头脑中如何组织,在自然行为中仍难以直接观察。在此,我们表明,向他人解释知识会在自然语言中引出概念记忆的空间结构化表征。具有不同分裂型特质的参与者通过基于图像或语言的输入学习两个概念维度之间的关联,随后描述他们的记忆策略或解释他们将如何向他人传授这些信息。空间结构在教学过程中比反思过程中更可能出现,尤其是在基于图像的学习之后。正如先前证据所预测的那样,视觉输入需要主动构建内部关系支架,认知紊乱在选择性地削弱了基于图像学习后的空间表达,但未影响基于语言的学习。这些发现确立了自然语言作为概念图谱结构的行为读出,并表明一种共同机制将图谱构建与认知紊乱联系起来,贯穿任务表现和言语交流。

medRxiv

标题 作者 发布日期 PDF链接 摘要
Boora,一个用于巴西初级保健中超重和肥胖护理的AI辅助数字平台:感知可用性与可接受性的形成性混合方法评估 Couto, F. d. F. S. 2026-08-07 PDF 目的评估Boora在巴西初级保健用户和卫生专业人员中的感知可用性、可接受性和用户体验(而非临床有效性)。Boora是一个AI辅助、人工监督的纵向超重和肥胖护理数字平台原型。设计采用收敛混合方法形成性评估。感知可用性通过系统可用性量表(SUS)测量并进行描述性总结;实际操作后的半结构化访谈采用编码本主题分析(Braun和Clarke)进行分析;两条研究线索通过联合展示进行整合。定性报告遵循定性研究综合报告标准(COREQ)。研究场所巴西统一卫生系统内帕拉州阿纳宁德瓦初级卫生保健网络(2026年1月至2月)。参与者十五名超重或肥胖成人(BMI≥25 kg/m²,通过电子健康记录确认),使用患者应用程序24小时;八名初级保健专业人员(护士、医生和营养师),使用专业仪表板约20分钟完成预设任务(使用合成数据)。主要结局指标SUS评分及涉及可用性、可接受性、感知有用性、障碍以及感知的临床和工作流程适配性的定性主题。结果Boora在两个队列中均显示出良好的感知可用性(用户均值76.5,SD 10.3;专业人员均值77.5,SD 4.6;均高于SUS规范平均值68)。每个队列出现四个主题。用户重视可访问的界面和可见的进展,但描述了每日记录负担、预期参与度脆弱以及数字素养和可访问性障碍。专业人员重视清晰的界面和面板管理、主动随访的前景,同时需要培训、AI治理、保护时间以及与国家级记录系统的互操作性。整合结果表明,用户预期的参与度下降正是专业人员认为仪表板可帮助识别的风险,而教育性AI助手是两组中最薄弱和最模糊的组成部分。结论Boora被认为可用且可接受,其感知价值集中在人工监督的纵向随访,而非自主自我追踪或AI建议。这些发现涉及感知可用性和可接受性,而非临床有效性或持续参与。实际应用将取决于可访问性改进、电子记录集成以及符合巴西拟议的基于风险的AI框架和LGPD原则的明确AI治理。关键信息关于本主题的已知信息移动和网络应用程序可以支持体重管理,但缺乏结构化专业支持时用户参与度往往随时间下降,且大多数证据来自高收入国家。初级保健中的自主AI建议可能不安全或与临床指南不一致,凸显了人工监督和可审计系统的必要性。本研究的新增内容在巴西公共卫生系统中,AI辅助、人工监督的平台原型(患者应用程序与专业仪表板配对)经短暂实际操作后被患者和初级保健专业人员认为可用且可接受。混合方法整合表明,用户预期的参与度下降与专业人员认为仪表板可帮助识别的风险相对应,将平台的感知价值定位于人工监督的纵向随访;教育性AI助手是其最薄弱的组成部分。本研究对研究、实践或政策的影响支持将初级保健肥胖工具中的AI设计为可审计的、受监督的支持而非自主建议,符合巴西拟议的基于风险的AI框架原则。参与者指出低识字用户的可访问性、与国家级电子健康记录的互操作性、保护时间和培训是采用的潜在前提条件,这些值得进行纵向、真实世界评估。
撒哈拉以南非洲地区COVID-19疫苗错误信息的区域与时间模式 Jamalova, R. 2026-08-07 PDF 背景:尽管COVID-19疫苗在全球范围内推广,但撒哈拉以南非洲在疫苗接种覆盖率上仍落后于其他地区,主要原因是疫苗分配不公和可负担性障碍。与此同时,由于对副作用的担忧、对机构的不信任以及社交媒体平台(如Twitter)上传播的错误信息,COVID-19疫苗犹豫进一步抑制了接种率,即使在疫苗可及的地区也是如此。方法:我们收集、预处理并对来自撒哈拉以南非洲的6,305,628条与COVID-19疫苗接种相关的推文进行了地理定位,并使用经过验证的基于LLM的分类框架识别出1,312,969条包含错误信息的推文。我们分析了疫苗话题与错误信息流行率之间的关系、其随时间的变化,以及在不同收入水平和次区域国家集群中的分布。结果:与错误信息相关的讨论集中在疫苗安全性担忧、机构不信任和反对强制接种上。次区域聚类显示,讨论差异远大于收入聚类(100个话题中分别为87个和7个),这一模式在排除每个区域或集群中推文量最高的国家后依然稳健,错误信息流行率在南非和较高收入国家中最高。东非和西非的讨论主要聚焦于实施,而南非和中非则更多涉及怀疑和阴谋论。错误信息流行率在2021年底引入疫苗强制接种政策时急剧上升,并在讨论量下降后仍保持高位。结论:这些发现表明,撒哈拉以南非洲的反错误信息策略应因地制宜而非统一实施,公共卫生传播应远超推广期,特别是在强制接种等有争议的政策决策之后,此时错误信息似乎更加根深蒂固。
印度尼西亚医疗机构就诊患者痰液中Minidock MTB用于结核病诊断的评估 Hartati, S. 2026-08-07 PDF 背景:在结核病高负担国家,获取结核病(TB)诊断工具的机会仍然有限,部分原因是检测集中且复杂。我们评估了MiniDock MTB——一种低复杂度的近即时检测(nPOC)检测方法——在痰液中的诊断准确性及其与Xpert MTB/RIF Ultra(Xpert)的一致性。方法:2024年9月至2025年4月,在印度尼西亚万隆的15个社区卫生中心、一家肺科诊所和一家肺科医院连续纳入年龄大于28天的疑似肺结核病例。使用MiniDock MTB对痰拭子、Xpert和液体培养进行检测。我们评估了诊断准确性,以微生物学参考标准和复合参考标准(CRS)为基准,并评估了与Xpert的一致性。结果:在筛查的3051名个体中,671人符合条件并被纳入;其中533名成人(年龄≥15岁),138名儿童。总体而言,126人Xpert阳性,132人培养阳性。在成人中,MiniDock MTB的敏感性分别为86.2%(100/116;95% CI 78.8 - 91.3)和55.8%(110/197;95% CI 48.9 - 62.6),分别以液体培养和CRS为参考;儿童中阳性结果数量较少,无法进行估计。特异性范围为96.8%至98.8%。MiniDock MTB与Xpert之间的总体一致性(排除微量阳性)为94.8%(95% CI 92.6 - 96.3;K = 0.84)。阳性一致性百分比在成人和儿童中分别为82.8%(95% CI 75.1 - 88.4)和25%(95% CI 4.6 - 69.9),且随着菌载量降低而下降(p = 0.004)。结论:在成人中,MiniDock MTB在痰液中以液体培养为参考的敏感性超过了WHO对痰液基nPOC结核病检测的阈值。与Xpert的一致性较高,但在低菌载量结核病中敏感性降低。关键词:结核病;诊断;MiniDock;痰拭子 资助:盖茨基金会 INV-059052。
基因组维度解构双相障碍的临床异质性 Bipolar Disorder Working Group of the Psychiatric Genomics Consortium, 2026-08-07 PDF 双相障碍(BD)的临床异质性具有未解决的遗传基础。我们对来自57个队列(38,022例病例)的226,032名个体中16种BD亚表型进行了全基因组关联研究(GWAS)的荟萃分析;其中10种进入多变量和多性状分析。四个因子(强迫性、精神病性、失调性、内化性)解释了82.8%的共享遗传方差。BD1和BD2尽管遗传相关性高,却负载于不同因子;87.0%的常见因子位点在两种亚型中均不显著。单相躁狂与精神病性而非内化性对齐,且可与BD1区分;快速循环显示出可遗传的跨域易感性。我们识别出356个风险位点,其中158个为新发现,包括精神病性、单相躁狂、快速循环和分裂情感性障碍的首个单变量GWAS关联,以及249个可信基因(89个高置信度),其中12个具有已批准药物或临床阶段注释。细胞类型关联显示沿精神病性因子存在中脑多巴胺能-GABA能梯度。BD的遗传结构似乎是层级性的,一般易感性分解为超越亚型的病程和共病维度。
健康与生物医学研究论文中线性回归推断可重复性的实证评估 Jones, L. 2026-08-07 PDF 背景:在健康研究中,建模决策的变异性可能导致即使分析相同数据也得出不同结论,这一挑战被称为推断可重复性。在线性回归分析中,对关键假设(如残差正态性和线性)的错误处理可能削弱可重复性。本研究探讨了当相同数据被重新分析时,这些假设的违反如何影响推断结论。方法:我们从2019年随机抽取了95篇报告使用线性回归方法的健康相关PLOS ONE论文。其中43篇论文提供了数据,20篇被评估计算可重复性,每篇论文评估三个模型。随后,对至少部分计算可复现的14篇论文进行了推断可重复性检查。为评估假设违反的影响,比较了系数、95%置信区间和模型拟合的差异。结果:在评估的十四篇论文中,仅有三篇在推断上可重复。最常被违反的假设是正态性和独立性,各出现在八篇论文中。独立性违反尤其具有后果性,并常与推断失败相关。尽管复现的分析通常保留了与原研究相同的二元统计显著性分类,但置信区间往往更宽,表明不确定性增加和精度降低。这种不确定性可能影响结果解释,进而影响治疗决策和临床实践。结论:我们的发现表明,关键建模假设的重大违反往往未被作者和同行评审员察觉,并且在许多情况下与推断可重复性失败相关。这凸显了加强统计教育和提高建模决策透明度的必要性。研究人员不应采用僵化或误导性的规则,如错误地检验结果变量的正态性,而应采用由研究问题和研究设计指导的建模框架。当假设被违反时,应考虑适当的替代方法,如稳健方法、自助法、广义线性模型或混合效应模型。鉴于即使在相对简单的回归模型中假设违反也很常见,与统计学家早期且持续的合作对于支持可信、可辩护且具有临床意义的结论至关重要。
连接引导的加速θ爆发刺激作为住院难治性抑郁症的增效治疗:一项随机、双盲、假刺激对照试验 Mueller, C. 2026-08-07 PDF 重要性:标准重复经颅磁刺激方案因需连续数周每日治疗,难以整合至住院精神科护理中。加速间歇性θ脉冲刺激(iTBS)可能为住院治疗抵抗性抑郁症(TRD)患者提供可行的增效策略。目的:确定连接引导的加速iTBS能否在常规多模式住院护理基础上,改善住院TRD患者的抑郁症状。设计、设置与参与者:本随机、双盲、假刺激对照临床试验在德国巴德茨维申安大学奥尔登堡精神病学系卡尔·雅斯贝尔斯诊所住院部开展。招募2021年5月至2024年8月期间年龄18至65岁的单相TRD患者。干预措施:参与者接受主动或假iTBS,靶点为基于静息态功能MRI确定的个体化左侧背外侧前额叶皮层位点,该位点与膝下前扣带皮层呈最强功能反相关。治疗在10个工作日内每日3次(共30次,总计54000脉冲),作为常规多模式住院护理的增效手段。主要结局与测量指标:主要和次要结局为刺激阶段2周内每周评估的蒙哥马利-阿斯伯格抑郁评定量表(MADRS)评分变化及每日评估的贝克抑郁量表第二版(BDI-II)评分变化。探索性结局包括缓解率和应答率。结果:57名随机参与者中,51人完成治疗(主动组,n=27;假刺激组,n=24)。该队列表现出中重度治疗抵抗(平均莫兹利分期法评分10.9),82%参与者存在精神科共病。主动iTBS较假刺激与更陡峭的MADRS改善相关(-3.54分/周;95% CI,-5.53至-1.55;错误发现率校正P<.001),对应模型估计降低12.06分对比4.98分(Cohen d=-0.89)。BDI-II轨迹同样倾向于主动治疗,但效应量较小(-0.23分/天;95% CI,-0.41至-0.05;错误发现率校正P=.02;Cohen d=-0.22)。主动iTBS的MADRS应答率更高(42.3%对比13.0%),而缓解率数值上更高但无显著差异(26.9%对比12.5%)。未发生严重不良事件。结论与相关性:加速连接引导iTBS在TRD急性住院治疗中产生显著的附加抗抑郁效应。需更大规模多中心试验以确定持久性并优化临床实施。试验注册:ClinicalTrials.gov标识符:NCT04832750。
医院内耐甲氧西林金黄色葡萄球菌的传播由成瘾性mupA质粒驱动 Podkowik, M. 2026-08-07 PDF 背景。莫匹罗星是金黄色葡萄球菌去定植治疗的基石药物,其耐药性是去定植失败的公认原因,但它在医院传播中的作用尚不清楚。方法。我们对两家常规使用莫匹罗星去定植的城市医院成年患者的超过10,000株金黄色葡萄球菌分离株进行了基因组监测。通过体外实验和小鼠定植模型评估细菌表型和适应性,以解释监测结果。结果。基因组测序识别出475起医院传播事件,而常规监测未检出任何一例。质粒介导的耐药决定因子mupA(ileS2)在耐甲氧西林金黄色葡萄球菌(MRSA)中的富集程度是甲氧西林敏感菌株的八倍。mupA与近三倍的医院传播增加相关,尤其是在医疗保健相关MRSA谱系中。出乎意料的是,多个独立进化的必需染色体基因ileS1失活突变与mupA共存,形成质粒成瘾现象,使mupA成为细菌生存不可或缺的因子。质粒携带激活了严谨反应并降低了定植适应性,但也赋予了对乙醇和过氧化物等消毒剂的附带耐受性。尽管成瘾进一步降低了金黄色葡萄球菌的适应性,却增加了质粒转移,促进了传播,尽管存在这些代价。意外地,我们发现了一种依赖莫匹罗星的异亮氨酸限制脆弱性,揭示了靶向mupA介导耐药性的潜在策略。结论。莫匹罗星耐药MRSA的医院传播由质粒促进,这些质粒创造了一个进化陷阱,其中莫匹罗星使用选择细菌依赖高代价的耐药元件。这些发现表明,仅减少莫匹罗星使用不太可能消除耐药性,强调了基因组监测和耐药性检测的必要性,并为保留莫匹罗星有效性的策略提供了框架。
针对职业压力、焦虑和抑郁症状的状态个性化情绪匹配转移音乐与直接提振音乐的基于网络的随机试验 Ding, Y. 2026-08-07 PDF 背景:基于网络的音乐干预可为日常生活中的情绪调节提供可扩展的支持,但优化音乐排序以促进情绪变化的策略仍不明确。基于等值原则(ISO)的情绪匹配至转移策略,先播放与听者当前情感状态一致的音乐,再逐步转向积极目标。相比之下,直接提升(DUL)策略则从目标状态的音乐开始。ISO是否优于DUL尚未得到证实。目的:评估在针对职业压力的自导式网络音乐干预中,个性化ISO排序策略与直接提升(DUL)策略相比是否提供差异化益处。方法:在这项双组、参与者设盲的随机试验中,120名讲中文的职场成年人按1:1比例分配至ISO或DUL组。参与者通过网络平台完成连续5个晚间会话。主要结局为基线至干预后即刻的职业压力、焦虑症状和抑郁症状变化的组间差异。采用未调整的随机截距线性混合效应模型,并对3个主要结局进行Holm校正。1周和1个月结局及干预完成情况为探索性指标。结果:所有120名随机参与者提供了基线数据,94人完成了全部5次会话和干预后即刻评估。ISO组的完成率高于DUL组(54/60,90% vs 40/60,66.7%;风险比1.35,95% CI 1.11-1.65;P=.004)。干预后即刻,ISO组在三个主要结局上的数值改善均大于DUL组,包括职业压力(组间变化差异:-2.45分,95% CI -7.08至2.18)、焦虑症状(-2.34分,95% CI -5.22至0.54)和抑郁症状(-3.60分,95% CI -7.19至-0.01)。经Holm校正后,所有主要结局均未达到统计学显著性。探索性纵向分析表明,改善在随访期间得以维持,但9个探索性随访对比在Holm调整后均无统计学显著性。结论:状态个性化ISO排序作为自导式数字干预具有可行性,与DUL音乐相比,其完成率更高,且在压力、焦虑和抑郁症状方面呈现方向一致的改善。这些发现为更大规模试验提供了初步支持,以探索用于数字心理健康应用的适应性音乐排序策略。
报告引导的半监督学习用于双参数MRI前列腺癌可扩展检测:多中心前瞻性验证与多模态整合 Calado, A. 2026-08-07 PDF 目的:前瞻性验证一种仅使用病灶教师模型的半监督学习框架(RG-SSL-LOC),用于在双参数MRI(bpMRI)上可扩展地检测临床显著性前列腺癌,并评估其在多模态模型中的附加价值。材料与方法:使用包含13,706次bpMRI检查(13,630名患者,27个中心)的多中心数据集进行模型开发/验证。在外部回顾性、外部前瞻性和内部前瞻性队列中,于病灶水平和病例水平评估了三种分割模型(全监督学习[FSL]、最先进的报告引导半监督方法[RG-SSL]以及提出的RG-SSL-LOC)。将表现最佳模型的预测结果与临床放射学变量结合,采用多模态方法。所有病例水平结果均与PI-RADS进行比较。结果:在病灶水平,RG-SSL-LOC的中位Dice系数高于FSL和RG-SSL(0.49对比0.41和0.40;两者均p<.001)。在病例水平,RG-SSL-LOC在外部回顾性、外部前瞻性和内部前瞻性队列中的曲线下面积(AUC)值分别为0.83、0.82和0.87。与FSL相比,AUC分别为0.84(p=.237)、0.80(p=.020)和0.84(p<.001);与RG-SSL相比,AUC分别为0.83(p=.929)、0.82(p=.652)和0.86(p=.007);与PI-RADS相比,AUC分别为0.78(p=.055)、0.83(p=.652)和0.86(p=.480)。结合临床放射学变量后,RG-SSL-LOC在外部回顾性(0.85对比0.80,p=.002)、外部前瞻性(0.87对比0.84,p=.008)和内部前瞻性(0.91对比0.88,p<.001)队列中显著提高了AUC;在后者中,减少了15.19%的不必要活检。结论:RG-SSL-LOC实现了优于其他方法的分割质量,展示了稳健的前瞻性多中心性能,并改善了多模态检测。
高强度间歇训练、瑜伽及间歇性低氧-高氧暴露对轻度认知障碍患者认知表现与健康的效果和安全性(KAYH):一项随机、假对照试验的研究方案 Wagner, S. 2026-08-07 PDF 引言:被诊断为轻度认知障碍(MCI)的个体发展为痴呆的风险增加。由于目前尚无针对MCI的治愈性药物疗法,非药物及运动相关的医疗疗法代表了一种有前景的方法。本研究旨在评估非药物干预对MCI个体认知表现的影响。方法与分析:本研究将是一项前瞻性、随机、假对照、单中心优效性试验,采用平行组设计。共100名年龄60岁且患有MCI的患者将被随机分配到三个干预组之一或对照组。三个干预组包括高强度间歇训练(HIIT)、瑜伽和间歇性低氧-高氧暴露(IHHE),而对照组的参与者将接受IHHE的假应用(IHHE-S)。主要结局是3个月干预期后通过蒙特利尔认知评估评估的认知功能。次要结局及痴呆可修改风险因素的评估包括生活质量、实验室数据、身体活动、人体测量数据和心肺适能。所有伤害及(严重)不良事件将在每次研究访视时系统评估。伦理与传播:本研究已获得蒂宾根大学医学院伦理委员会批准(494/2025BO1)。研究结果将在同行评审期刊上发表,并向利益相关者及科学会议展示。