跳转至

2026-08-02 每日论文

来源 独立页面
arXiv arXiv
bioRxiv bioRxiv
medRxiv medRxiv

arXiv

标题 作者 发布日期 PDF链接 摘要
学习追踪塞伯格对偶 Jonathan J. Heckman 2026-07-30 PDF 对偶性在建立广泛物理系统中的微观现象与涌现现象方面扮演着重要角色。然而,在实践中,即使所有“游戏规则”众所周知,确定两个系统是否对偶往往在计算上具有挑战性。换句话说,面对两个系统时,如何高效地确认它们实际上是对偶的?在本文中,我们利用机器学习方法来解决超对称quiver规范理论的Seiberg对偶性问题。数学上,这涉及建立quiver的突变,这又是“学习解结”主题的一个变体。一方面,这引导我们开发出一个实用工具,用于确定不同对偶性的计算复杂度。另一方面,它也使我们能够研究不同网络架构如何学习追踪Seiberg对偶性。我们发现,对于具有适度数量quiver节点(约10个)的quiver,由变换器和多层感知器组成的不同网络架构往往优于确定性算法。通过补充成熟的路径查找算法(本质上是“quiver的谷歌地图”)来增强网络,可以进一步提高搜索策略的效率和准确性。我们预期这类问题可以作为前沿AI模型应用于理论物理的有用基准。
ReToken:一个Token以提升视觉-语言模型在视觉检索中的性能 Yao Xiao 2026-07-30 PDF 长视觉上下文对视觉-语言模型构成挑战:随着干扰物数量增加,性能下降,且在GPU内存限制下,一次性处理所有token在计算上不可行。我们提出ReToken,一种单一可学习嵌入,作为显式检索目标进行训练,从预填充的视觉KV缓存中选择一组稀疏的、与查询相关的视觉token。仅在小规模图像问答数据集上训练,ReToken在图像和视频基准测试中均取得一致提升:在Visual Haystacks上,它使Qwen3VL-8B提升13.4个百分点,InternVL3.5提升12.4个百分点(相对提升超过20%);在LVBench上,它零样本迁移至长视频,为Qwen3VL-8B带来8.0个百分点的增益。得益于其轻量级设计,训练和长视频推理均可在单个H100上完成。代码可在 https://github.com/avaxiao/ReToken 获取。
ACE-Data-0:以人为中心的泛在感知作为具身数据引擎 Yukang Cao 2026-07-30 PDF 具身智能面临一个根本性的数据瓶颈。模型必须捕捉第一人称感知、全身运动、灵巧操作、物体状态、声音和触觉如何随着人类在时间推移中追求目标而共同演化。现有数据集将这些体验分散在不同的视角、模态或空间尺度上,使得完整的感知-行动回路仅被部分观测。我们引入了环境捕捉引擎(ACE),一个以人为中心的数据引擎,将真实家庭环境转变为空间校准、时间同步的录制工作室。ACE在两种互补尺度上运行:桌面级配置解析手部物体操作,而房间级配置则捕捉家具环境中的全身运动、移动和交互。ACE将自我中心和多视角外部视频、全身和关节手部运动、物体几何和六自由度轨迹、音频以及触觉信号记录为统一的多感官流。利用ACE,我们构建了ACE-Data-0,包含150小时和1700万视频帧,涵盖200个任务类别,由50名参与者在2个环境中执行,总计75,000个交互片段。该数据集涵盖原子操作、长时程家务活动链以及人-场景交互,同时通过目标级而非逐步指令保留自然行为变异。我们进一步引入了一个分层基准,从信号进展到场景组件,再到交互。对最先进方法的评估揭示了在接触、遮挡、自我运动和长时间跨度下的显著差距。ACE-Data-0提供了同步的人类演示,带有对齐的感知、运动和接触监督,为模仿学习、世界模型、视觉-语言-行动系统和具身AI提供了可扩展的基础。
PhiZero:围绕物理语言构建的世界模型 Shuyao Shang 2026-07-30 PDF 我们介绍PhiZero,一个围绕物理语言构建的物理世界模型,物理语言是一种世界状态转换的紧凑离散表示。现有的物理世界模型通常直接在像素空间中预测未来视频,将底层世界动态隐含在高维视觉预测器中。受人类从视觉经验中抽象预测结构并将其组织为自然语言以进行显式推理的能力启发,我们通过自监督从野外视频中学习物理语言,并利用它显式推理物理世界如何演化。因此,PhiZero采用先推理后渲染的范式:它首先将未来世界演化推断为物理语言序列,然后将推断的转换渲染成视频。在生成和理解基准上的广泛实验验证了PhiZero建模物理一致世界演化的能力。我们进一步展示了其在现实和交互式世界建模、细粒度动作条件模拟以及零样本运动迁移方面的潜力。
PAC-MAN:感知感知CBF-RL用于人形躲避球中的全身安全 Lizhi Yang 2026-07-30 PDF 我们提出了PAC-MAN,一种感知感知的CBF-RL框架,将控制障碍安全性与部署现实的机载感知相结合,用于全身人形躲避球。部署的策略仅通过头戴摄像头获取分割掩码深度来感知球,而训练时的CBF引导则代表每个身体链接的间隙,并通过对抗性运动先验来规范化由此产生的闪避反射。我们在一个受控的任意链接接触基准上进行了评估,该基准包含两种模式的定向投掷:单次投掷和部署循环,其中机器人在投掷之间走回其站位并恢复。在此基准上,该策略的表现接近特权状态预言机:仅固定机载摄像头就足以进行躲避。我们发现,有用的障碍结构依赖于感知可观测性:联合CBF在准确球状态时表现最佳,在固定摄像头观测下仅作为训练引导时性能下降,并通过球跟踪云台或特权运行时滤波器恢复。因此,我们在真实世界中零样本部署了一个轻量级链接CBF策略于Unitree G1上,它能容忍不完美的感知,在95%的投掷中成功,并使用语义分割来躲避不同的球。
AskChem:面向化学文献综合的以声明为中心的基础设施 Bing Yan 2026-07-30 PDF 化学文献综述通常需要整合分散在众多出版物中的具体发现,然而现有的文献检索系统主要返回排序后的文档列表。因此,科学家和AI代理需要自行定位相关信息、验证其来源,并手动整合跨论文的答案。我们提出了AskChem,一种以声明为中心的跨论文化学检索基础设施。AskChem将检索单元从论文转变为携带来源的声明:每篇论文被转换为原子化、类型化的声明,每条声明均以源DOI和逐字引用或明确的证据定位符为依据。在这一共享声明库之上,AskChem提供了互补的检索与综合结构:一个稳定的分面分类法用于层级检索和浏览,一个通过关系连接声明的证据图,以及一个将索引论文置于科学原理下的探索性动态分类法。AskChem目前索引了来自147K篇论文的240万条声明,并提供网页界面,以及面向AI代理的REST、SDK和MCP访问。在AskChem-Bench上,将GPT-5.5阅读器基于AskChem进行检索,可实现100%可解析的DOI,而无检索时为88.3%,并且在五个测试系统中拥有最高的引用密度。AskChem已上线,网址为https://askchem.org。
AISPA:面向大型语言模型应用的以用户为中心的系统提示审计 Xiangning Lin 2026-07-30 PDF 系统提示是由开发者配置的指令,用于管理AI应用中基础模型的行为。它们在商业AI产品中广泛使用,但很少向公众或监管机构公开,这在AI系统的广泛部署中造成了严重的信任和问责缺口。本文介绍了人工智能系统提示保证(AISPA),一个以用户为中心的框架,用于系统审计AI系统中的系统提示。AISPA检查系统提示的特定部分,并沿着对用户重要的八个维度进行评估。我们随后使用此框架审查了88个商业AI产品中系统提示的3,249条指令,将每条指令分类为保护性(对用户)或问题性。我们的审计揭示了四个核心发现。首先,系统提示设计在不同产品和开发者间差异显著,一些组织每个产品平均包含超过60条保护性指令,而其他组织平均不到5条。其次,保护性指令被广泛采用但范围浅显:98.9%的产品至少包含一条,但只有24%覆盖了AISPA分类法的全部八个维度。第三,系统提示持续变得更长且更保护用户,表明用户保护在商业提示设计中正成为更明显的关注点。第四,尽管有这些进展,问题性指令仍然普遍存在:大约40%的产品包含至少一条违背用户利益的指令,且保护性和问题性指令经常在同一提示中共存。我们的发现强调了在商业AI产品中提高系统提示透明度、标准化和独立监督的必要性。
Chimera:混合视觉扩散Transformer的设计与Chinchilla缩放 Chongjian Ge 2026-07-30 PDF 视觉生成日益需要高分辨率图像、长视频和多模态上下文,这使得全注意力的二次成本变得难以承受。我们引入了Chimera,一种混合视觉扩散骨干网络,并配以原则性的扩展策略。Chimera将文本、图像和视频令牌按光栅顺序处理为单一流,无需位置嵌入。它结合了Kimbi Delta Attention(KDA)用于长上下文状态跟踪,复杂度为O(N),交错的多头潜在注意力(MLA)用于直接全局交互,以及模态感知的短卷积用于局部时空上下文。稀疏专家混合(MoE)层在控制激活计算的同时扩展容量。为扩展这一异构架构,我们提出了HeteroP,一种模块级方案,根据每个张量的功能扇入和模型深度,在宽度和深度间转移超参数。HeteroP产生一个一致调优的家族,用于拟合Chinchilla风格的计算最优法则,涉及激活模型大小、训练令牌数量和图像-视频数据比例。依据这些法则,我们训练了一个具有20亿激活参数的110亿参数Chimera模型。实验显示三个结果。首先,以预训练扩散损失衡量,密集骨干网络比匹配的全注意力Wan-2.1 2B基线计算效率高1.7倍,而完整系统达到7.3倍。其次,无需长度特定微调,Chimera从5秒训练片段零样本外推至30秒视频,最后五秒FID仅退化6.5%。第三,拟合法则显示,计算最优图像预训练在激活模型大小和训练令牌数量间几乎均分计算,而视频预训练在更高预算下适度偏向模型大小。这些结果为设计和扩展高效长上下文扩散架构奠定了基础。
OSReward:为跨平台计算机使用奖励模型建立标准化评估体系 Qiushi Sun 2026-07-30 PDF 计算机使用智能体(CUA)正快速推进于数字世界。CUA轨迹记录了智能体的动作、状态和推理过程。验证其是否完成了任务指令,是CUA评估、数据整理和强化学习的核心。人工编写的验证器或人工标注者无法大规模提供此类验证,因此该领域日益转向使用视觉语言模型(VLM)作为CUA轨迹的评判者。但一个根本问题长期未被审视:这些VLM评判者是否足够可靠?为系统研究此问题,我们引入了OSReward,一个真实、高质量的基准,用于评估VLM评判者在CUA轨迹上的表现。这些轨迹来自多种智能体骨干,执行跨平台的人工验证指令,并通过多阶段人工标注严格标记了地面真值判定。在此基础上,我们衍生出OSReward-Hard,一个聚焦于真正困难案例的挑战集,以及OSReward-Multi,用于细粒度的效率和一致性评分。迄今为止最全面的VLM评判者评估发现,即便是最先进的模型也未能达到理想评判者的标准,它们普遍存在系统性宽松偏差,将失败运行误标为成功。少数足够可靠可信任的模型,其运行成本过高,难以大规模应用,而价格适中的开源模型则远远落后。为弥合这一差距,我们构建并发布了OS-Shepherd-100K,一个为CUA社区提供的带推理注释的轨迹判断开放语料库。在此基础上,我们训练了OS-Shepherd(9B和35B),这些开源奖励模型提供低成本、稳定且可靠的奖励信号,以比前沿模型低30-60%的成本匹配商业评判者。广泛的分析进一步为大规模可靠CUA奖励的设计提供了信息。我们的代码、基准、数据集和模型检查点可在https://os-copilot.github.io/OSReward-Home/获取。
KAISEN:临床风险模型的可复现亚组公平性审计 Sparsh Roy 2026-07-30 PDF 临床风险模型通常能在整体性能上表现优异,但在不同患者亚组间的错误率却存在显著差异。为捕捉这一问题,已有审计流程被提出,但其各组成部分很少经过压力测试,因此尚不清楚审计的哪些环节在何种条件下可被信赖。我们提出KAISEN,一个五阶段审计流程,涵盖亚组分层、差异度量、机制诊断、事后缓解和漂移监测,并在一个包含16种疾病任务、来自“健康人群2030”的15个社会决定因素轴及三个预设交叉点的合成基准上评估至失效点。四项发现如下。(一)显著性追踪各轴差距与其自身最小可检测效应:15个轴上显著性计数与原始均等几率差(EOD)之间的秩相关系数为rho = 0.56,当EOD按该下限标准化后升至rho = 0.78。(二)分组阈值优化在48次保留运行中全部降低EOD(配对delta = -0.285,95% CI [-0.313, -0.252]),而分组Platt缩放——作为更优的校准器——在EOD上表现如抛硬币(48次运行中19次改善,95% CI [0.26, 0.55]),平均效应接近零,因此审计应报告的是方差而非平均值。(三)机制诊断在144个受控案例中全部正确分类,但在代理变量误设下未能恢复48个模型驱动案例中的任何一个,且无任何失败信号。(四)CUSUM失效与误报追踪队列实现远多于疾病:在参考阈值下,所有27个误报和8个漏检移位中的7个来自不同种子(卡方p = 0.002),因此在一个队列上调优的阈值无法迁移。所有结果均为合成数据,具有已知真值,不确立临床有效性。复现每个数字的代码、工件和脚本均已发布。

bioRxiv

标题 作者 发布日期 PDF链接 摘要
人类海马体中的语言语境化 Katlowitz, K. 2026-08-02 PDF 语言中的词义受周围词语的语境化影响。受基于Transformer的大语言模型(LLMs)中自注意力机制的启发,我们假设大脑中的结构组合源于将规范(非语境)词表示与邻近词表示相结合。我们在人类海马体(一个参与语义和语境处理的区域)中分析了单神经元活动,同时让n=10名参与者收听播客。我们发现,海马体神经元通过序数和频域位置编码来编码从句内的词位置。此外,对特定词的神经反应既反映了该词自身的词汇语义,也反映了前序词嵌入的加权和。这些语境化词的相对权重与LLM自注意力权重相关。这些发现表明,大脑中的语境化利用了与LLM中注意力重新加权相似的向量位移,并强调了内侧颞叶在更广泛语言网络中的作用。
STAR Suite:通过AI辅助开发在单一二进制文件中进行转录组学处理 Hung, L.-H. 2026-08-02 PDF 单细胞转录组检测——包括混合CRISPR/Perturb-seq筛选、克隆谱系追踪以及10x Flex固定RNA分析——是现代生物学的核心,但其数据处理一直依赖Cell Ranger,这是一种专有工具,仅限于10x产品,且没有针对Perturb-seq或Flex的开放端到端流程。我们推出STAR Suite,它将STAR比对器扩展为单一可执行文件,通过一条命令处理bulk RNA-seq、scRNA-seq、Perturb-seq、10x Flex和SLAM-seq,无需额外依赖。对于单细胞检测,它复现了Cell Ranger 9.0.1的结果(基因水平Pearson相关系数0.99-1.0),同时运行速度快3.6至5.7倍,这得益于新颖的精确匹配和比对验证哈希算法。通过一个经过验证的接口服务于AI代理和人类操作员,STAR Suite是NIH MorPhiC联盟的生产标准;其132,226行C/C++代码是在人类指导、AI实施的流程下构建的。源代码、工作流配方和每次运行的溯源信息均在MIT许可证下发布。
微管卷曲作为揭示轴突细胞生物学和神经退行性变基本概念的高效读出指标 Voelzmann, A. 2026-08-02 PDF 神经纤维(又称轴突)是神经细胞的细长突起,长度可达一米,它们构成了神经系统的连接网络。这些脆弱结构必须存活于生物体整个生命周期,因此成为神经退行性疾病中的主要损伤部位。其长期维持依赖于复杂的局部细胞生物学稳态,这由运动蛋白驱动的沿微管束运输所支撑,这些微管束沿轴突不间断延伸。为了理解轴突稳态,我们使用标准化的果蝇初级神经元系统,报告并讨论了105个基因在多种细胞生物学过程中的功能丧失。约40%的这些基因缺陷导致微管束紊乱,称为“微管卷曲”,我们将其用作轴突萎缩的指标。我们的活体成像显示,微管卷曲起始于轴突变宽的区域,如靠近胞体、分支点或生长锥的区域。在野生型神经元中,任何起始的卷曲都被限制,但在促进卷曲的突变条件下,它持续存在并形成增长的足迹。对20种促进卷曲条件的进一步分析提出了一种大致分为两组的分类:影响轴突生理的突变导致ROS介导的微管卷曲,而引发运动蛋白过度激活或影响微管调节蛋白的突变则导致结构诱导的非ROS依赖性卷曲。正如将要讨论的,我们的数据为先前提出的“局部轴突稳态依赖循环”模型提供了一致支持,该模型可以解释一个长期存在的谜团:来自多种细胞生物学过程的基因常常与同一类遗传性神经退行性疾病存在突变关联。
利用解析的祖先转录状态重建整个生物体的细胞系统发育 Liu, Z. 2026-08-02 PDF 将细胞谱系追踪与单细胞RNA测序相结合,可以重建系统发育树,以整合单细胞转录组图谱。然而,该树的内部节点——代表祖先细胞——在转录上保持沉默,阻碍了沿谱系纵向追踪细胞状态动态。在此,我们通过重建15个斑马鱼幼虫的高分辨率合子到幼体发育细胞系统发育,并直接测量末端节点(即采样细胞)的转录组,克服了这一障碍。利用一组谱系定型上调基因(LUGs),我们开发了LUG编码祖先投影(LEAP),一种基于系统发育的新型计算框架,并成功推断了系统发育内部节点的转录状态。这首次在非线虫生物中实现了谱系信息指导的发育全程细胞状态动态纵向分析。我们的分析揭示了一个与孵化相关的主要且此前未被认识到的命运特化波,区别于已充分表征的原肠胚形成事件。此外,我们发现了大量已决定命运但转录分化极小的初始细胞状态,揭示了发育命运特化的隐藏层。总之,通过解析重建细胞系统发育的祖先转录状态,这项工作为构建复杂生物中谱系分辨的细胞图谱铺平了道路,以全面表征细胞状态动态。
远距离扩散驱动了广泛分布蛾类谱系(鳞翅目:刺蛾科)的全球热带分布格局 Taberer, T. R. 2026-08-02 PDF 理解全球生物多样性模式如何形成是生物地理学的核心主题,当代理论认识到扩散和隔离分化两者的作用。广泛分布的属可以为解开这些过程在进化时间尺度上的相对影响提供重要系统。然而,许多研究较少的类群,尤其是热带地区的类群,缺乏密集采样的系统发育树,这阻碍了对其进化和生物地理历史的稳健推断。本研究探讨了假定泛热带分布的蛾类属Parasa Moore(鳞翅目:刺蛾科)的全球多样化和系统学,旨在评估扩散和隔离分化在塑造其分布中的相对重要性。通过对主要来自博物馆标本的中等覆盖度全基因组测序,生成了Parasa及其相关属(Parasa复合群)的全球采样时间校准系统发育树。祖先范围估计分析被用于推断地理起源和生物区域间可能的扩散时间。Parasa复合群起源于非洲晚渐新世(约24百万年前),并通过早-中中新世的一系列长距离扩散事件,扩展到亚洲(约23百万年前)和美洲(约21百万年前)。在所有区域中,扩散是塑造现今分布的主导过程,而隔离分化在某些亚区域中的作用有限。系统发育分析进一步表明,Parasa并非单系属,多个独立谱系促成了其明显的泛热带分布。这些发现强调了长距离扩散在产生某些全球分布模式中的核心作用。结果支持一个动态的范围进化模型,涉及中新世快速扩散和随后的区域多样化。此外,Parasa的非单系性需要大量的分类修订,强调了稳健的系统发育框架在解释全球生物多样性模式中的重要性。
人类大脑microRNA表现出细胞类型特异性和年龄依赖性 Dubnov, S. 2026-08-02 PDF MicroRNAs在调控大脑过程中发挥关键作用,涵盖从神经发生到神经系统疾病,并参与多种细胞类型特异性通路。然而,单细胞小RNA测序的技术限制使大多数研究局限于整体组织样本的批量分析,限制了我们对大脑MicroRNAs细胞类型特异性的解析及其功能的深入研究。为生成人类大脑中全面、细胞类型分辨的MicroRNAs图谱,我们从新鲜神经外科手术来源的脑样本中分离出神经元、星形胶质细胞、小胶质细胞和少突胶质细胞,并通过RNA测序分析其小RNA谱系。结果显示,MicroRNA谱系存在显著的细胞类型相关差异,识别出新型细胞类型特异性MicroRNA标记,并揭示了其起源基因组位点对细胞类型特异性的贡献。我们进一步表征了MicroRNA链偏好性和isomiR加工的细胞类型依赖性,并识别出与大脑衰老相关的细胞类型依赖性MicroRNA程序。结合配套的细胞类型信号富集统计工具,我们的图谱为人类大脑中细胞类型分辨的MicroRNA分析提供了公开可用资源。

medRxiv

标题 作者 发布日期 PDF链接 摘要
评估不同妊娠期间歇性预防治疗分娩策略在中度和高度疟疾传播环境下对低出生体重结局的影响:一项建模研究 Chakuvinga, L. 2026-08-02 PDF 引言:妊娠期疟疾是导致新生儿低出生体重(LBW)的主要风险因素,进而对儿童的生长发育产生负面影响。世界卫生组织(WHO)建议疟疾流行国家的孕妇采取干预措施,包括使用妊娠期间歇性预防治疗(IPTp)。然而,WHO指出,孕妇接受推荐剂量IPTp的覆盖率仍然很低。本研究的主要目标是评估提高IPTp剂量覆盖率的效果,并评估妊娠时间与季节性传播的关系对妊娠期疟疾感染及新生儿低出生体重的影响。我们在中度和高度传播环境中探讨了这些效应。方法与发现:构建了一个描述妊娠期疟疾及IPTp剂量的分区数学模型,以分析IPTp、杀虫剂处理蚊帐(ITN)使用及季节性变化在中度和高度疟疾传播环境中的效果。模拟结果表明,将ITN使用和IPTp剂量覆盖率均提高至高水平,可分别预防8月起始妊娠在中度和高度传播环境中90%和84%的临床病例。模型预测,将IPTp首剂覆盖率提高至90%,同时降低后续剂量,可分别避免中度和高度传播环境中8月队列44%和37%的低出生体重病例。未受保护且妊娠期第三孕期与1月降雨和疟疾发病率高峰重叠的妊娠,承受最高的低出生体重负担。结论:最高的IPTp覆盖率可预防最多的低出生体重病例,为扩大IPTp实施提供了益处证据。总体而言,我们的结果表明,提高ITN使用率在减少妊娠期临床疟疾病例方面具有显著影响,并改善出生结局。这凸显了其作为关键干预措施的重要性,以及为孕妇疟疾控制目标提供的健康益处。妊娠期与流行病高峰在后期重叠会导致低出生体重增加,表明有必要保护有疟疾感染风险的孕妇直至分娩。