跳转至

2026-10-03 每日论文

来源 独立页面
arXiv arXiv
bioRxiv bioRxiv
medRxiv medRxiv

arXiv

标题 作者 发布日期 PDF链接 摘要
摩尔、埃舍尔、彭罗斯:共形黄金辫 Sophia Feldman 2026-10-01 PDF 我想我一生中从未做过如此奇特的事情。除此之外,它展现了一个年轻人饶有兴趣地看着展览墙上的一幅版画,而那幅版画描绘的正是他自己。这怎么可能呢?也许我离爱因斯坦的弯曲宇宙并不遥远。'' M.C. 埃舍尔如此描述他1956年的石版画《版画画廊》。近半个世纪后,一项数学分析通过共形幂映射 $z \mapsto z^α$,$α\in \mathbb{C}$,将其几何结构与一幅未扭曲的源图像联系起来。在此构造的基础上,我们使用一个冻结的文本到图像扩散模型来生成新的自指场景。仅靠提示词并不能强制实现递归,而事后变换则可能使结构连接不良。在采样过程中施加变换同样不够:去噪器可能会“修复”预期的扭曲,或偏离规定的几何结构。我们构造了不可逆图像变换 $T$ 的广义逆 $T^\dagger$,并使其适应其递归约束。在理想化的表述中,彭罗斯恒等式 $TT^\dagger T = T$ 使 $TT^\dagger$ 成为到几何容许图像上的幂等投影。然而,即使有投影,仅对变换后的图像去噪仍然是一个分布外任务。因此,我们将去噪步骤与 $T$ 和 $T^\dagger$ 交织在一起:源空间步骤发展未扭曲的场景,而变换空间步骤则在最终几何结构中细化其外观和连接。我们生成类似《版画画廊》的构图,并探索进一步的变换。我们不是扭曲一幅已完成的图像,而是让场景及其扭曲共同发展。
球体编码器2 Kaiyu Yue 2026-10-01 PDF 球面编码器是一种自编码器,通过从高维潜在球面上解码随机点来生成图像。我们识别出原始公式中的两个限制,这些限制降低了其生成质量。首先,相对于编码潜在空间中的极点,随机点集中分布在赤道附近,但训练旋转从未到达这一区域,留下了一个限制单步生成的空白。其次,使用像素级重建损失进行生成训练会促使解码器对可能的图像进行平均,产生缺乏高频细节的模糊图像。我们提出球面编码器2来解决这两个限制,在保持自编码器速度和简单性的同时,大幅提高图像生成质量。模型发布在\href{https://github.com/kaiyuyue/sphere2}{github.com/kaiyuyue/sphere2}。
一个基础驱动所有:用于实时虚拟形象的高斯混合形状蒸馏 Ramazan Fazylov 2026-10-01 PDF 3D高斯化身支持快速渲染,然而其实时动画常受限于高昂的神经推理成本。我们针对这一瓶颈展开研究,并表明预训练化身模型的动画可以通过身份无关的blendshape线性组合来紧密近似。基于这一发现,我们提出了GALA(Gaussian Animation via Linear Approximation),一种蒸馏方法,用浅层系数预测器和线性混合替代逐帧的繁重神经解码。为提高保真度并降低内存需求,我们提出在渲染感知度量和内存预算下使用块局部PCA构建基。我们的方法学习一个浅层MLP网络来预测blendshape系数,并可应用于多种动画架构而无需重新训练原始模型。我们通过加速三种不同的化身模型(用于面部表情的3D动画以及带衣物动态的全身动画)的推理来验证GALA。在这些模型中,我们的蒸馏方法能够泛化到未见过的身份,并将CPU动画成本降低最多三个数量级,同时保留大部分渲染质量。我们方法的优异结果证实了所学化身表示的共享线性结构,并实现了在移动设备上高达60fps帧率的高效且准确的动画。项目页面:https://ramazan793.github.io/gala/
KaliBench:一个面向Kali Linux网络安全工具使用的细粒度基准,具有无需运行时即可验证的奖励 Pengfei Li 2026-10-01 PDF 大型语言模型正越来越多地应用于网络安全工作流,人们期望其将分析人员的意图转化为工具调用。然而,现有评估侧重于基于知识的测评或端到端智能体任务,并未直接衡量大型语言模型为真实网络安全工具生成可执行命令的能力。这一空白至关重要,因为网络安全操作依赖严格的命令行界面,其中细微的语法错误、错误的标志—值绑定或参数顺序错误都可能导致执行失效。我们提出KaliBench,一个用于Kali Linux上自然语言到命令行界面翻译的细粒度基准与数据集,包含8,504个查询—命令对,覆盖23个能力维度和5个安全阶段中的1,642个工具。KaliBench通过基于手册的流水线构建,采用确定性规范化与别名感知评估,从而能够对工具选择和参数构造进行精确且可复现的评估。为确保语义正确性与实际可执行性,我们开发了一个多阶段验证流水线,结合基于大型语言模型的验证、沙箱终端执行和人在回路中的改进。基于这些细粒度、确定性的信号,KaliBench进一步支持用于训练的免运行时可验证奖励。在三种评估模式和24种通用及面向安全的开放权重模型配置下,在无限制设置中,没有任何开放权重模型的精确命令准确率超过42%,凸显了在没有明确工具提示的情况下准确使用基于命令行界面的网络安全工具的难度。我们进一步表明,使用源自KaliBench的可验证奖励进行监督微调和强化学习,可显著提升一个8B模型,并达到与一个685B MoE模型相当的性能。
ROWBench:视频模型是否渲染出程序所指定的内容? Zheng-Hui Huang 2026-10-01 PDF 可编程世界模型将可执行动力学与视觉生成分离,为下一代游戏引擎提供了有前景的基础。然而,其对显式规则和交互的视觉遵循程度仍未得到充分评估。现有基准评估视觉质量、可控性以及指令或物理遵循性,但很少测试对细粒度、程序指定的世界事件的保真度。我们提出了 PROWBench,包含 170 个程序化构建的情节和 600 个代理视频,覆盖多样场景和交互。PROWBench 记录实体状态和带时间戳的事件,包括相机视野之外的事件,作为可重放的世界记录,并据此渲染同步视图和代理表示。这使得生成的视频能够对照程序执行的可观察后果进行检查。一个可扩展框架构建场景、控制行为,并能以不同表示渲染每个相机视图,例如粗粒度 3D 和边界框。该基准涵盖第一人称和第三人称视角,并为部分情节提供同步多视图观测。基于这些记录,PROWBench 评估实体控制、长时程记忆,并通过两个基于 VLM 的指标——逻辑-渲染对齐和交互成功率——评估对规定时间线的遵循以及带时间戳的引擎记录事件的视觉实现。
重建、实践、走向真实:具身智能体的引导式自我提升 Yen-Jen Wang 2026-10-01 PDF 构建跨多种任务的可靠机器人能力需要大量人力来开发与维护技能、设计奖励,并将感知与控制集成。我们提出Reconstruct, Practice, Go Real(RPG),一个在不更新模型权重的情况下自主改进机器人执行系统的框架。RPG在离线数据集中识别操作能力,并在仿真中构建相关练习任务。在练习过程中,RPG利用执行反馈、特权仿真器状态和可用数据集视频来诊断失败。它基于这些诊断开发新的可复用符号技能、改进现有技能并修订系统提示。跨任务评估测试各个候选变更和合并修订,之后才将其保留以供复用。在测试时,一个多模态LLM使用所得的系统提示和技能库来协调感知与机器人控制。在22个操作任务的留出初始化上,RPG将任务成功率从第一轮练习后的28.6%提升到15轮后的95.0%,优于所有评估的基线,包括ASPIRE(75.5%)和由GPT-6 Astra Pro驱动的CaP-Agent0(60.0%)。经过通用的校准和硬件适配流程后,冻结系统在所有30次物理试验中均成功,其中三个任务各进行十次试验。项目网站:https://rpg-robot.github.io/
嵌入预测有助于图像生成 Sihan Xu 2026-10-01 PDF 在扩散Transformer中,类别标签或文本提示被嵌入一次,并在每个去噪步骤中重复使用相同的条件。我们探究预测嵌入能否替代其作为条件。下一嵌入预测自回归(NEPA)训练一个Transformer来预测序列中的下一个连续嵌入。在生成过程中,干净图像紧随噪声图像之后,因此其嵌入是条件和噪声图像之后的下一个嵌入。我们训练一个NEPA模型,通过多嵌入预测一次性预测所有嵌入,并在嵌入条件生成中,一个DiT生成器以这些预测为条件,在每个去噪步骤重新计算,因此条件信号适应于当前的噪声状态。在类别条件ImageNet $256\times256$上的实验研究了生成器的条件、多嵌入预测的设计以及两个模型的扩展。NEPA模型在每个采样步骤中增加第二个网络;借助它,并结合REPA,我们的最终模型NEPA-DiT-XL达到了1.32的FID,使用的训练计算量约为REPA的三分之一。
ScholarCatalyst:一个用于检索激发新研究的论文的基准 Sohyeon Kim 2026-10-01 PDF 是什么让伟大的科学家伟大?即便AI系统开始在开放问题上取得进展,科学家在感知一个新问题需要哪些埋藏在不断增长的研究档案中的先前想法方面,仍然远远领先于它们。为了研究这种能力,我们借助那些 firsthand 知道哪些早期工作推进了其已完成项目的研究人员,论文则充当指向其中想法的指针。利用我们使作者标注可扩展的自动化流程,我们通过让207篇近期计算机科学论文的184位主要作者标注哪些候选工作已经或本可以推进其项目,并附上详细理由,构建了ScholarCatalyst。我们引入了一项带有作者提供判断的检索任务:给定一个初始研究问题,仅从项目开始时已有的文献中检索这些论文。Agentic search并不比嵌入检索表现更好(0.42 vs. 0.48 Recall@20),尽管它调用了同一个检索器作为工具。即便是一个基于Claude Fable 5.1构建的智能体,它可能在训练期间见过这些已完成的论文,也只达到0.51 R@20。这些结果凸显了需要新的训练方案,使模型具备在广泛语料库中搜索的专家直觉。我们将ScholarCatalyst设想为迈向科学智能体的一步,这些智能体能够接受一个半成形的想法,并指出它所需的先前研究。
SILSA:用于拓扑保持高分辨率三维生成的滑动窗口切片潜在表示 Tianjiao Yu 2026-10-01 PDF 高分辨率三维生成日益依赖体素隐变量和多阶段流程,即先预测活跃结构,再合成局部几何。尽管有效,这种设计将连续表面碎片化为大量局部 token,增加了生成成本,并且常常削弱薄或高度连通形状的拓扑一致性。我们提出 SILSA,一种拓扑感知的三维生成框架,用紧凑的滑动窗口切片隐变量表示形状。SILSA 不生成昂贵的体素 token,而是沿三个规范轴使用一组固定的重叠切片,其中每个 token 概括一个局部深度窗口,以保持横截面连续性并支持单阶段整流流生成。Slice VAE 将有向表面样本编码为多轴切片隐变量,并用稀疏体积解码器重建,而 Volumetric Anchor Lattice 通过共享三维工作空间协调各方向切片流。为保持结构正确性,我们引入切片级拓扑监督,匹配持久图并对齐相邻切片间的 Betti 转变。实验表明,SILSA 在提高结构保真度的同时大幅降低生成成本。相比最强基线,SILSA 将 PSNR 提高 $8.7\%$,覆盖率提高 $5.96$ 个绝对点,Betti 误差降低 $9.2\%$,同时比次紧凑基线少用 $70.0\%$ 的 token,比稀疏或分层 tokenizer 少用超过 $98\%$ 的 token,有效减少 $40.4\%$ 的训练内存和 $58.5\%$ 的推理时间。定性结果进一步显示,薄结构、重复组件和长程连通性得到更好的保持。
VISTA:交互世界中推理的视觉框架 Qiushi Han 2026-10-01 PDF 我们表明,多模态模型具备强大的推理能力,而一个合适的框架能够释放其在多样化交互环境中解决任务的潜力。我们提出VISTA,一种视觉框架,赋予通用多模态模型长时程视觉能力。VISTA允许模型通过视觉观察直接感知环境,并维护无损视觉记忆,以原始形式保存过去的观察。模型可以在推理时主动检索这些观察并重新组织其视觉输入。在ARC-AGI-3上,VISTA将Claude Opus 5.0的相对人类行动效率得分从40.68提升至完美的100.00,模型完成全部25个公开游戏所用的行动次数比首次参与的人类玩家少57.4%。VISTA的简洁设计还使其能够以极少的适配自然扩展到多样化的视觉环境。在涵盖多种视觉游戏和谜题的另外三个基准测试中,它大幅优于使用相同底层模型并仅配备最小框架的基线方法。我们的结果凸显了VISTA作为通用视觉框架的潜力,可推动多模态智能体在复杂视觉环境中的发展。

bioRxiv

当天没有抓取到有效论文。

medRxiv

标题 作者 发布日期 PDF链接 摘要
验证机器学习模型使用视频尿动力学数据对脊柱裂患者膀胱功能障碍分类和肾积水风险的预测 Weaver, J. K. 2026-10-03 PDF 目的:视频尿动力学(VUDS)用于评估脊柱裂(SB)患者的膀胱功能障碍及上尿路恶化风险,但其判读存在评估者间差异。机器学习模型此前已利用VUDS数据对膀胱功能障碍严重程度进行分类并预测新发肾积水。本研究在独立外部队列中评估了这些模型适配版本的性能。材料与方法:收集2016年至2025年间在单一机构接受VUDS的SB患者的VUDS数据。将此前开发的机器学习框架适配用于独立数据集。使用了三种模型:使用压力-容积数据的深度学习卷积神经网络模型、使用透视成像数据的深度学习影像模型,以及对压力-容积和透视数据风险取平均的集成模型。将这些模型与专家小儿泌尿外科审阅者相比,评估其对新发肾积水的预测和膀胱功能障碍严重程度的分类。结果:肾积水队列纳入70例患者,其中13例(18%)发生新发肾积水。集成模型优于单一模态,一致性指数为0.77(仅压力-容积:0.70,仅影像:0.72),总体AUROC为0.75(压力-容积:0.67,影像:0.74)。对于95项VUDS研究中的膀胱功能障碍分类,集成模型达到71%的准确率,而仅压力-容积数据为60%,仅影像为66%,且与专家审阅者无实质性分歧。结论:为利用VUDS数据预测新发肾积水和分类膀胱功能障碍严重程度而开发的机器学习模型,能够适配至外部独立数据集,并表现出与既往报道相似的区分度和准确率。
多组学数字食物即药物项目成员中肠易激综合征症状严重程度的变化:一项对均值回归进行校正估计的回顾性单臂队列研究 Pedroso, I. 2026-10-03 PDF 背景:关于食物即药物项目用于肠易激综合征(IBS)的真实世界证据稀缺,而单臂评估因均值回归(RTM)而高估改善程度。我们在一个多组学个性化数字健康食物即药物项目中估计了IBS症状严重程度量表(IBS-SSS,0-500)的变化,包括未校正和RTM校正后的结果。方法:回顾性单臂队列。在15,933名具有有效基线的成员中,2,254名有随访读数,1,683名在基线后至少14天有一次读数。通过基线严重程度分层,在4、12(主要)和26周估计变化,采用未校正和通过协方差分析进行RTM校正。应答者定义为下降至少50分(最小临床重要差异基准)。敏感性分析涵盖公平性、逆概率加权和临界点分析,针对每个标志窗口内无读数的成员、阴性对照分层和药物。在成员内和成员间评估体重减轻和膳食营养密度与症状变化的关联。结果:在12周时(n = 430),IBS-SSS未校正下降43.88分(95%置信区间[CI] -52.44至-35.32;p < 0.001),RTM校正后下降47.73分(-55.48至-39.98;p < 0.001);1,339名有症状成员中有720名(53.8%;95% CI 51.1至56.4)下降至少50分。更严重成员的更大改善在RTM校正后持续存在(严重分层,n = 37:未校正-127.43,RTM校正-60.71,95% CI -97.75至-23.68,p = 0.001)。较高的膳食营养密度与成员自身轨迹内较低的IBS-SSS相关(p = 0.018),而体重变化则不相关(p = 0.361)。尽管基线因年龄和性别存在差异,各组间改善相似:RTM校正的12周变化不因年龄(p = 0.458)、体重指数(p = 0.328)、性别(p = 0.749)、收入(p = 0.486)或族裔(p = 0.170)而异。估计值对标志窗口内无读数成员的加权具有稳健性(RTM校正估计值变动小于2分),且这些成员的变化必须比观察到的差39至73分,均值变化才会达到零。基线药物使用和开始使用GLP-1受体激动剂不能解释症状变化。结论:项目参与者的IBS-SSS显著下降,更严重组的改善更陡峭,即使在RTM校正后也是如此。改善在社会经济特征、年龄和性别方面相当,并且对所评估的混杂因素和缺失数据假设具有稳健性。这些来自自选单臂队列的关联值得在独立研究中重复验证。
使用基于人群的MRI在大小样本中预测ADHD的认知功能 Lal Khakpoor, F. 2026-10-03 PDF 机器学习为将神经影像转化为精神表型的预测工具提供了一个有前景的框架。然而,一个主要的转化挑战是,在大型、异质性人群队列上训练的模型能否在没有数据集特异性调优的情况下泛化到临床人群。在此,我们测试了基于神经影像的认知预测模型对注意缺陷/多动障碍(ADHD)儿童的泛化性。利用青少年大脑认知发展(ABCD)研究的基线数据(n = 11,747),我们在81个由MRI衍生的特征集上训练了预测模型,这些特征集涵盖基于任务的fMRI对比、功能连接、结构MRI和弥散测量及其多模态堆叠组合。我们分别在非ADHD参与者和日益严格的ADHD分层中测试了性能,并进一步在一个独立的ADHD队列(Lytle et al., 2020; n=79)中评估了外部泛化性,且未进行再训练。在内部,整合所有特征集的堆叠模型达到了最高的预测准确度(r=.57),并再现了观察到的组水平认知差异,同时在ADHD和非ADHD组之间保持了相当的性能。在外部,堆叠的工作记忆任务模型泛化到了独立的ADHD队列(r=.44)。总之,这些发现提供了证据,表明基于人群训练的多模态神经影像模型能够捕捉ADHD和非ADHD组中与认知相关的神经变异,而外部验证则为跨队列和测量情境的可迁移性提供了初步证据。
评估人工智能与神经科医生诊断推理在神经病理学金标准下的表现 Leng, Y. 2026-10-03 PDF 背景 由于临床表现重叠和疾病表现异质性,复杂神经系统疾病的准确鉴别诊断仍具挑战性。尽管大语言模型在临床推理中展现出前景,但既往研究多以临床医生共识而非生物学金标准来评估其性能。神经系统诊断人工智能的评估需要以神经病理学发现为基础的基准。方法 我们提出 NeuroBench,一个以神经病理学确诊为参考标准的复杂神经系统病例精选基准,以及 DIAGNO,一个基于大语言模型且具有置信度感知的神经系统诊断系统。NeuroBench 包含来自三个独立医疗系统的 791 份回顾性病例摘要及相应的尸检确诊诊断:500 例来自麻省总医院脑切片会议;200 例来自西奈山医疗系统;91 例来自德克萨斯大学圣安东尼奥健康科学中心。在所有病例中,DIAGNO 生成前 3 位鉴别诊断,并对低置信度病例采用检索增强生成。在 203 例复杂麻省总医院病例的子集中,由三名独立盲法评审员将 DIAGNO 与神经科医生分别对照神经病理学金标准进行评估。结果 NeuroBench 涵盖 59 种独特的神经病理学诊断,涉及脑血管病、脑肿瘤、神经系统感染以及多种神经退行性和炎症性疾病。DIAGNO 在 500 例麻省总医院病例中达到 83.8% 的前 3 位准确率,在 200 例西奈山病例中达到 76.5% 的准确率,在 91 例德克萨斯大学圣安东尼奥健康科学中心病例中达到 92.3% 的准确率。在 203 例麻省总医院病例子集中,DIAGNO 的前 3 位准确率高于神经科医生(0.67 对 0.63),分类学层面准确率也更高(0.74 对 0.67)。在意见不一致的病例中,DIAGNO 正确的情况多于神经科医生(29 例对 19 例)。DIAGNO 与神经科医生之间的诊断一致性较高(前 3 位预测一致率为 90%)。在对麻省总医院布莱根医疗系统 8 例病例的真实世界评估中,神经科医生对 DIAGNO 的推理在多个维度上给予良好评价(平均 4.03/5)。结论 NeuroBench 确立了神经病理学确诊作为评估神经系统诊断人工智能的参考标准,超越了基于临床医生的基准评估,重新定义了诊断准确率的上限。依据该标准评估,DIAGNO 达到了与神经科医生相当的诊断性能,并在真实世界应用中获得了临床医生的良好评价,支持其作为神经系统临床决策支持工具的潜力。
成人肠易激综合征患者疼痛的音乐干预临床和机制反应:单臂初步研究方案 Wu, W. 2026-10-03 PDF 肠易激综合征(IBS)是一种常见的脑-肠互动障碍,以反复发作的腹痛和排便习惯改变为特征。尽管基于音乐的干预(MBI)已显示出对疼痛和压力的益处,但与MBI相关的IBS疼痛变化机制仍知之甚少,且在日常生活中使用多模态可穿戴监测捕捉这些反应的可行性尚未确立。本方案描述了一项单臂试点机制性试验,旨在考察IBS成人患者对MBI的临床和多模态机制反应,以及将生理监测从实验室扩展到家庭环境的可行性。将招募36名年龄在18-50岁、经医疗服务提供者确诊为IBS的成人,预计约30名将完成干预后实验室访视。参与者将接受由委员会认证的音乐治疗师指导的实验室课程,并使用标准化的20分钟MBI方案完成为期四周的自我管理家庭练习,每周至少五天。在脑-肠机制框架指导下,评估将包括患者报告的疼痛、压力和IBS症状;定量感觉测试;使用16S rRNA基因测序的肠道微生物组分析;以及神经、自主神经和肌肉活动的多模态生理记录。分析将描述临床和机制指标在单次会话内及纵向的变化特征,并评估招募、保留、MBI依从性、可穿戴数据完整性和参与者可接受性。研究结果将为未来一项具有足够把握度的随机对照试验中候选机制和可穿戴监测方法的评估选择提供依据。
终身测序:关于终身基因组医学价值与可行性的专业观点 Lewis, A. C. F. 2026-10-03 PDF 引言。终身基因组医学,即利用储存的基因组数据为终生医疗提供信息,正从愿景走向现实,全球已有数十个新生儿测序项目正在开展,数据再分析也已进入临床实践。关于其价值和可行性的专业观点尚未得到考察。方法。我们对52位美国专业人士进行了半结构化访谈并进行了主题分析,包括临床遗传学家、遗传咨询师、初级保健临床医生、实验室人员以及基因组筛查实施者。访谈探讨了服务提供场景、纵向临床关系、数据再分析和再次联系、知情同意、数据管理、隐私以及儿科到成人的过渡。分析将演绎领域与归纳编码相结合,并关注各利益相关群体之间的异同。结果。所有五个群体的参与者都认为终身基因组医学具有临床价值, citing 基因组信息在多个生命阶段的相关性、随着情况变化重新查询基因组的能力,以及根据不断演变的知识采取行动的能力。少数人质疑这一价值,倾向于更有针对性的检测。许多参与者认为该模式不可避免,并描述了许多组成活动的操作先例,从对十年前数据的再分析和重新分类流程,到“一次测序,多次查询”工作流程和电子健康记录整合警报。参与者描述了治理方面的重大缺口,涵盖服务提供场景、知情同意、数据管理、再次联系以及儿科到成人的过渡,同时还有持续存在的操作挑战,如互操作性。没有哪个服务提供场景被明确青睐:参与者认为新生儿筛查提供了最强的公平性理由,但与其将要求的明确知情同意相冲突;卫生系统提供将那些无法获得服务的人排除在外;商业模式可能寿命短暂。参与者在入组、维持随访以及儿科到成人交接环节提出了公平性担忧,我们认为这些担忧对于与卫生系统联系最少的人群而言是累积且相互强化的。结论。许多参与者预计终身基因组医学将会实施,但尚未出现一个全面或明确受青睐的负责任提供模式。需要在治理方面进行协调投资,同时需要证据表明哪些形式的终身基因组医学具有足够的临床价值以证明其成本合理。
慢性护理路径优化的强化学习:跨三种临床目标类型的统一框架 Wang, R. 2026-10-03 PDF 慢性病照护需要在生物标志物、安全性和成本等多重约束下进行序贯治疗,而不同疾病的临床目标结构各不相同。本版本探讨一种基于生理学的强化学习范式能否只编写一次,然后无需疾病特异性策略架构即可实例化用于三种目标结构(达标治疗、多标志物巡航和有界周期完成)。痛风、慢性肾脏病和PCOS介导的生育治疗是三个实例。训练采用行为克隆,随后对每种疾病500条模拟轨迹进行近端策略优化。评估使用配对种子(N = 50主要分析;N = 500自助法95%置信区间)、多种子偏移42-51、消融和分布外特征。PCOS(周期完成):在N = 50时,PPO为72.0%,医生基线为54.0%;在N = 500时,PPO为69.8% [65.6, 73.8],医生为52.8% [48.8, 57.2]。痛风(达标治疗):PPO为88.0%,对照为90.0%(McNemar p = 1.0)。CKD(巡航):医生为32.0%,BC/PPO为38.0%。本v2撤回v1中出现的三个文献坐标,它们与任何可恢复来源均不匹配。被撤回的比较由第4、8和12周的NOR-Gout校准替代,该校准属于平行期刊手稿重新校准后的核心内容。共享的BC到PPO训练在三种目标类型中实例化,且不进行跨疾病权重共享。前瞻性验证仍有必要。