跳转至

arXiv 2026-08-19

标题 作者 发布日期 PDF链接 摘要
从语料到协同演进的能力:面向通用图像生成的能力中心数据设计 Xingjian Wang 2026-08-18 PDF 大规模图像生成受益于数据规模、质量、再平衡和重新标注方面的进步,但传统流程通常孤立地优化特定任务的数据集。核心挑战不仅在于如何策划每个任务特定的语料库,还在于如何根据生成能力之间的依赖关系组织异构监督。我们提出了一种能力驱动的数据基础设施,将能力特定的监督构建与能力对齐的课程调度相结合。其三个专门但可互操作的数据引擎为文本-图像接地、图像间变换和图像-知识关联构建互补的关系监督,而字幕专家则跨任务和粒度对齐T2I和编辑监督。一个多阶段课程沿着能力获取的依赖顺序共同演化任务组成、视觉概念分布、数据质量和图像分辨率,能力感知评估通过定向检索、专家构建和差距感知重采样闭环。在规模上,该框架策划了4.4亿图像的T2I语料库、1.2亿编辑对和超过2700万图像-实体对。借助这一基础设施,我们从零开始训练了两种规模的多模态扩散模型,分别为3B和6B参数。我们在CPI-Bench上进行定量评估,并在多样化的文本到图像和编辑场景中进行定性评估。实验结果展示了广泛的视觉覆盖、多功能的渲染以及跨生成能力的有效迁移。
面向放射学报告结构化与质量保证的多智能体AI系统,并包含独立放射科医师评估 Iryna Hartsock 2026-08-18 PDF 目的:开发并评估一个本地部署的多智能体AI系统,用于放射学报告结构化和质量保证。材料与方法:本回顾性研究纳入了2023年和2024年由15名委员会认证放射科医生口述的638份胸部、腹部和盆腔CT检查放射学报告。开发了一个多智能体AI流程,用于执行报告结构化和质量保证(QA)。该系统使用正则规则和本地大语言模型,在句子级别将报告结构化为标准解剖部分。它还检测了“发现”与“印象”部分之间或部分内部的不匹配、性别-解剖冲突,以及未记录的关键发现沟通。两名委员会认证放射科医生独立评估了一个45份报告的子集。结果:多智能体系统将所有报告(22,270个句子)的“发现”部分结构化为预定义的解剖格式,同时保留原始报告内容。系统标记了90份(14.1%)报告,最常见的是部分不匹配(80份报告,12.5%)。在放射科医生评估中,两位审阅者一致认为31份(69%)被正确重构,2份(4%)被错误重构,并对剩余12份(27%)意见不一。两位审阅者一致认为没有遗漏临床重要信息,也没有引入虚构内容。总体QA性能在84%的评估报告中被评为“优秀”或“良好”,其余报告被评为“一般”。结论:一个本地部署的多智能体AI系统在单一流程中结合了放射学报告结构化和质量保证。该系统在放射科医生评估中表现出良好性能。此类系统可能支持放射学实践中报告标准化和质量保证。
论自我改进智能体的脆弱性:方差、任务顺序与欠规格化 Qinyuan Ye 2026-08-18 PDF 基于记忆的自我改进智能体——它们通过在线任务流学习,并借助维护文本记忆库随时间提升性能——在近期文献中展现出巨大潜力。然而,这些方法的可靠性方面被严重忽视。在本研究中,我们对两种基于记忆的方法进行了全面重新评估,沿两个维度扩展了评估范围:(1)包含多次运行以量化方差,(2)随机打乱任务顺序以探究任务顺序的影响。通过这些实验,我们得出两个观察结果,揭示了当前方法的脆弱性:首先,在复杂环境和多步骤任务中,智能体评估本质上带有噪声,而叠加自我改进循环可能进一步放大这种噪声。其次,智能体的改进高度依赖于任务顺序。先前工作常采用默认排序,这隐含了一种课程式学习,成为成功的隐藏前提。为更好理解这种脆弱性,我们手动检查了智能体的记忆,并假设任务和环境规格不足是导致此脆弱性的因素。我们通过将能提供更好规格的信息(如详细评分标准和环境反馈)纳入记忆构建过程来验证这一假设。虽然这些附加信息部分弥补了先前实验中的性能下降,但显著差距依然存在,表明其他未表征因素也促成了这种脆弱性。展望未来,我们的工作倡导对自我改进智能体采用更严格的评估协议,通过报告多次运行结果并在挑战性条件下进行压力测试。此外,我们关于规格不足的发现呼吁构建支持有效人类监督的系统与界面,防止智能体以不可预见的方式失败。
EDITBRIDGE:迈向忠实且高效的超高分辨率图像编辑 Jiayi Song 2026-08-18 PDF 高分辨率图像编辑在专业工作流中的需求日益增长,然而现有的基于扩散的模型受限于二次注意力复杂度和过高的内存需求,仍只能处理低于1K分辨率的图像。一种常见的解决方案采用两阶段流程:先在低分辨率下进行编辑,再独立进行超分辨率处理。然而,这种方法存在两个关键问题:信息发散,即幻觉细节与原始高分辨率(HR)源图像相矛盾;以及纹理退化,表现为过度平滑或过度锐化的伪影。我们提出EditBridge,一种用于高效超高分辨率编辑的扩散桥接框架。与从噪声中重新生成的传统扩散方法不同,我们将细化过程构建为从低分辨率(LR)编辑结果到其高分辨率对应版本的结构化数据到数据转换,并明确以原始高分辨率源图像为条件,以保留真实细节。为了高效整合高分辨率源引导,我们引入了一种基于先验的块状稀疏注意力机制,利用第一阶段编辑中的语义对应关系,将跨图像交互限制在空间对齐区域,从而显著降低计算开销。大量实验表明,EditBridge在高达4K分辨率下实现了高保真编辑和卓越的感知质量,在2K分辨率下实现了3.6至8.4倍的加速,并能在61秒内完成实用的4K编辑。
TokEval:分词器评估套件 Clara Meister 2026-08-18 PDF 语言模型分词器通常在评估不足的情况下被选择,尽管其设计选择直接影响模型能力。这在一定程度上归因于对哪些分词器属性影响下游性能的哪些方面理解有限。我们引入了TokEval,一个分词器评估指标框架,超越了生育率和压缩率等标准度量,以捕捉语言和结构上有意义的属性,例如UTF-8字符边界完整性和数学中的数字位值边界对齐。为了验证这些指标是否能预测下游模型性能,我们进行了受控的语言模型预训练实验,仅改变分词器的训练数据混合、预分词策略和训练算法。我们在每字节比特数(一种与分词器无关的困惑度版本)以及多个基准上评估了生成的模型,涵盖语言理解、数学推理和代码生成。我们的实验表明,不同的内在属性对模型能力有不同的影响:信息论指标预测语言建模能力(Spearman rho高达0.80),而结构敏感指标,如测量数字和换行处理的指标,与任务准确性相关。我们希望TokEval能实现更有原则的分词器评估,在两者一致的地方用内在测量取代预训练扫描。
浓度博弈:贝叶斯更新、遗憾与信息 Akshay Balsubramani 2026-08-18 PDF 我们给出一个学习者和自然之间的两人零和重复博弈,其价值恒等式同时生成贝叶斯更新和指数权重遗憾的精确核算,并提供了广泛浓度现象共享的比较器类变分形式。终端收益是固定相对熵下比较器相对于先验所能获得的最大值,而单步约束是自然在学习者混合行动下移动的信息预算。学习者的行动在其他方面不受限制,吉布斯/贝叶斯权重作为其唯一的贝尔曼均衡器出现——即使得每轮损失独立于自然移动方向的混合行动——其中对数配分函数扮演价值函数的角色。遗憾精确分解为三部分:反映观测结果变化的每轮信息损失、精确核算轮次间测量尺度变化的加性重调温漂移,以及比较器相对于先验所携带的信息。驱动标准遗憾界的方差和有界范围代理是该分解的宽松松弛,该分解普遍成立并支配它们。双方策略从分解中逐项读出,重复博弈产生信息论的自博弈账本,取代通常的二次变分替代。相同的比较器类几何解释了经典大偏差界,而老虎机、后验采样、聚合和提升中的方法都是这一个遗憾分解的特例。
代理推荐系统中的委派不对称性:在线约会中双向接受度的测量 Daria Leshchikova 2026-08-18 PDF 以用户名义进行对话的自主LLM代理,是匹配平台中一种新兴的设计模式,但其可行性取决于一个鲜少被审视的条件:用户不仅必须接受将对话委托给代理,还必须接受接收来自他人的代理中介通信。我们通过两项针对主流约会平台活跃用户的大规模调查(生成式个人资料特征N=2,894;自主对话代理N=2,617,以两种语言进行)来研究这一条件。我们基于带潜在回归的分级响应模型,开发了一个代理接受度的潜变量测量模型,并通过模型比较表明,发送意愿和接收代理通信意愿是不同的构念:高度相关(rho=0.92)但可分离(Delta BIC=52),且在不同语言间具有部分测量不变性。该模型量化了一种系统性的委托不对称性:部署自己的代理所需的接受度远低于参与对方代理(阈值-0.38对比+0.32;完全参与为+1.39),且平均部署倾向约为参与倾向的三倍。在基于陈述接受度的随机配对反事实下,仅有4-13%的有向二元组结合了代理部署与接收者参与,且存在显著的性别方向性失衡。设计反事实量化了杠杆效应:互惠要求将交互量削减一半或更多,排除了近三分之二的潜在部署;而基于接收接受度路由代理联系,使每次接触的参与度提升三倍,这一提升在目标项目被剔除的样本外验证中依然稳健(AUC 0.88,受访者级交叉验证下四分位提升3.1倍)。我们讨论了代理推荐系统设计的启示,包括披露、选择加入机制和接受度感知的匹配。
HLSR:面向实时拥堵规避的混合实时预测选择性动态车辆重路由 Xiao Wang 2026-08-18 PDF 城市交通拥堵降低了生产力,并增加了出行成本和排放。全网实时行程时间最短路径重路由在模拟中可能非常有效,但假设每辆在途车辆在每个决策周期都被重新规划。我们提出HLSR,一种选择性混合实时-预测车辆重路由框架,在有限干预范围内融合实时边缘速度与短期预测。基于双阈值拥堵检测、校准的上游选择和驾驶员定制的行程时间预测,HLSR进一步引入了接近车辆扩展、行程时间加权k最短路径生成,以及用于多成本路径分配的地平线依赖混合实时-预测路段速度。
用于无监督动态对比增强MRI重建的原始表示学习 Veronika Spieker 2026-08-18 PDF 动态对比增强MRI的可靠定量分析需要在高欠采样率下实现高质量的时空重建。基于高斯和Gabor基元的扫描特定重建方法在无需大型训练数据集的情况下显示出有前景的结果,但尚未解决动态对比这一额外维度。我们提出了一种基于多维基元的动态对比增强MRI重建框架,该框架将潜在解剖结构、动态对比增强和残余运动分离为独立的时间基函数,从而实现对表示形式的几何解释。我们表明,该架构在重建质量以及提取的主动脉和肾脏增强曲线的准确性方面,均能达到与传统重建方法相当的性能。模块化层级设计可自然扩展到额外的动态因素和更高的加速率。代码可在 https://github.com/compai-lab/ 2026-GaborDCE-spieker 获取。
StagedWorkspace:面向知识工作代理的版本化工作空间 Yining Hua 2026-08-18 PDF AI代理越来越多地执行知识工作(即生成和修改持久的数字工件,如代码仓库、文档、电子表格、幻灯片、报告),然而它们搜索的解析视图、编辑的原生文件、审查的更改以及提交的工件可能引用同一工作产品的不同版本。我们将此表述为工作区状态契约:每个视图都应明确绑定到演化中的工作区状态的某个版本。编码代理部分通过搜索、差异和测试的仓库契约解决了这一需求,而对于PDF、电子表格、幻灯片、笔记本和混合格式项目文件夹,类似的契约则不那么明确。我们提出StagedWorkspace,一个面向知识工作代理的版本化工作区。该工作区将解析记录和审查差异绑定到原生文件变化时的内容哈希。在OfficeQA Pro和APEX-Agents上的固定框架消融实验中,双解析/原生访问在每个测试模型上都有最高的点估计;相对于更受限的单视图,它将OfficeQA Pass@1提高了8.3-12.1个百分点,APEX平均评分提高了4.7-9.2个百分点。SW-AGENT在OfficeQA上使用Gemini 3.1 Pro得分为63.9%,在APEX上使用GPT-5.4 Nano得分为42.1,而已发布的同模型得分分别为29.3%和25.5。在57个文件编辑任务上的配对审查轴消融进一步发现,当差异可见时,观察到的得分更高。这些结果将工作区状态识别为知识工作代理中的一个实验变量,并激励基准测试将证据、分阶段编辑和提交的工件作为显式状态转换来评分。