| CPI-Bench:面向真实世界图像编辑的全面、实用且智能的基准 |
Qinye Zhou |
2026-08-14 |
PDF |
随着图像编辑模型的快速进步及其在各领域的广泛应用,将这些模型能力直接部署到现实场景中的需求日益迫切。然而,现有基准仍局限于简单的单图像任务,覆盖维度有限,且无法有效区分不同模型间的性能差异。因此,它们难以可靠评估模型在复杂多图像编辑、高要求推理指令及实际部署环境中的表现。为解决这些局限,我们提出CPI-Bench,一个面向真实世界图像编辑的全面、实用且智能的基准。CPI-Bench包含三个核心子集:CPI-General-Bench,全面覆盖多样编辑任务并首创多图像编辑评估;CPI-Practical-Bench,聚焦高频真实用户应用场景;以及CPI-Intelligent-Bench,专门评估高要求推理型编辑能力。基于CPI-Bench对主流图像编辑模型的评估结果表明,CPI-Bench增强了模型间的性能区分度。它提供了对通用编辑能力、实际部署效能及高级推理编辑差距的全面可靠量化,为图像编辑模型的未来优化提供了宝贵指导。关键在于,我们的排名分析显示,CPI-Bench与Arena图像编辑排行榜实现了最高一致性,表明其忠实捕捉了人类评估者的偏好和感知判断,可作为真实用户体验的稳健代理指标。 |
| MagnifiQ:面向高分辨率图像恢复的补丁感知文本引导渐进式超分辨率方法 |
Mahesh Reddy |
2026-08-14 |
PDF |
从退化输入进行高分辨率图像恢复具有挑战性,因为它必须在恢复细粒度局部细节的同时保持全局结构一致性,尤其是在4K分辨率下,直接基于扩散的恢复计算成本高昂,且容易产生重复或不一致的纹理。在这项工作中,我们引入了MagnifiQ,一个图像恢复框架,它跨分辨率逐步放大并恢复图像,例如从1024x1024到4096x4096。我们的方法利用预训练的文本到图像扩散模型(如SDXL),并通过将其原始自注意力层替换为卷积操作来适应更可扩展的高分辨率推理,这些卷积操作的计算成本随图像分辨率线性增长。我们进一步提出了一种渐进式放大策略,该策略在多个分辨率阶段迭代恢复图像,细化每个中间输出,而不是直接生成最终的4K图像,从而改善全局一致性并减少高分辨率伪影。为了增强局部细节同时控制内容漂移,MagnifiQ使用补丁特定的文本提示,在恢复过程中提供空间局部化的语义指导。在合成和真实世界退化图像上的大量实验表明,MagnifiQ在感知质量和人类偏好方面优于先前的基于扩散的恢复方法,产生更清晰的纹理和更连贯的4K结果,同时通过其可扩展的主干和渐进式设计提供实用的速度-质量权衡。 |
| 基于生成的分布值结果推断 |
Yijiao Zhang |
2026-08-14 |
PDF |
现代生成模型越来越多地产生分布值输出,例如单细胞基因组学中预测的细胞对遗传扰动的反应。尽管这些模型提供了有价值的辅助信息,但它们本质上并不完美,因此需要统计方法来利用其预测而不依赖其正确性。我们提出了生成驱动推断(GPI),这是一个通用框架,用于利用辅助生成模型改进对分布值参数的推断。聚焦于Wasserstein重心及相关分布泛函,我们引入了一种函数值桥接表示,将非线性Wasserstein空间中的推断转化为希尔伯特空间中均值函数的估计,从而实现了类似于预测驱动推断的增强估计框架。我们开发了一族具有最优信息借用的GPI估计器,建立了相合性、渐近正态性和同时置信带,并为线性泛函和Wasserstein距离推导了有效推断。模拟研究展示了相对于仅使用标记数据方法的效率提升,以及在生成模型误设定下的稳健性能。我们使用K562细胞的Perturb-seq研究来展示所提出的框架,其中由State基础模型生成的合成扰动反应被用于改进与40S核糖体模块扰动相关的通路级共识基因表达分布的推断。 |
| 解码过去:一种面向史前手印模板性别归属的不确定性感知深度学习框架 |
Karel Becerra |
2026-08-14 |
PDF |
确定旧石器时代晚期手印模板创作者生物性别仍是一项具有挑战性的问题,原因在于缺乏地面真值、当代与史前群体之间的种群差异,以及图像退化带来的不确定性。传统形态测量方法在性别间存在高度结构重叠、跨种群泛化能力差,且特征工程主观性强。本研究提出了一种不确定性感知的深度学习框架,用于史前手印模板的性别归属,该框架在整个分析流程中显式建模、传播并聚合不确定性。方法结合了双图像处理、双轮廓提取、结构化剪影增强、模型架构多样性以及基于集成的决策聚合。该流程为每个模板生成十二种合理的剪影实现,以捕捉边界不确定性,这些实现由两个各含十个深度神经网络的集成(EfficientNet-B3和MobileViT-S)处理,这些网络基于14,036个当代手部样本进行训练。此外,三角化验证方案将集成预测与无监督二维潜空间流形映射(UMAP + k-NN)及可解释人工智能空间归因(LayerCAM)相结合,以确保解剖学一致性。在当代数据上,集成模型实现了强分类性能,在较年长年龄组中准确率超过88%。当应用于史前模板时,该框架同时产生性别预测和内部一致性的置信度度量,从而能够区分形态稳定与模糊案例。集成预测、潜空间结构和可解释性分析之间的收敛表明,不确定性可以成为考古推断的可测量组成部分,从而实现对古代岩画的稳健且可复现的解码。 |
| 通过LLM增强的语义感知类型检查发现漏洞 |
Ruizhe Wang |
2026-08-14 |
PDF |
基于静态分析的漏洞检测传统上依赖安全专家将不安全编码模式编码为算法规则。然而,这种方法往往聚焦于语法模式,忽略了代码中更深层的语义信息,如变量和函数名的含义。随着软件系统日益复杂,仅使用语法规则建模漏洞变得越来越困难。在本文中,我们提出了一种语义感知的软件漏洞检测方法。我们介绍了SETYPE,一种语义感知类型系统,可直接从源代码中仅基于符号和表达式在自然语言中的含义推导而来。在SETYPE类型系统中,类型推断和检查均由大型语言模型(LLMs)执行,类型检查失败即表明存在潜在漏洞。我们开发了原型PYSETYPE,以证明SETYPE在检测Python Web应用漏洞方面的可行性。我们在真实世界应用上的评估实现了87%的检测精确率和88%的检测准确率。使用PYSETYPE,我们识别出15个潜在零日漏洞,其中9个已由开发者确认。 |
| Marionette:预测世界状态、渲染几何、绘制外观 |
Zian Meng |
2026-08-14 |
PDF |
交互式游戏世界模型通常直接在像素或潜在空间中自回归地观察视觉观测,迫使姿态、几何和遮挡等结构化属性由同一生成序列隐式维持。在长时间跨度上,这些潜在世界属性的误差会累积,使一致性和可控性变得脆弱。我们显式建模演化的世界状态,将精确的几何计算委托给一个固定的、零参数的渲染器,而让神经模型负责合成外观。我们将这一思想实例化为Marionette,一个针对具有关节角色交互游戏的世界模型。首先,一个两阶段自回归动力学模型预测一个显式且可解释的276维3D世界状态,包括多实体关节骨架、度量根轨迹和旋转。其次,一个零参数图形桥接将预测状态转换为姿态控制视频,以闭式方式计算世界空间几何和遮挡。第三,一个控制条件视频扩散观测模型从生成的结构化控制中合成逼真的RGB观测。我们的实验确立了Marionette的两个特性。首先,预测的世界状态是直接可控的。强制一个不匹配的动作流在48个保留片段上将根对齐关节误差改变了31%。其次,长时间跨度行为在状态中决定,并可在该处修复。若不加约束,两个生成角色漂移到相距21.2米(记录会话保持约5米),且三分之一的帧显示地面穿透。对显式状态施加的两条规则,即地形碰撞器和分离上限,将穿透减少66%并保持这对角色互动,而观测模型不变。通过预测状态路由外观在我们可检测的保真度上无损失,FVD为831,而记录姿态为799。 |
| 跨会话边界的情境学习状态交接 |
Masahiro Kato |
2026-08-14 |
PDF |
本研究探讨了使用大语言模型的应用中会话交接的方法论与理论特性。当上下文达到模型输入限制、应用重启或要求另一代理完成任务时,任务可能在新会话中继续。应用随后必须决定从先前会话传递哪些信息。我们将交接定义为任务相关的上下文学习(ICL)状态的转移,并区分早期材料的精确恢复与目标分布的保留。在外生性条件下,预测等价性刻画了最粗糙的确定性充分交接,并给出固定长度的比特需求。该分析隔离了记忆约束、写入者和续接过程的影响,并量化了在实现的下游查询未知前进行写入的成本。我们提出一个三部分记录,精确存储决策和约束,对重复证据使用任务合理的统计量,并保留那些其效果未被这些统计量保留的原始观察。高斯线性回归给出精确的有限维交接和有限比特扰动界,而非参数回归给出将记忆与平方预测误差相关联的上下界。这些结果为决定交接必须保留什么以及其记忆需求如何依赖于续接任务提供了理论与方法。 |
| 通过差分故障注入验证LLM现代化科学软件 |
Evan Coleman |
2026-08-14 |
PDF |
大型语言模型(LLM)智能体日益被用于现代化生产科学软件中遗留的Fortran代码,但对此类转换的验证侧重于名义执行,可能无法测试现代化是否保留了原始代码对故障、扰动和降精度的响应。我们提出了一种差分故障注入验证方法:一个测试装置在GAMESS的十二个位置对共享的自洽场驱动程序进行插桩,并对原始实现和LLM现代化实现施加相同且确定性的故障,从而隔离转换后的积分内核。在超过2200次运行中,瞬态故障吸收成本与基于收缩的模型相符(预测斜率分别为每比特0.74和1.49次迭代;实测为0.82和1.50),持续扰动使最终能量误差每增加一个比特减半,且这些实验暴露了相位相关的并行死锁和降精度下的假收敛。原始内核与现代化内核在所有200次配对注入中一致,且一项测量引导的同步更改与现代化方案组合后,在所有40个配对中均匹配。 |
| 参与式道德人工智能并非中立:开发者无形之手 |
Taenyun Kim |
2026-08-14 |
PDF |
随着人工智能系统在社会中做出更多涉及道德判断的决策,一种应对方式是道德偏好 elicitation。在此方法中,研究人员就假设性困境对参与者进行民意调查,并利用汇总投票来训练AI模型,随后该模型在更大范围内应用这些政策。在投票进行之前,开发者在道德AI elicitation流程中需做出三个关键选择:特征范围界定、选民抽样和问题框架设定。换言之,他们决定哪些特征进入投票、包括哪些选民以及如何呈现问题。这些选择往往不透明、缺乏文档记录,并被视作技术细节而非规范性考量。我们在一个常见的实证研究中审视了这些选择,并表明每一项都可能影响道德AI elicitation所产生的偏好。在两个阶段(N=809)和三个部署情境(即AI肾脏分配、模拟缺席员工的AI代理、以及生成式AI对逝者的描绘)中,我们考察了道德AI elicitation流程的三个主要阶段。首先,道德相关特征在不同情境间发生变化。这表明特征模式不应假定能在不同部署领域间转移。其次,对于约三分之一的特征,偏好因政治意识形态而异,且部分差异方向相反。因此,选民群体的意识形态构成会影响最终的汇总偏好概况。第三,elicitation问题的措辞可将意识形态差距缩小或扩大至整整一个量表点。框架条件还改变了道德基础与参与者判断之间的关联方式。综合这些发现,投票式对齐无法仅通过聚合实现公平或透明的AI;至少,道德AI elicitation流程的每个阶段都应接受审计并予以公开。 |
| 面向大规模和高阶MIMO检测的过渡学习 |
Yubo Zhang |
2026-08-14 |
PDF |
高阶多输入多输出(MIMO)检测需要在大型离散符号空间中进行高效搜索,同时为信道解码生成可靠的软信息。本文开发了一种学习转移(L2T)框架,将MIMO检测表述为完整向量转移的随机序列。在每次转移中,信道耦合的Transformer同时更新实例嵌入和采样策略,而分块自回归分解以适度的序列复杂度捕捉流间依赖性。对于硬输出检测,递归应用转移网络,并通过残差到误码率课程进行训练,该课程首先从精确残差度量中学习MIMO搜索几何,然后将策略与传输比特精度对齐。对于软输出接收,训练良好的硬策略在参数级别被克隆到未绑定的软输入软输出迭代检测与解码(IDD)接收器的每一层中。这种绑定到未绑定的转移保留了学习到的零先验搜索动态,同时在解码器反馈下实现层和轮次特定的专门化。在每个IDD轮次内,解码器先验根据贝叶斯规则倾斜候选生成,似然加权的终端假设为LDPC解码产生后验和外在对数似然比。多阶段训练策略通过逐步将接收器暴露于合成和循环内解码器生成的先验,进一步稳定了从硬到软的转移。 |