跳转至

arXiv 2026-08-22

标题 作者 发布日期 PDF链接 摘要
关于轨迹的信息:鞅与随机时间 Akshay Balsubramani 2026-08-20 PDF 对非负鞅轨迹路径空间上的信息流进行核算,可得到其精确变分恒等式,即使在任意随机时刻也成立。这恢复了广泛使用的经典集中不等式,从Ville到PAC-Bayes,并度量了每个不等式所舍弃的内容。尾部界限所控制的对象本身是相对熵,通过链式法则分解为每步条件散度。被舍弃的松弛量在三种几何形态中均有精确形式:Azuma-Hoeffding和PAC-Bayes界的Gibbs倾斜,Ville界和合并检验中的交叉本身,以及$L^p$极大值界中的支配证书。该证书的可选停时亏损按步分解为运行最大值的Bregman散度。在路径-时间空间上,同一恒等式增加了一个因子来定价预期:任意随机时刻携带一个e过程“偷窥惩罚”。配分函数可解读为合并过程——独立副本的前缀共享概率——而测试鞅的几何混合在多模型安全检验中获得合并收益。
ConceptGuard:大型语言模型中上下文敏感遗忘的基准测试 Sahil Kale 2026-08-20 PDF 大型语言模型(LLMs)日益需要选择性移除有害或敏感知识,即所谓的“遗忘”,然而现有方法和基准未能全面评估这一能力。当前方法依赖于由独立事实组成的不相交的遗忘集和保留集,并通过简单直接的事实回忆来衡量成功。这种框架未能捕捉遗忘的一个关键要求,即消除有害行为同时保留良性且有益的知识。我们认为,有效的遗忘必须在概念层面运作,确保完全移除不安全应用,同时维持其正确且有用的用途,从而实现概念上有意义且完整的遗忘。为了从这种实用视角更好地评估遗忘技术,我们引入了双重用途概念的概念:这些概念既可用于有害情境,也可用于良性情境。基于这些概念,我们构建了一个名为ConceptGuard的基准,其中遗忘集和保留集在概念使用上明确互补。我们的基准独特地使得遗忘能够在概念层面而非稀疏事实层面进行探索和评估,并且评估是意图敏感的,旨在最大化上下文分离以促进更安全的行为。我们证明,当前遗忘技术在此设置下表现不佳,显示出弱的上下文分离以及ROUGE和概念级指标上的较差表现。我们的结果揭示了强烈的遗忘-效用权衡、上下文敏感性的有限提升,以及不同方法在概念级控制上的不一致性,并为更符合现实世界安全需求的遗忘方法提供了思路。我们的数据集已公开可用。
4DAnyone:从随意单目视频中创建任意人物的4D模型 Yudong Jin 2026-08-20 PDF 我们提出了4DAnyone,一个从无标定单目视频重建4D人体的框架,通过生成重建级多视角一致视频并将其提升为4D高斯泼溅(4DGS)。现有的相机控制视频扩散模型能合成合理的novel-view视频,但在扩展到4DGS重建所需的数十个目标视角时无法保持一致性。我们将这一失败识别为有界注意力上下文问题:当目标视角超过单次DiT前向传播的容量时,必须将其分组,暴露两个耦合瓶颈。在参考上下文方面,对所有先前生成视角的条件化以$O(N)$增长,削弱了跨视角外观引导。在目标上下文方面,不相交的组无法直接交换信息,导致全局结构漂移。4DAnyone通过两种互补设计解决这两个瓶颈:参考上下文打包(RCP)将增长的参考视角压缩为固定长度的混合分辨率上下文,具有$O(1)$参考上下文复杂度,而目标上下文路由(TCR)在去噪过程中旋转目标视角分组,在高噪声步骤跨组共享上下文,在低噪声步骤稳定细节。我们进一步使用内部游戏引擎构建MVGameHuman数据集,并结合光舞台和野外视频数据集进行训练。在DNA-Rendering和DyMVHumans上的实验表明,4DAnyone在novel-view视频质量和下游4DGS重建方面均优于先前方法,并具有稳健的野外泛化能力。视频结果和源代码见项目页面:https://4danyone.github.io。
WithEveryone:面向群体图像生成的统一规划与身份锚定 Hengyuan Xu 2026-08-20 PDF 当场景必须包含多个指定人物时,保持身份一致的图像生成变得愈发不可靠。除了保留每个身份外,模型还必须将每个参考绑定到不同的人物和位置,而训练时的身份损失必须在多个噪声预测人脸之间建立对应关系。我们提出WithEveryone,一个统一框架,用于生成包含多达十个参考身份的群体图像。WithEveryone将每个选定身份注入为寻址令牌,预测结构化身份-布局计划,并将该计划渲染为视觉条件。其关键目标,布局接地身份损失,利用标注的人脸区域直接监督预期身份,避免不稳定的基于嵌入的人脸匹配;身份表示强制训练还在图像合成前为每个身份预测。在身份不相交的基准上,WithEveryone实现了最高的目标上下文身份相似度,将人脸相似度从GPT-Image-2的0.462提升至0.499,同时将复制粘贴伪影从0.169降至0.055。它还覆盖了97.3%的请求身份,重复率仅为2.8%。这些结果表明,显式身份-布局接地使身份保持生成能够扩展到更大群体,而无需依赖直接参考人脸复制。
Swift-Image:探索紧凑统一图像生成模型的性能前沿 Taihang Hu 2026-08-20 PDF 我们提出了Swift-Image,一个紧凑的统一模型,用于文本到图像生成、单图像编辑和多图像编辑。我们的目标是在受限的计算预算下,通过系统的训练工程探索一个相对较小的视觉生成器能推进到何种程度。Swift-Image采用高效的6B单流DiT架构和渐进式训练流程,从广泛的语义覆盖逐步演进到更高分辨率、更强的视觉质量和统一的生成-编辑监督。在后训练阶段,我们采用并行专家强化学习,随后进行多教师在线策略蒸馏,以缓解异构目标之间的干扰。我们进一步将高层推理与像素级渲染解耦,通过提示增强器将用户请求转化为与生成器对齐的视觉规格。为高效部署,结构剪枝和少步蒸馏产生了3B和加速变体。Swift-Image在评估的开源模型中仅以6B参数和243K GPU训练小时达到领先的聚合性能;压缩后的3B模型几乎无性能损失,而少步蒸馏进一步以显著更少的采样步骤提升了聚合编辑性能。我们的研究还总结了架构、数据课程、后训练、提示增强和模型压缩方面的实用经验。
G-CARL:面向患者导向的医学报告解读的基于检查表对齐的奖励学习 Shiao Xie 2026-08-20 PDF 医疗报告的个性化解读已成为患者日益重要的需求。满足这一需求既需要基于证据的医学事实准确性,又需要依赖情境的患者沟通,然而现有的医学视觉语言任务未能充分涵盖这些双重需求。为弥合这一差距,我们引入了面向患者的医疗报告解读(PMRI),这是一种新颖的开放式多模态生成任务,要求模型根据用户查询和对话历史,以准确且易懂的语言解释医疗报告。这两个目标在可验证性上根本不同,但又紧密耦合,使得在传统监督微调和整体强化学习范式下难以联合优化。为应对这一挑战,我们提出了G-CARL,一种基于依据的、清单对齐的强化学习框架,结合多源检索进行原子声明验证,以及上下文感知、实例特定的加权清单用于响应覆盖,为事实性、用户需求满足和表达质量提供结构化监督,而不限制响应多样性。我们进一步构建了MMedReport,一个真实世界的PMRI基准,以及临床医生设计的三维评估协议。大量实验表明,G-CARL在整体质量、声明级精确度和清单召回率上持续优于现有后训练基线。临床医生的成对偏好评估进一步证实,G-CARL生成的解读更准确且更符合患者需求。
$TCP_α$:面向可靠音乐信息检索的边际控制置信度估计 Parampreet Singh 2026-08-20 PDF 深度神经网络往往过度自信,即使对错误预测也赋予高置信度。因此,用户缺乏可靠信号来判断何时可以信任预测。事后置信度估计通过在被冻结的分类器上训练一个轻量级辅助头来解决这一问题。然而,现有目标存在固有歧义:它们为正确和错误预测分配重叠的置信度值,而决策边界附近的错误预测所获得的置信度分数与正确预测无法区分。在本工作中,我们提出$TCP_α$,一种新颖的置信度目标,通过引入针对误分类样本的边际控制惩罚来解决这些局限。我们证明$TCP_α$保证了正确与错误预测目标值之间的完全分离,且分离边际与类别数量无关,并随惩罚参数单调增加。由于准确分类器自然产生极少错误,学习这些目标会导致严重的类别不平衡回归问题。因此,我们对在这种不平衡下学习的训练策略进行了系统性研究,并通过广泛的消融实验确定了有效的训练配置。我们在拉格识别任务上评估了所提方法,考察了其在域偏移下的鲁棒性,并进一步在帧级装饰音检测上验证,无需修改所选配置。在所有设置中,$TCP_α$在失败预测方面始终优于现有置信度目标。仅拒绝置信度最低的8%预测,就将基础模型的宏F1分数从0.89提升至0.98,而仅使用新语料库中5%的标注样本微调置信度头,即可有效恢复域偏移下的性能。
针对卧室人体活动监测与睡眠中断检测,天花板安装式FMCW、IR-UWB和Wi-Fi雷达的比较 Anton Lambrecht 2026-08-20 PDF 尽管无接触式射频(RF)医疗监测的重要性日益增长,但诸如调频连续波(FMCW)雷达、脉冲无线电超宽带(IR-UWB)和Wi-Fi传感等不同无线电技术,在相同部署条件下很少被直接比较,因为现有研究通常在硬件、数据集和评估方法上存在差异。此外,尽管天花板安装雷达在医疗环境中具有实际部署和成本优势,其性能仍未得到充分探索。因此,本文基于20名参与者在六种房间布局下的同步记录,对天花板安装的FMCW、IR-UWB和Wi-Fi传感进行了受控比较与分析。所有技术均采用相同的卷积神经网络(CNN)进行评估,涵盖细粒度的10类人体活动识别(HAR)任务和粗粒度的4类睡眠监测任务。IR-UWB在跨受试者活动识别性能上表现最佳(89.0%宏F1),而FMCW对未见房间布局的泛化能力最强(83.8%宏F1)。在睡眠监测方面,所有技术在未见环境中均超过92%的宏F1。结果揭示了识别性能与环境鲁棒性之间的基本权衡,这可通过距离分辨率、天线多样性、多普勒分辨率和空间信息保留的差异来解释。这些发现为面向医疗的RF传感系统设计提供了实用指南。
一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法 Narges Ahmadi 2026-08-20 PDF 出行行为研究日益将数字数据采集与预测建模相结合,然而这些阶段往往被分别开发和评估。本研究提出了一种三智能体工作流,整合了对话式数据采集、结构化数据处理和行为预测。一项由聊天机器人管理、图像增强的陈述偏好调查,在五种预设天气情景下收集了学生通勤者的出行方式选择,产生了454个受访者-情景观测值。使用多项逻辑模型分析了与天气相关的关联,而逻辑回归和随机森林提供了机器学习基准。九个本地部署的大语言模型(LLMs),参数规模从20亿到350亿不等,在四种零样本提示和上下文条件下进行了评估,并通过角色、少样本和基于视觉的配置进行了扩展。随机森林实现了69.6%的五类准确率,而最佳纯文本零样本LLM在无需任务特定拟合的情况下达到了69.9%。习惯性出行信息产生了最一致的增益,专家框架通常优于角色扮演,而角色信息在习惯性出行信息不可用时最为有用。少样本提示改善了几个模型的预测,增益在少量示例后趋于稳定。使用与受访者相同的天气图像,最佳基于视觉的配置达到了71.5%的五类准确率,表明视觉上下文可能为选定模型提供额外的预测信息。总体而言,该研究展示了如何在可审计的多智能体工作流中协调对话式调查、结构化数据处理、传统行为建模、机器学习和多模态LLM预测。
从计算机使用痕迹中归纳任务模型 Yucheng Jiang 2026-08-20 PDF 自然主义计算机使用轨迹,即被动记录的屏幕截图和鼠标或键盘操作,是提取日常工作中符号化、可审计且可复用模型的宝贵资源。随着计算机使用代理进入实际工作场景,这些模型变得至关重要,因为代理需要学习任务实际上是如何执行的,而组织需要审计并复用这些知识。然而,诱导此类任务模型具有挑战性,因为活动仅以低级事件形式被观察,且现实工作是多线程的,目标交织在一起。现有方法假设给定任务或单一工作流,并产生步骤级摘要而非结构化任务模型。我们引入了任务模型归纳(TMI),它(i)在无约束轨迹中发现潜在任务,解开并发活动,并且(ii)对每个潜在任务,诱导一个任务模型,该模型将递归目标分解的层次目标模型与组织执行的控制流程序模型配对。在内在评估中,针对受控的人类和代理轨迹,TMI以0.974的一致性恢复交织任务,与地面真值分组相比,并重构了74.9%的观察执行步骤,远超最强的工作流归纳基线。在外在评估中,从TMI任务模型衍生的技能将保留任务的准确性提高了30.0%,优于最强基线。