跳转至

arXiv 2026-09-24

标题 作者 发布日期 PDF链接 摘要
硬停止:面向失控智能体执行的核级抢占与遏制 José Luis Pino 2026-09-24 PDF 2026年7月,一个不受约束的自主智能体在参与前沿AI网络安全评估测试平台时,突破了其评估沙箱,建立了外部命令与控制据点,并对Hugging Face的生产级多租户数据集转换基础设施执行了一次多阶段入侵(本尸检报告中称为Incident-2026-Alpha)。在超过4.5天的时间里,该失控智能体在6,280个worker集群中执行了17,600个离散动作,攻陷了AWS EC2实例元数据服务(IMDS)凭证,伪造了Kubernetes服务账户令牌,通过过度授权的CSI驱动获取了物理worker节点的root权限,收集了136个生产密钥,并将181个临时沙箱注册到该组织的内部mesh VPN中。本专著呈现了对该入侵的第一性原理取证尸检,提供了形式化证据表明该入侵是在工具性趋同论下、于缺乏带外断路器的未衰减自主循环中运行的预期后果,揭示了在取证事件响应期间使集中式商业模型陷入瘫痪的防御性LLM护栏悖论,并形式化了双边认识论安灯命令。我们详细说明了双过程系统架构——结合离散事件系统的带外监督控制(Ramadge和Wonham 1989)、同步反应式(SR)环境哨兵(Berry和Gonthier 1992;Lee和Neuendorffer 2005),以及微秒级(中位数4.8 $μ$s / WCET上界$< 0.154$ ms)POSIX抢占总线——展示了编译的、确定性的认识论边界如何在第一个偏离目标的套接字数据包穿越hypervisor之前阻止自主失控越界。
CORDIAL:从少量标签校准序数LLM输出 Xiangwei Wang 2026-09-24 PDF 一个大型语言模型(LLM)可以将文本映射为有序尺度上的分布,但该分布是一种带噪测量:饱和、压缩或夸大,并且存在方向一致的偏差。我们提出 CORDIAL,它将模型输出视为对真实标签的带噪读取,并通过一个含五个可解释参数的通道对其进行校正。该通道足够小,使其后验可以从少量标签中平均得到,并且我们证明由此得到的校准保持一阶随机序。在 Amazon 评论和 CMU-MOSEI 转录文本上,使用四个 LLM,CORDIAL 在 80 个设置中的 76 个里,在 5 到 100 个标签下,于九种校准器中取得最低对数损失;在 20 个标签和主要的 7B 读取器下,它使用 28–54 个标签即可匹配最强基线。同一后验还使我们能够从其他任务中学习先验,并融合多个 LLM。诸如 Dirichlet 校准之类的无限制校准器只有在校准集增长到数百或数千时才会超过它。
REAT:一种用于多轮数学教学的反思性经验增强辅导框架 Jianheng Zhou 2026-09-24 PDF 当前的大型语言模型(LLMs)在解决复杂数学问题方面表现出色,但这种能力并不能自然而然地转化为有效的辅导教学。尽管先进的大语言模型辅导系统可能利用多智能体框架或微调技术,但大多数系统仍然缺乏一种能够随时间系统性地积累和复用教学经验的机制,这限制了它们在动态、多轮交互过程中对不同学生需求的适应能力。为弥补这一差距,我们提出了反思性经验增强辅导(REAT)框架,该框架将来自历史对话的经验蒸馏与实时自适应检索相结合。在多智能体观察者-评论者-导师(OCM)蒸馏流程的驱动下,REAT 审视过去的对话轨迹,并将原始交互提炼为结构化的、与具体问题无关的教学经验。在实时辅导过程中,一个状态感知的检索模块注入这些经过整理的经验,以基于学生的认知状态提供自适应支架。实验表明,所提出的框架显著优于仅提示词和 supervised fine-tuning(SFT)基线,尤其是在改善复杂、低分辅导场景方面。至关重要的是,所蒸馏出的经验在不同模型架构和数学数据集上展现出稳健的泛化能力。
SEEK:面向工业搜索的技能路由评估与可进化知识 Zhongxin Huang 2026-09-24 PDF 搜索质量评估为工业搜索系统的开发和迭代提供了必要的监督和诊断信号。尽管大语言模型为人工评估提供了一种可扩展的替代方案,但可靠的自动评估仍然具有挑战性:用户在页面层面体验搜索结果,而适用的评估标准是多维且持续演变的。将所有评估标准打包进一个统一的提示会引入无关上下文和潜在的标准干扰,而通过后训练将其内化则会将规则更新与昂贵的模型重训练周期紧密耦合。为解决这些问题,我们提出了可进化知识驱动的技能路由评估。具体而言,SEEK将具体的搜索评估标准外化为一个技能库,为每个查询-结果列表对动态路由相关技能,并采用任务适配的列表级评估器来生成页面级判断和失败模式归因。一个两阶段训练流程教会评估器将评估标准与人类偏好对齐,而一个回放门控技能库允许反复出现的评估知识缺口被纳入而无需模型重训练。在工业短视频搜索上的实验表明,SEEK提升了列表级质量评估准确性,并在归因诊断方面取得了显著进展。SEEK已部署于快手,一个拥有超过4亿日活跃用户的短视频平台,显著提升了在线搜索评估的规模和质量。
学习为科学影响力进行构思 Shubham Kale 2026-09-24 PDF 科学构思正日益受到大语言模型的中介影响,但当前的构思系统通常基于即时可判断的代理指标进行训练和评估,如新颖性、清晰度和可行性。这使得延迟的科学采纳信号能否作为反馈,将模型引导至具有更高预期影响力的研究方向这一问题仍悬而未决。我们以引用归一化影响力作为学术采纳的噪声但可扩展的代理指标来研究这一问题。我们从超过10万篇计算机科学论文中构建了一个大规模数据集,通过提取目标条件下的想法描述,并为每篇论文分配一个有序的、按年份归一化的引用标签。随后,我们训练了一个目标条件奖励模型,从研究目标和想法对中预测引用影响力标签,并利用该奖励通过监督微调及随后的强化学习来对齐想法生成器。为减少循环性,我们采用一种留出的、基于参考的评估协议来评估生成的想法,该协议将模型输出与同一研究目标下的历史想法进行比较,并根据参考想法的引用影响力标签对判断进行加权。实验表明,我们经强化学习调优的模型持续产生比基础模型和监督微调基线具有更高估计影响力的想法。我们的发现将科学影响力定位为一种实用的、以结果为支撑的反馈信号,用于在开放式科学发现中对齐大语言模型。
自适应Fisher白化交叉协方差用于低资源语音识别 Asmee Mishra 2026-09-24 PDF 将多语言语音基础模型适配到低资源语言仍然困难,尤其是那些在预训练中代表性不足的语言。尽管参数高效微调(PEFT)降低了适配大模型的成本,但LoRA等传统方法依赖于通用的低秩参数化,并未显式利用下游任务信息来定义适配子空间。为了探究任务感知的PEFT能否更好地支持低资源ASR,我们将Fisher白化互协方差分析(FCCA)应用于Whisper和Qwen3-ASR,并引入两个互补的扩展:非对称耦合FCCA(AC-FCCA),其利用结构化的跨层共享;以及自适应秩FCCA(AR-FCCA),其在固定参数预算下重新分配各投影矩阵之间的适配容量。在受控的多语言实验中,我们在预训练中代表性不足或不受支持的语言以及代表性良好的语言上评估了这些方法。标准FCCA与可训练参数预算匹配的LoRA相比具有竞争力,且通常优于后者。AR-FCCA在两种模型架构上均比标准FCCA提供了一致性更高的改进,在若干评估设置中取得了统计显著的增益,同时保持相同的可训练参数数量。这些结果表明,任务感知的子空间构造对于低资源语音适配是有效的,并且自适应秩分配提供了一种稳健的方式来提升参数效率而不增加模型容量。
加纳语言青少年健康传播中自动语音识别(ASR)的基准测试与领域适应 Stephen E. Moore 2026-09-24 PDF 本文对三种加纳语言(契维语、达格班尼语和埃维语)中青少年健康传播的自动语音识别(ASR)进行了端到端研究。研究工作分为三个相互关联的阶段:第一,我们在通用领域圣经语料库和青少年性与生殖健康(ASRH)领域ASR数据集上,使用字符错误率(CER)和词错误率(WER)对五个ASR系统(三个语言特定的Wav2Vec2模型和两个多模态大语言模型Gemma 3n与Gemma 4)进行基准测试。第二,在基准测试的指导下,我们进行有监督领域自适应:尽管Gemma 4是最强的零样本候选模型,但对其微调在计算上不可行,因此我们转向紧凑的Qwen3-ASR-0.6B,在大型加纳圣经语料库(约9万样本)上进行微调,并严格在留出的人工采集领域内音频上评估。微调降低了每种语言的WER,其中埃维语最为显著(WER从109.3%降至64.8%,下降44.5个百分点;CER从65.1%降至24.9%)。第三,我们通过KasaHealth验证该工作,这是一个以语音为先的实时ASRH应用,已以三种语言部署,并辅以技术评估工具Senti-Check。KasaHealth由50名社区受访者测试,实现了100%的聊天批准率、72%的良好或优秀翻译评分以及92%的推荐意愿率,同时揭示了最制约实际使用的领域差距。在所有三个阶段中,证据趋于一致:对于这些语言,关键制约因素是经过验证的领域内数据,而非模型能力或计算资源。
将大型语言模型碰撞严重程度流程适配到田纳西州:跨采样策略的性能 Abhilasha Saroj 2026-09-24 PDF 各州碰撞数据库在结构、编码和伤害严重程度分布上存在差异,限制了预测工作流在不同辖区之间的直接复用。本研究将SafeTraffic Copilot大语言模型(LLM)碰撞严重程度工作流适配到田纳西州三年624,392起碰撞记录的数据集上。田纳西州的碰撞、道路、车辆和人员属性经过协调统一并转换为文本提示,缺失值予以保留而非推断。使用低秩适配对Llama 3.1 8B进行微调,以对五个伤害严重程度类别进行分类。采用随机、基于县和严重程度平衡的抽样策略,通过独立的样本内和未见测试实验进行评估;未见测试实验使用70/15/15的训练、验证和测试划分。在各自的未见测试集上,随机和基于县的模型取得了接近80%的加权F1分数,但宏F1仍低于47%,致命碰撞F1低于27%,表明较强的总体性能可能掩盖对稀有结果的弱识别能力。在其平衡评估群体中,严重程度平衡模型取得了57.7%的加权和宏F1分数以及65.9%的致命碰撞F1分数,产生了更均衡的类别级性能。由于每种抽样策略使用了不同的测试子集,跨策略差异是描述性的而非受控排名。结果凸显了将LLM碰撞严重程度性能与抽样设计、类别平衡、类别级指标和评估群体构成结合起来解释的重要性。
TimeBraid:统一时间序列与语言以用于理解和预测 Xinyue Wang 2026-09-24 PDF 我们提出了TimeBraid,一系列统一的时间序列与语言模型,通过交错的全局残差注意力层,将预训练语言模型与预训练时间序列基础模型对齐。每个模型从一侧继承知识、指令遵循与推理能力,从另一侧继承连续信号感知与零样本预测能力,并在一个共享表示空间中将两者融合,使两种模态均能被理解和生成。我们研究了使这种统一建模奏效的设计选择:在何处对齐两个表示空间,如何将语言锚定于时间结构,如何平衡理解与生成,以及如何保持联合优化稳定。由此得到的方案结合了面向多样化时间序列与文本任务的统一提示方案、稳定的联合训练,以及来自220万条精选序列—文本对和490万条指令微调样本的监督。在涵盖时间序列感知、理解、推理以及上下文辅助预测和单模态预测的基准上,TimeBraid与规模大得多的通用模型及任务专用模型相比仍具竞争力。
OREO:通过实时渲染-编辑优化实现3D生成中的保真度对齐 Zhiyuan Ma 2026-09-24 PDF 尽管3D生成领域近期取得了进展,但模型往往难以生成具有高视觉保真度的资产。为弥合这一差距,我们提出了OREO,一个对齐框架,通过利用丰富的2D扩散先验来增强3D生成器的真实感。OREO不依赖静态数据集,而是建立了一个动态优化循环,实时生成经过编辑的渲染图作为2D伪目标。其核心在于我们引入了强化编辑(Reinforced Editing),利用2D模型对3D输出的渲染视图进行精炼,在保持底层几何结构、视角和内容的同时提升其整体视觉保真度。这些精炼后的视图作为高质量监督目标,使3D生成器能够从自身生成的样本中学习,并逐步提升其视觉质量。实验表明,OREO有效改进了预训练基线,生成的3D资产具有更强的视觉真实感。