跳转至

arXiv 2026-08-08

标题 作者 发布日期 PDF链接 摘要
通过选择性上下文偏好优化学习何时信任 Xian Sun 2026-08-06 PDF 语言模型越来越多地根据外部信号来调整其答案,而一个单一的误导性信号就能将正确答案变为错误。显而易见的补救措施——训练模型抵抗此类信号——却隐藏着一种失败模式:一个忽略所有上下文的模型看似稳健,但在上下文值得信赖时却毫无用处。我们将此问题重新定义为选择性信任,并引入MIST,这是一个人工标注的基准,每个推理项目在四种匹配条件下呈现(干净、误导、正确上下文和无关上下文),同时引入SC2W,这是一个配对指标,统计误导性信号将干净正确的答案翻转为错误的频率。通过一项全面的基准研究,我们观察到这种易感性是普遍存在的。随后,我们提出SCOPE,它挖掘干净正确/误导错误的失败案例,并优化标准直接偏好优化(DPO)目标,该目标基于在所有四种条件下均衡匹配的偏好对,而非仅基于误导性项目。我们的方法显著降低了流行开源模型上的SC2W,同时在添加的上下文干净、正确或无关时保持准确性。通过这项工作,我们认为模型应依据选择性信任来评判,而非仅凭抵抗力。
DyPES-VLA:学习共享动力学先验与具身特定控制以实现跨具身操作 Junfeng Li 2026-08-06 PDF 视觉-语言-动作(VLA)模型已成为机器人操作的有力范式,但为异构机器人本体训练单一通用策略仍是一个未解问题。现有方法存在两个主要局限。首先,它们未能充分利用跨多样视觉和交互数据共享的动态先验,限制了跨本体迁移。其次,它们需要大量手动预处理,将特定本体的动作转换为通用格式。为克服这些局限,我们提出DyPES-VLA,一种学习共享动态先验和特定本体控制的跨本体VLA。首先,我们通过在跨本体数据上以未来预测目标训练视觉-语言模型(VLM)来学习共享动态先验,驱动共享查询表示捕捉物体运动、接触及交互引发的场景变化。其次,一个特定本体的专家混合(MoE)动作头将这些共享动态先验直接转换为各本体原生动作空间中的可执行控制,无需手动预对齐异构动作为通用格式。该动作头共享注意力层以捕捉常见的时间动作结构,而其特定本体的前馈专家则解决不同本体的独特运动学约束和控制语义。作为通用策略,我们的方法在仿真和真实世界评估中达到最先进性能,在LIBERO上取得98.0%成功率,在RoboCasa-GR1上为59.25%,在RoboTwin 2.0上为89.02%。
工具调用的苦涩教训 Ishan Patel 2026-08-06 PDF 工具使用将LLM转变为超越其训练数据行动的智能体,对于具备代码能力的模型,程序化工具调用通过用自然链式与并行化的脚本替代僵化的JSON调用,进一步扩展了这一能力。然而,在现有基准上,针对当前及先前模型代际,在真实世界任务条件下对工具作为代码的系统性评估尚未进行。在本工作中,我们在BFCL v4上对14个语言模型实证比较了程序化工具调用(PTC)与原生JSON工具调用。在程序化工具调用范式中,工具以类型化Python存根形式暴露,模型通过代码调用,执行与结果处理在单一智能体回合内完成。在BFCL v4上,程序化工具调用在14个模型中的11个上匹配或超越了原生JSON工具调用,其中GPT-5.6系列相比JSON工具调用基线提升了10.6%。此外,在并行扇出条件下,它在14个模型中的13个上匹配或优于基线,并在上下文退化条件下保持稳定,而基线平均退化2.3%。我们的结果表明,程序化工具调用是JSON工具调用的可行且稳健的替代方案,其性能随发布代际的模型能力而跟踪提升。
追踪心脏:心力衰竭特征工程的一种证据关联管道 Soorya Ram Shimgekar 2026-08-06 PDF 电子健康记录(EHR)特征工程是临床研究和人工智能中的主要瓶颈,占数据科学家工作量的39-45%。这一问题在心力衰竭中尤为突出,该病影响约670万美国成年人,需要将碎片化的EHR数据与疾病特异性、基于指南的临床推理相结合。现有的基于规则和基于大语言模型(LLM)的方法仅提供部分自动化,且可维护性和证据可追溯性有限。我们开发了Nimblemind多智能体系统(nMAS),这是一个基于证据、以评分标准为基础的自动化心力衰竭特征工程流水线,并在来自九个EHR源表的500条虚拟患者记录上进行了评估。nMAS生成了132个结构化特征和70个按评分标准评分的聚合特征,验证了结构完整性、评分标准合规性和来源可追溯性,并由受限LLM进行审计。添加聚合特征将保留的AUROC从0.895提升至0.963(HFrEF表型)和从0.870提升至0.910(HFpEF表型),独立LLM基于评分标准对证据支持和方法学合理性的评估得分为最高分的81.5%。这些结果证明了复杂心血管EHR数据自动化、可审计特征工程的可行性,但评估仅限于单机构队列,仍需外部验证。
研究移动购物应用中的人工智能数字主权:以尼日利亚为例 George Grispos 2026-08-06 PDF 电子商务移动应用在尼日利亚的普及正在扩展,既带来了机遇也带来了风险,包括欺诈和用户对数字技术控制力的减弱,引发了对数字主权的担忧。本研究探讨了尼日利亚移动应用中的人工智能(AI)如何影响数字主权,并通过平台透明度作为用户意识和控制力的关键指标进行考察。采用解释性方法,本研究将选定Android应用的取证分析与情境文档分析相结合,以识别AI功能并评估披露实践。研究结果显示,AI在应用中被广泛实施,但其使用透明度仍然有限。对尼日利亚的社会经济分析进一步表明,对消费者数字平台的依赖日益增加,AI认知水平中等,互动模式不均衡。通过提供关于AI透明度和平台实践的实证证据,本研究增进了对个体数字主权的理解,并强调了在AI驱动的数字环境中保护用户控制力所面临的挑战。
一种最优的不可知PAC算法 Markus Engelund Mathiasen 2026-08-06 PDF 设 (H\subseteq{-1,+1}^X) 为一个有限VC维 (d\ge1) 的类别。记 (L) 为二元风险,(L^=\min_{h\in H}L(h)),我们构造一个学习器,实现统计最优的风险界:从大小为 (n) 的 i.i.d. 样本出发,对每个 (0<δ\le 1/2),以至少 (1-δ) 的概率有 [ L(\widehat h) \le L^+ 7\cdot10^8\left( \sqrt{\frac{L^(d+\log(1/δ))}{n}} +\frac{d+\log(1/δ)}{n} \right). ] 这解决了在任意固定 (L^) 下,agnostic PAC 学习的样本复杂度,直至通用常数,与 Devroye、Györfi 和 Lugosi [A Probabilistic Theory of Pattern Recognition, Springer, 1996] 的下界相匹配。
AV-AIVAT:在不完美信息博弈中,以认证的随时有效停止实现74倍更廉价的智能体评估 Boning Li 2026-08-06 PDF 判断两个智能体孰强孰弱,意味着持续对弈直至技巧胜过运气,而每局对弈都耗费资金、模型推理或专家时间。由于所需对局数未知,固定预算评估要么在结果已定后继续付费,要么在智能体尚无法区分前就停止,而采用普通置信区间的朴素可选停止则会破坏既定显著性水平。我们使此类评估在证据充分时即刻停止,且保证不变。行动知情价值评估工具(AIVAT)通过条件均值零修正降低不完美信息博弈中的方差,在涵盖71,439手配对单挑无限注德州扑克(HUNL)的15种LLM智能体配置中,中位数降低54倍,但未说明何时停止。我们将AIVAT与持续监测的置信序列(CSs)结合,形成随时有效的AIVAT(AV-AIVAT),其在线价值模型仅从过往对局中学习,因此没有对局会修正自身。在名义95%水平及目标精度±1大盲注下,原始结果在渐近置信序列(AsympCS)下停止所需手数中位数是AIVAT修正结果的74倍。精确有限样本认证采用经验-伯恩斯坦置信序列(EB-CS),该序列需要对修正后收益进行独立论证的界限。我们为Leduc德州扑克结构性确立此界限,并刻画由CS下注上限及该界限设定的宽度下限,该下限决定方差收益中有多少转化为更早停止;描述性HUNL EB-CS运行显示停止时间比中位数为1.37倍。AV-AIVAT将方差缩减转化为高效、可审计的早期停止,同时将渐近筛选与精确认证分离,使评估能在证据充分时即刻停止,并向第三方提供在停止时刻重新核查结论所需的一切。
低频陷阱:视频语言模型在简单事件记录上失败 Sarvesh Baskar 2026-08-06 PDF 真实世界视频基准提供了广泛的覆盖范围,但其固定片段将事件数量、速率、持续时间和视觉复杂性纠缠在一起,使得故障模式难以隔离。现有的程序化基准虽然提供了更好的控制,但仅对最终答案评分,而非对照可执行的真值审计报告的事件。为弥合这一差距,我们引入了基于轨迹锚定的参数化剖析,用于三个受控视频任务中的事件计数:弹球墙壁接触、视觉闪烁和类别状态转换。在2,190个视频中,我们变化事件数量N和频率F,同时保持渲染固定。每个视频包含一个可执行的事件轨迹,用于能力表面估计和时间戳级评估。我们的结果揭示了分阶段的时间故障。在80%可靠性阈值下,Gemini 3.6 Flash可靠地计数持久状态转换,最多12个事件,频率为0.5和1.0 Hz,但对于瞬态闪烁事件,未显示出可靠的正计数区域。因此,事件表示决定了模型是否最初访问证据——这一限制随着数量和频率的增加而加剧。在高数量、高频率区域,仅0.2%的最终计数正确,模型仅恢复18.1%的真实事件。为测试视觉访问是否为主要瓶颈,我们增加采样率。尽管这使弹球准确率从19.6%提升至29.3%,但报告序列与真值一致的时间仅占3.7%。因此,额外帧可能抬高最终分数,而不产生忠实的事件恢复。不同的提示策略产生同样有限的增益,真实世界视频评估也显示出成功集中在低事件数量。最终,轨迹锚定的剖析将视频评估从聚合准确率指标转变为详细诊断,揭示时间推理失败的位置。
资源化权威:一种面向已部署AI智能体参与式治理的机制设计模型 Praphul Chandra 2026-08-06 PDF 我们为一个已部署AI代理的持续参与式治理给出了一个正式的机制设计模型。该机制基于这样的原则:治理应通过资源分配来控制AI代理,从而通过计算预算使授权自我执行。该机制旨在确立安全AI范式,即计算是有效的治理杠杆。我们将我们的工作定位为部署者之上的合规性或公共资源覆盖层。一个治理周期是一个扩展形式博弈,其中经过验证的人类利益相关者依次到达,并在提供或拒绝市场上,以一种刻意区别于代理计算的治理货币进行贡献。一个资金聚合器将原始贡献转化为广度加权的有效支持——一个带有滞回效应的双阈值门将净支持转换为二元授权,通过一个受外生认证安全上限约束的耦合映射,释放计量计算预算——在硬件中实现为签名计算许可证,从而使决策自我执行。我们刻画了该机制能够治理的代理类别,并将被治理代理对治理选民的操纵隔离为核心开放问题。我们还引入了几个应对被治理代理操纵治理选民挑战的方案。
CalibForge:面向可学习终端任务扩展的对抗性求解器校准 Fanzhe Meng 2026-08-06 PDF 训练终端代理需要可执行且可验证的任务,这些任务不仅应可解决,而且对学习而言应具有适当的挑战性。可执行验证确立了可行性,但并未揭示任务相对于给定求解器设置的行为方式。在本文中,我们提出了CalibForge,一个自主的终端任务合成系统,该系统利用已验证的求解器行为,通过对抗性求解器校准来修订候选任务。多求解器校准针对异构求解器池中的分歧,而对比求解器校准则针对指定的强通过/弱失败关系;两者都将基于已证明的可解性锚定的求解器相对可学习区域操作化。使用CalibForge,我们构建了5,431个校准后的终端任务。我们的消融实验表明,这两种策略比仅进行编写和验证或仅使用单一求解器反馈提供了更有效的监督。在完整集合上训练的模型在Terminal-Bench 2.0上达到了32.58%和47.57%的准确率。相对于相应基础模型的最大改进在Terminal-Bench 2.0上达到24.71个百分点,在SWE-bench Pro上达到27.68个百分点,在Doc2Repo上达到30.04个百分点。这些结果共同支持将求解器相对可学习性作为构建有效且可迁移的代理训练数据的实用目标。