| 通过选择性上下文偏好优化学习何时信任 |
Xian Sun |
2026-08-06 |
PDF |
语言模型越来越多地根据外部信号来调整其答案,而一个单一的误导性信号就能将正确答案变为错误。显而易见的补救措施——训练模型抵抗此类信号——隐藏着一种失败模式:一个忽略所有上下文的模型看似稳健,但在上下文值得信赖时却毫无用处。我们将此问题重新定义为选择性信任,并引入MIST,这是一个人工标注的基准,在四种匹配条件下(干净、误导、正确上下文、无关上下文)呈现每个推理项,同时引入SC2W,这是一个配对指标,统计误导性信号将干净正确的答案翻转为错误的频率。通过一项全面的基准研究,我们观察到这种易感性是普遍存在的。随后,我们提出SCOPE,它挖掘干净正确/误导错误的失败案例,并优化标准直接偏好优化(DPO)目标,该目标基于在所有四种条件下均衡匹配的偏好对,而非仅基于误导项。我们的方法显著降低了流行开源模型上的SC2W,同时在添加的上下文干净、正确或无关时保持准确性。通过这项工作,我们认为模型应依据选择性信任来评判,而非仅凭抵抗力。 |
| DyPES-VLA:学习共享动力学先验与具身特定控制以实现跨具身操作 |
Junfeng Li |
2026-08-06 |
PDF |
视觉-语言-动作(VLA)模型已成为机器人操作的有力范式,但为异构机器人本体训练单一通用策略仍是一个开放问题。现有方法存在两个主要局限。首先,它们未能充分利用跨多样视觉和交互数据共享的动态先验,限制了跨本体迁移。其次,它们需要大量手动预处理,将特定本体的动作转换为通用格式。为克服这些局限,我们提出DyPES-VLA,一种学习共享动态先验和特定本体控制的跨本体VLA。首先,我们通过在跨本体数据上以未来预测目标训练视觉-语言模型(VLM)来学习共享动态先验,驱动共享查询表示捕捉物体运动、接触及交互引发的场景变化。其次,一个特定本体的专家混合(MoE)动作头将这些共享动态先验直接转换为每个本体原生动作空间中的可执行控制,无需手动预对齐异构动作为通用格式。该动作头共享注意力层以捕捉常见的时间动作结构,而其特定本体的前馈专家则解决不同本体的独特运动学约束和控制语义。作为通用策略,我们的方法在仿真和真实世界评估中达到最先进性能,在LIBERO上取得98.0%成功率,在RoboCasa-GR1上为59.25%,在RoboTwin 2.0上为89.02%。 |
| 工具调用的苦涩教训 |
Ishan Patel |
2026-08-06 |
PDF |
工具使用将LLM转变为超越其训练数据行动的智能体,而对于具备代码能力的模型,程序化工具调用通过用自然链式与并行化的脚本替代僵化的JSON调用,进一步扩展了这一能力。然而,在现有基准上,针对当前及先前模型世代,在真实世界任务条件下,对作为代码的工具进行系统性评估尚未开展。在本工作中,我们在BFCL v4上对14种语言模型,实证比较了程序化工具调用(PTC)与原生JSON工具调用。在程序化工具调用范式中,工具以类型化的Python存根形式暴露,模型通过代码调用它们,执行和结果在单一智能体回合中处理。在BFCL v4上,程序化工具调用在14种模型中的11种上匹配或超越了原生JSON工具调用,其中GPT-5.6系列相比JSON工具调用基线提升了10.6%。此外,在并行扇出条件下,它在14种模型中的13种上匹配或优于基线,并在上下文退化条件下保持稳定,而基线平均退化2.3%。我们的结果表明,程序化工具调用是JSON工具调用的可行且稳健的替代方案,其性能随发布世代的模型能力而跟踪提升。 |
| 追踪心脏:心力衰竭特征工程的一种证据关联流水线 |
Soorya Ram Shimgekar |
2026-08-06 |
PDF |
电子健康记录(EHR)特征工程是临床研究和人工智能中的主要瓶颈,占数据科学家工作量的39-45%。这一问题在心力衰竭中尤为突出,该病影响约670万美国成年人,需要将碎片化的EHR数据与疾病特异性、基于指南的临床推理相结合。现有的基于规则和基于大语言模型(LLM)的方法仅提供部分自动化,且可维护性和证据可追溯性有限。我们开发了Nimblemind多智能体系统(nMAS),这是一个基于证据、以评分标准为支撑的自动化心力衰竭特征工程流水线,并在来自九个EHR源表的500条虚拟患者记录上进行了评估。nMAS生成了132个结构化特征和70个按评分标准评分的聚合特征,验证了结构完整性、评分标准合规性和来源可追溯性,并由受限LLM进行审计。加入聚合特征后,HFrEF表型分类的留出集AUROC从0.895提升至0.963,HFpEF从0.870提升至0.910,独立的基于LLM的评分标准评估对证据支持和方法学合理性的评分为最高分的81.5%。这些结果证明了针对复杂心血管EHR数据的自动化、可审计特征工程的可行性,但评估仅限于单机构队列,仍需外部验证。 |
| 探究移动购物应用中的人工智能数字主权:以尼日利亚为例 |
George Grispos |
2026-08-06 |
PDF |
电子商务移动应用在尼日利亚的普及正在扩大,既带来了机遇也带来了风险,包括欺诈和用户对数字技术控制力的减弱,引发了对数字主权的担忧。本研究探讨了尼日利亚移动应用中的人工智能(AI)如何影响数字主权,并通过平台透明度作为用户意识和控制力的关键指标进行考察。采用解释性方法,本研究将选定安卓应用的取证分析与情境文档分析相结合,以识别AI功能并评估披露实践。研究结果显示,AI在应用中广泛实施,但对其使用的透明度仍然有限。对尼日利亚的社会经济分析进一步表明,对消费者数字平台的依赖日益增加,AI意识中等,互动模式不均衡。通过提供关于AI透明度和平台实践的实证证据,本研究增进了对个体数字主权的理解,并强调了在AI驱动的数字环境中保护用户控制力所面临的挑战。 |
| 一种最优的不可知PAC算法 |
Markus Engelund Mathiasen |
2026-08-06 |
PDF |
设$H\subseteq{-1,+1}^X$为有限VC维$d\ge1$的类别。记$L$为二元风险,$L^=\min_{h\in H}L(h)$,我们构造一个学习器,实现统计最优的风险界:从大小为$n$的i.i.d.样本出发,对每个$0<δ\le 1/2$,以至少$1-δ$的概率有[ L(\widehat h) \le L^+ 7\cdot10^8\left( \sqrt{\frac{L^(d+\log(1/δ))}{n}} +\frac{d+\log(1/δ)}{n} \right). ] 这解决了在任意固定$L^$下,agnostic PAC学习的样本复杂度问题,其常数与Devroye、Györfi和Lugosi [A Probabilistic Theory of Pattern Recognition, Springer, 1996]的下界匹配。 |
| AV-AIVAT:在不完美信息博弈中,以74倍更低成本实现带认证的随时有效停止的智能体评估 |
Boning Li |
2026-08-06 |
PDF |
判断两个智能体孰强孰弱,意味着持续对局直到技巧胜过运气,而每局对局都耗费资金、模型推理或专家时间。由于所需对局数未知,固定预算评估要么在结果已定后继续支付,要么在智能体尚无法区分时提前停止,而采用普通置信区间的朴素可选停止会破坏既定显著性水平。我们使此类评估在证据充分时即刻停止,且保证不变。行动知情价值评估工具(AIVAT)通过条件均值零修正降低不完美信息博弈中的方差,在跨越71,439手配对单挑无限注德州扑克(HUNL)的15种LLM智能体配置中,中位数降低54倍,但未说明何时停止。我们将AIVAT与连续监测的置信序列(CSs)结合,形成任意有效AIVAT(AV-AIVAT),其在线价值模型仅从过往对局学习,因此没有对局会修正自身。在名义95%水平及±1大盲注的目标精度下,原始结果在渐近CS(AsympCS)下停止所需手数中位数是AIVAT修正结果的74倍。精确有限样本认证使用经验-伯恩斯坦CS(EB-CS),这需要对修正后收益进行独立论证的界。我们为Leduc德州扑克结构性建立此界,并刻画由CS的赌注上限和该界设定的宽度下限,该下限决定方差收益中有多少转化为更早停止;描述性HUNL EB-CS运行显示停止时间比中位数为1.37倍。AV-AIVAT将方差缩减转化为高效、可审计的早期停止,同时将渐近筛选与精确认证分离,因此评估可在证据充分时即刻停止,并向第三方提供在停止时刻重新核查结论所需的一切。 |
| 低频陷阱:视频语言模型在简单事件记录上的失败 |
Sarvesh Baskar |
2026-08-06 |
PDF |
真实世界视频基准提供了广泛的覆盖范围,但其固定片段将事件数量、速率、持续时间和视觉复杂性纠缠在一起,使得故障模式难以隔离。现有程序化基准虽提供更好的控制,但仅对最终答案评分,而非对照可执行真值审计报告的事件。为弥合这一差距,我们引入基于轨迹的参数化剖析,用于三个受控视频任务中的事件计数:弹球墙壁接触、视觉闪烁和类别状态转换。在2,190个视频中,我们变化事件数量N和频率F,同时保持渲染固定。每个视频包含一个可执行事件轨迹,用于能力表面估计和时间戳级评估。我们的结果揭示了分阶段的时间故障。在80%可靠性阈值下,Gemini 3.6 Flash可靠地计数持久状态转换,最多12个事件,频率为0.5和1.0 Hz,但对瞬态闪烁事件未显示可靠的正确计数区域。因此,事件表示决定了模型是否最初访问证据——这一限制随着计数和频率增加而加剧。在高计数、高频率区域,仅0.2%的最终计数正确,模型仅恢复18.1%的真实事件。为测试视觉访问是否为主要瓶颈,我们增加采样率。尽管这使弹球准确率从19.6%提升至29.3%,报告序列与真值一致的时间仅占3.7%。因此,额外帧可能抬高最终分数而不产生忠实的事件恢复。不同提示策略带来同样有限的增益,真实世界视频评估也显示成功集中于低事件计数。最终,基于轨迹的剖析将视频评估从聚合准确率指标转变为详细诊断,揭示时间推理失败之处。 |
| 资源化权威:一种面向已部署AI代理参与式治理的机制设计模型 |
Praphul Chandra |
2026-08-06 |
PDF |
我们为一个已部署AI代理的持续参与式治理提出了一个正式的机制设计模型。该机制基于这样的原则:治理应通过资源分配来控制AI代理,从而通过计算预算使授权自我执行。该机制旨在确立安全AI范式,即计算是有效的治理杠杆。我们将我们的工作定位为部署者之上的合规性或公共资源覆盖层。一个治理周期是一个扩展形式博弈,其中经过验证的人类利益相关者依次到达,并在提供或拒绝市场上以治理货币贡献,这种货币刻意与代理的计算资源区分开来。一个资金聚合器将原始贡献转化为广度加权的有效支持——一个带有滞回效应的双阈值门将净支持转换为二元授权,通过受外生认证安全上限约束的耦合映射,释放计量计算预算——在硬件中实现为签名计算许可证,从而使决策自我执行。我们刻画了该机制能够治理的代理类别,并将被治理代理对治理选民的操纵视为核心开放问题。我们还引入了若干挑战,以应对被治理代理对治理选民的操纵。 |
| CalibForge:面向可学习终端任务扩展的对抗性求解器校准 |
Fanzhe Meng |
2026-08-06 |
PDF |
训练终端代理需要可执行且可验证的任务,这些任务不仅需要可解,还要对学习而言具有适当的挑战性。可执行验证确立了可行性,但并未揭示任务相对于给定求解器设置的行为。在本文中,我们提出CalibForge,一个自主的终端任务合成系统,该系统利用已验证的求解器行为,通过对抗性求解器校准来修订候选任务。多求解器校准针对异构求解器池内的分歧,而对比求解器校准则针对指定的强通过/弱失败关系;两者都将基于已证明可解性的求解器相对可学习区域操作化。使用CalibForge,我们构建了5,431个校准后的终端任务。我们的消融实验表明,这两种策略比仅进行编写和验证或仅使用单一求解器反馈提供了更有效的监督。在完整集合上训练的模型在Terminal-Bench 2.0上达到32.58%和47.57%的准确率。相对于对应基础模型的最大改进在Terminal-Bench 2.0上达到24.71个百分点,在SWE-bench Pro上达到27.68个百分点,在Doc2Repo上达到30.04个百分点。这些结果共同支持将求解器相对可学习性作为构建有效且可迁移的代理训练数据的实用目标。 |