| TrustedARI:面向自主AI的可信原生代理路由基础设施 |
Qi Li |
2026-06-14 |
PDF |
AI智能体越来越多地通过智能体路由基础设施(ARI)访问外部模型、工具和服务,以管理异构接口和碎片化订阅的开销。然而,ARI的架构引入了根本性的信任风险:它能够以明文形式获取智能体查询和服务响应,同时智能体无法验证其查询是否被路由到预期的服务提供商,也无法验证请求和响应是否未被篡改。为解决这一问题,我们提出了TrustedARI——首个面向智能体AI的信任原生智能体路由基础设施。在架构上,TrustedARI基于三项核心创新构建:(i)一种适配ARI的三方TLS握手协议,通过角色特定的TLS密钥材料分发,使智能体和ARI能够联合认证服务提供商;(ii)一种隐私保护的查询构建协议,允许智能体和ARI在不暴露各自私有输入的情况下协作构建格式正确的查询;(iii)一种可验证的计费协议,支持基于使用量的公平结算,同时保障服务响应的完整性和机密性。我们实现并广泛评估了TrustedARI的原型以验证其性能。实验证实TrustedARI具有高效性:与现有三方TLS握手相比,我们的ARI适配握手协议将通信开销降低了39.34%。此外,隐私保护查询构建协议带来的开销可忽略不计——计算时间平均为0.19秒,通信成本为0.58 MB——而可验证计费协议将证明生成速度提升了28.20倍。关键在于,TrustedARI无需对服务提供商进行任何修改即可直接部署。 |
| 真相留在家中:通过模型谱系中继承的诚实头增强上下文基础 |
Miso Choi |
2026-06-14 |
PDF |
大型语言模型(LLM)的最新进展催生了众多专门的多模态大语言模型(MLLM),这些模型共享基础LLM,形成了不同的模型谱系。目前尚不清楚基础LLM与下游变体之间是否存在根本性的行为关联。我们通过量化注意力头级别的上下文真实性分数来探究这一问题。在包括Vicuna、Qwen2.5、LLaMA2和Mistral系列模型在内的多种LLM和MLLM谱系中,我们发现真实性分数在模型家族内部得到强烈保留,即使在指令微调或多模态适配后也是如此。我们进一步证明,这种继承性与注意力头权重的保留一致,且上下文真实头会关注与查询相关的证据。基于这一发现,我们提出TruthProbe,一种软门控策略,在保留其他头贡献的同时增强上下文真实头。TruthProbe在HaluEval上提升了上下文真实性,并在POPE和CHAIR上减少了多模态幻觉,基础LLM的真实性分数能有效迁移至其微调后的LLM和MLLM后代。代码已开源:https://github.com/miso-choi/TruthProbe。 |
| SACE:视觉自回归模型中语义奇点处的概念擦除 |
Siya Yang |
2026-06-14 |
PDF |
视觉自回归(VAR)模型的快速进展为高保真文本到图像合成开辟了变革性前沿,同时也加剧了对生成内容安全对齐的担忧。现有擦除技术主要针对扩散模型的同质去噪步骤设计,直接应用于VAR模型会导致灾难性语义崩溃和视觉伪影。为应对这一基础性挑战,我们首先提出语义奇点公理,该公理认为提示中嵌入的任何目标语义概念在Scale-0阶段被确定锁定。随后通过提出的增量语义显著性分析(ISSA)严格验证该公理,该方法还能使社区透明地审视从粗到细的语义注入过程。基于这一洞见,我们提出首个面向VAR模型的尺度感知概念擦除框架(SACE)。通过将干预严格限制在第一个尺度,我们的方法结合了熵正则化擦除目标以防止高熵采样退化,同时采用恢复性保留损失安全锚定纠缠良性先验的完整性。大量实验表明,我们的方法在各类领域实现了精准的概念擦除性能,且训练开销极小,及时而优雅地解决了新兴VAR架构中固有的关键安全漏洞。代码开源地址:https://github.com/limerenceysy/SACE |
| ScratchLens:面向Scratch程序的透镜参数化行为等价性 |
Yuan Si |
2026-06-14 |
PDF |
两个Scratch程序可能在语法上差异很大——重命名变量、拆分脚本、提取自定义积木或重新排序初始化——但行为仍然相同;而一个积木的编辑,例如将阻塞广播替换为异步广播,可能仅在特定调度下才显现出差异。判定行为等价性对于自动反馈、评分支持和修复验证至关重要,但树差异比较过于严格,而单次运行的动态比较对于并发、随机和时序依赖的行为来说并不可靠。我们观察到,基于积木的程序的等价性是透镜参数化的:最终状态、帧轨迹、监视器、事件因果性和调试轨迹会引发不同的观察关系。SPECTRA通过一套因果发散现象和观察透镜的分类体系使这一点明确化。它将Scratch项目编译为类型化资源和语义事务的因果中间表示,规范化重命名、守卫条件和过程体,用Mazurkiewicz轨迹范式对同触发器并发进行商化,将程序顺序与竞态分离,并通过SMT约束和虚拟机支持的反例引导精化处理剩余边界。结论性判定附带证据:通过双射和轨迹商化证明等价性,通过类型化见证证明差异性,未解决的情况则标记为未知。在来自真实Scratch项目的虚拟机见证变异语料库上,SPECTRA判定所有444个验证对,并在严格评分下对见证差异对未产生任何虚假等价声明(0/158)。结构方法、纯动态方法和LLM基线在分类体系预测的类别上均失败;消融实验量化了偏序归约和透镜参数化的贡献;针对性场景揭示了随机测试遗漏的模糊变异发散。 |
| 关于定义自然语言处理中的抹除伤害 |
Yu Lu Liu |
2026-06-14 |
PDF |
自然语言处理系统的部署引发了对其可能产生危害的担忧,其中包括表征性危害。近期文献已开始概念化并衡量其中一种危害——消除危害。然而,该领域在识别和衡量消除危害方面缺乏清晰且连贯的概念基础。现有对消除危害的概念化往往过于宽泛——难以明确界定和衡量消除危害所需的条件——或局限于特定场景——虽便于针对这些场景进行测量,但可能难以适应其他场景。为填补这一空白,我们构建并提出了一种结构化的消除危害定义,阐明确立消除危害是否发生所需的必要要素,以及实践者需明确阐述和操作化以衡量消除危害的具体内容。 |
| 布朗核阶梯 |
Mahdi Mohammadigohari |
2026-06-14 |
PDF |
构建在数学上易于处理的函数空间以捕捉层级组合表示,仍是统计学习理论的核心挑战。我们引入布朗核阶梯(BKL),这是一种通过布朗核积分构造递归定义的积分再生核希尔伯特空间层级结构。从线性泛函出发,每一层通过对前一层子集上概率测度支持的布朗核进行积分获得,从而形成深度直接通过层级编码的递归函数空间模型。基于该框架,我们定义了规范BKL空间及其关联的复杂度泛函。我们建立了这些空间的若干解析与统计性质,特别证明了BKL空间构成拟巴拿赫空间、满足深度依赖的赫尔德正则性估计,并具有关于深度的严格单调性。进一步,我们证明了正则化经验风险最小化的存在性结果,并推导了在环境维度和层级深度上一致受控的高斯复杂度界。分析的关键要素是基于递归子集分解与布朗核阈值表示的组合证明技术。这些估计为BKL空间上的正则化经验风险最小化提供了近参数阶的超额风险保证。我们的结果为研究深度学习中的组合表示提供了数学上易于处理的层级函数空间框架。 |
| 让他们偷:用知识蜜罐诱捕大语言模型提取攻击 |
Yuyang Dai |
2026-06-14 |
PDF |
作为商业API部署的大型语言模型容易受到模型提取攻击,而现有防御措施要么响应滞后,要么损害合法用户的体验。我们提出知识陷阱防御机制,通过构建蜜罐知识图谱和面包屑引导探索,将提取攻击导向低迁移性的知识。该机制不阻断查询或扰动输出,而是消耗攻击者有限查询预算于下游效用可忽略的知识,同时保持良性用户性能。在医疗和金融领域的实验表明,知识陷阱在不降低合法用户准确率的情况下,平均减少替代模型一致性6.2%,优于现有对用户产生可测量影响的防御方案。这些结果表明,防御知识空间遍历是缓解大语言模型提取攻击的可行方向。 |
| AttackonCTF:大语言模型时代下的硬件安全竞赛基准防御 |
Mohamadreza Rostami |
2026-06-14 |
PDF |
诸如HackTheSilicon等硬件安全竞赛,既是评估漏洞检测方法的基准平台,也是训练人类与AI的工具。然而,我们的研究表明,大语言模型正在威胁这些平台的有效性。检测器并非基于真正的安全推理,而是利用一种类似diff的语法比较方式,实现了83%的检测率,这破坏了公平评估。为解决这一问题,我们提出了首个面向LLM、语义保持的混淆框架,专门用于这些基准测试。与知识产权保护方法不同,该框架在保持功能的同时,应用了人类可读的变换和受控的diff噪声。在HackTheSilicon上,该框架在仅10%混淆率下将基于LLM的检测准确率降低了50%,在完全混淆下降低了78.6%,从而恢复了基准测试的可靠性。 |
| 基于记忆增强的图液态时间常数网络的连续跨域交通状态预测 |
Jinrong Xiang |
2026-06-14 |
PDF |
交通状态预测是智能交通系统中的基础任务。在实际应用中,部分区域因感知基础设施不足导致交通观测数据有限,这使得跨领域知识迁移成为解决数据稀缺型交通预测的重要方案。然而,现有跨领域交通预测方法仍存在若干局限,包括粗粒度的源-目标域适配、对未见目标域模式的有限处理能力,以及在非规则或异质时间条件下对连续交通动态建模不足等问题。针对上述问题,本文提出一种连续跨域交通预测框架——记忆增强图液态时间常数网络(MA-GLTC)。具体而言,我们首先构建时空单元(STU)将交通网络分解为可迁移的局部单元,实现跨领域的细粒度知识对齐;随后开发图液态时间常数网络(GLTC)以连续时间建模图耦合的交通演化过程。与通用图神经ODE模型不同,GLTC将图耦合循环电导引入液态时间常数动态中,使节点状态能够通过泄漏、自适应时间常数和邻域感知反馈进行演化。此外,我们设计了基于记忆的迁移存储(MTS)机制,用于保留源域知识、检索匹配的交通模式,并在出现未见状态时更新可靠的目标域模式。在五个公开交通数据集上的实验表明,MA-GLTC在短期和长期预测任务中均持续优于代表性域内和跨域基线方法。与次优方法相比,MA-GLTC分别将平均预测误差降低了3.02%、0.33%、8.92%、10.09%和2.11%。 |
| 离散扩散语言模型的平均场并行解码 |
Tamim Zoabi |
2026-06-14 |
PDF |
离散扩散语言模型支持并行令牌生成,为低延迟解码提供了可行路径。然而,基于边际置信度独立选择令牌会限制并行效率:单独看来可靠的令牌在同时更新多个位置时可能形成不兼容的配置。我们提出了一种无需训练的推理框架来协调这些并行更新。在每次前向传播中,该方法为每个掩码位置分配提交分数,并通过模型预测分布中的成对交互来优化这些分数。通过变分松弛方法,我们得到一个简单的定点更新公式,可在单次前向传播中抑制冲突的同步提交。该机制使解码器能够在保持竞争性生成质量的同时并行提交更多令牌。该方法轻量化,无需辅助模型或重新训练,可直接嵌入现有扩散解码流程。在推理和代码生成基准测试上的实验表明,该方法在质量-延迟权衡方面实现了持续改进。 |