| SPADE:自适应合成可执行环境中的自我对弈 |
Bo Liu |
2026-08-19 |
PDF |
持续的自我提升需要不断扩展的、自我生成的、多样化的、适应性目标池。对于语言代理而言,现有的训练环境池(手工策划、静态合成或冻结验证器)在学习者扩展时保持目标分布固定。我们引入了SPADE(自适应合成可执行环境中的自我对弈),这是一种自我对弈强化学习框架,其中单个大型语言模型扮演两个角色:一个环境设计器,编写完整、长视界的训练环境作为可执行代码,采用OpenAI Gym风格的reset()/step()接口;以及一个推理代理,学习在其中行动。每个环境都是有状态的多轮环境(状态转换、奖励函数和验证代码),因此一个接口覆盖了推理问题和多步代理工具使用。推理代理的遗憾通过其有无特权提示的奖励差距来估计;在优化这一遗憾信号时,环境设计器学会针对代理能力边缘的环境进行设计,同时保持其可行性。通过大量实验,我们发现几个对成功至关重要的组件:将环境设计器基于从大型预训练语料库中采样的文档进行接地,并赋予其累积的环境记忆。扩展到300亿参数模型,SPADE在八个保留的数学、科学、代码和推理基准上平均比最强的固定环境基线提高+5.3,并将工具使用设置提升+5.7(BFCL-v4多轮)和+13.9(ACEBench-Agent);在游戏设置中,与最强基线的差距随模型规模增长而扩大。通过使环境设计本身成为可学习组件,SPADE向开放式自我提升迈出了具体一步。 |
| SiNMULI:一种用于恶意URL识别的新型符号网络方法 |
Avijit Gayen |
2026-08-19 |
PDF |
在当今人工智能飞速发展的时代,计算机安全和在线防护措施已取得显著进步。然而,恶意网站仍持续助长网络钓鱼、欺诈活动及未经请求通信的传播。传统的机器学习、深度学习和伪造网站检测方法主要依赖静态数据分析,这往往难以有效应对恶意在线实体不断演变的特性。针对这些挑战,在本工作中,我们提出了一种基于符号网络的恶意URL识别方法,即SiNMULI。我们引入了一个创新框架,将有害URL的识别概念化为一个基于符号网络的二分类问题,该问题深深植根于社会网络分析和社会平衡理论的基本原则。在此方法中,基于URL的反向链接(即外部超链接)构建一个符号网络,其中每个节点代表一个URL,超链接作为符号边。利用平衡理论推理机制,我们的方法传播边的符号,并通过在入链上采用51%多数规则来对未标记域名进行分类。在真实世界数据集上的实验结果表明,SiNMULI达到了99.89%的准确率、99.62%的精确率和99.80%的F1分数,优于传统机器学习和深度学习基线模型。除了高准确性外,SiNMULI还提供了可解释性、对对抗性混淆的鲁棒性以及对训练数据的独立性,使其成为现实世界网络防御中轻量级且可扩展的解决方案。 |
| ADEPT:通过强化学习进行预训练和后训练以加速灵巧性 |
Jayjun Lee |
2026-08-19 |
PDF |
我们提出通过预训练加速灵巧性(ADEPT),一个大规模强化学习(RL)框架,用于在高自由度(DoF)机器人实体上学习可模拟到现实迁移的灵巧操作,这些实体能够直接从原始视觉-触觉感知解决长时程任务。ADEPT在一个通用物体重定位任务上预训练一个灵巧策略,然后以该预训练行为为先验,对下游策略进行后训练。ADEPT使得在多指机器人上学习那些从零开始难以发现的新行为成为可能,并避免为每个新下游任务重复学习相同的技能集。预训练策略零样本地处理下游任务的重定位阶段,但朴素的RL微调在迁移过程中会迅速退化这一能力。我们通过一种稳定的后训练方案解决此问题,该方案结合了行为克隆蒸馏、评论家预热和保守的在线策略更新。为了安全地利用完整的运动学灵巧性,我们引入了一个关节空间几何织物,在RL策略与机器人之间进行调解。我们将后训练的教师模型蒸馏为感知型学生模型,这些学生模型在两个实体上实现零样本模拟到现实迁移:一个配备两个RGB摄像头的23自由度Kuka-Allegro,以及一个配备两个RGB摄像头和五个基于视觉的触觉传感器的29自由度Flexiv-Sharpa,并能从具有挑战性的初始状态以人类水平的速度解决长时程任务。 |
| 超越教师似然:面向长上下文推理的组校准在策略蒸馏 |
Zhu Zhang |
2026-08-19 |
PDF |
On-policy蒸馏(OPD)通过来自更强教师的密集token级指导来训练学生基于自身响应的模型。然而,在长上下文任务中,token级教师支持可能偏向于局部合理的响应,这些响应会遗漏分布在输入中的证据或违反全局任务约束。相比之下,任务特定的验证器在响应级别评估任务完成情况,并可能返回反映部分成功的分级奖励。我们在两个代表性的长上下文证据聚合任务的固定响应上诊断了这种不匹配。在更长的输入范围内,轨迹级OPD分数与验证器奖励的逐渐不一致,表明教师与验证器之间存在分歧。受此观察启发,我们引入了组校准On-policy蒸馏(GC-OPD)。GC-OPD在每个rollout组内分别对验证器奖励和轨迹级OPD分数进行归一化,并使用它们的差异作为带符号的教师-验证器分歧残差。相对优势基于的信用分配(RACA)根据token的相对OPD优势将此轨迹级残差分配到各个token,同时保留原始OPD信号。在五个长上下文基准上,使用GC-OPD进行后训练将官方Qwen3-4B和Qwen3-8B检查点的五基准平均值分别从29.08提升到40.47,以及从35.12提升到44.65。在相同设置下,原始OPD达到39.31和43.56。受控消融实验表明,带符号残差比额外的OPD派生项或直接组归一化验证器奖励添加更有效,而RACA进一步优于均匀token分配。这些结果共同表明,组相对残差校准可以在不丢弃密集token级指导的情况下整合验证器结果。代码可在https://github.com/SolereZhang/GC-OPD获取。 |
| 基于新型3D深度学习架构的GPR数据图像引导路面缺陷识别 |
Yuandong Pan |
2026-08-19 |
PDF |
探地雷达(GPR)是一种广泛应用于土木和交通工程中地下检测的非破坏性传感技术。尽管其在路面状况评估方面具有潜力,但GPR在自动化检测中的大规模应用面临两个关键挑战:标注真实世界数据集的稀缺性,以及缺乏针对三维(3D)GPR数据独特特征设计的深度学习模型。本研究通过首先引入一种经济高效的数据准备流程来解决这些限制,该流程将正射影像红绿蓝(RGB)图像与3D GPR扫描相结合,以生成标注的3D GPR数据集。所提方法使用RGB和GPR数据的对齐段,以路面表面图像为参考,将表面可见缺陷的标签转移到相应的GPR段,从而在运营中高速公路路段收集的真实世界数据集中实现高效的大规模标注。除了数据集贡献外,我们提出了一种专门的3D卷积神经网络(CNN)架构,该架构结合了残差连接、混合卷积核大小以及深度和通道注意力机制,以增强特征表示和缺陷分类。该模型在检测路面结构中补丁和裂缝缺陷的二分类任务上进行了评估。实验结果表明,所提网络在多个评估指标上优于基线架构。消融研究进一步证实了所设计架构组件的有效性。这项工作为真实世界数据集生成提供了一种可扩展且实用的方法,并提出了一个新颖的深度学习框架。 |
| 针对通过声音模仿查询声音的微调策略 |
Aditya Bhattacharjee |
2026-08-19 |
PDF |
本技术报告描述了我们在AES AIMLA 2025挑战赛中通过声音模仿查询音效的获胜方案。我们研究了两种互补的微调策略:使用冻结的预训练CED编码器进行对比学习,以及使用MobileNetV3编码器结合半硬负样本的联合对比-三元组学习。本报告已为后续参考更新,以包含挑战赛后发布的相关细节。 |
| Lévy注意力:连续时间注意力的单遍预测不确定性 |
Sotirios P. Chatzis |
2026-08-19 |
PDF |
针对不规则采样时间序列的深度模型能够在任意连续时间戳上回答问题,却未报告每个答案应被信任的程度。我们证明注意力层本身可以弥合这一差距:通过正确的随机公式化,每次预测所经过的路径也能以闭合形式、零额外成本报告其应被信任的程度。我们引入Lévy注意力,一种交叉注意力算子,其输出是对非齐次泊松随机测度的随机积分:查询-键兼容性在连续(时间×通道)索引空间上组装强度,测度在其下散布原子,输出则在这些原子处平均插值后的值场。在期望上,它简化为一个磨光余弦核注意力,因此能替代softmax层并以精确梯度训练。softmax所丢弃的,泊松构造以闭合形式保留:证据$Λ_q$(总兼容性质量)和分歧$\mathrm{tr}\,Σ_V(q)$(值散布)。一个精确的方差恒等式使它们的组合$\hatσ(q)=\sqrt{\mathrm{tr}\,Σ_V(q)\,\varphi(Λ_q)}$成为采样算子的均方根偏差,由确定性路径发出,无需训练头。实证中,分歧携带信号,而证据因子在密集数据上无信息,在稀疏数据上则高度信息丰富。在t-PatchGNN上,算子替换相对于匹配对照最多损失5.6%的准确率,在最稀疏数据集上无损失。免费的分歧信号在匹配的五种子套件上优于20次MC dropout,且$\hatσ$缩放一个校准高斯分布,其零样本CRPS优于五十次采样器;分裂共形包装器在每个水平达到名义覆盖,单次通过能在1.4秒内对3,383名未见患者按信任度排序。 |
| 学而后失:预训练中一个经过测量的单示例反事实 |
Zachary Speck |
2026-08-19 |
PDF |
单个训练样本对最终模型的贡献通常是估计而非测量的,因为测量它需要两次昂贵的完整预训练运行,这两次运行仅在一个批次的一行上有所不同。我们在小规模下进行了24次这种反事实实验。我们在OpenWebText上从零开始训练了32个GPT-2模型,参数为124M,跨越四个条件和八个随机种子。在第200步(共9,536步),处于峰值学习率时,我们将一个256行批次中的一行替换为携带194个令牌段落的固定上下文注入。三个注入条件为:1. 流畅散文,带有语料库验证的主题;2. 流畅散文,带有虚构主题,其全批次梯度差异与前者匹配在0.14%以内;3. 随机键盘字符。第四个条件是无注入的孪生模型。该段落从一次暴露中学习,然后衰减。注入后五十步,看到段落的臂在段落上的交叉熵预测优于未看到的臂,差异为0.039和0.044 nats,在八个种子中的八个上p < $10^{-4}$。在最终步骤,我们未检测到任一段落的这种差异,p值分别为0.25和0.71,相对于最小可检测效应0.025和0.079 nats,也未检测到两个段落之间的差异,p=0.54。我们报告的每个几何度量都在该衰减后取得。我们预先注册的插值损失屏障对比为+0.0068,p=0.509,相对于最小可检测效应0.032屏障单位。保留的交叉熵为$-0.00044$,p=0.310。逐层中心核对齐在任何层上均未可检测地区分任何条件。权重位移达到种子间欧几里得距离的44.1%,并在训练中点时已稳定92%,而屏障达到种子间屏障的3.0%。这两个数字大约相差15倍,且这是一个下限。注入将模型重新定位在其盆地内,而未将其移出。 |
| ChildSafeAds共享任务2026:面向儿童YouTube视频中的商业内容 |
Thales Bertaglia |
2026-08-19 |
PDF |
ChildSafeAds是一个关于YouTube视频中可能触达儿童和青少年的商业内容的共享任务。它包含来自939个频道的3360个视频。每个实例以提交给SponsorBlock的一段片段开始,SponsorBlock是一个开源众包浏览器扩展,其用户标记赞助片段,以便其他人可以跳过这些片段。我们将该片段与其可用的转录文本、视频和频道信息,以及视频描述中链接的销售或服务页面配对。系统需要确定正在推广的优惠类型(ST1),分配产品类别(ST2),并识别法律风险标志(ST3)。证据分为四个累积访问级别,从转录文本到链接页面,以便结果可以与收集数据的成本进行比较。我们数据中45.5%的视频未能正确使用平台内的广告披露方法(即“包含付费推广”标签)。GPT-5.4在专家组织团队审查样本并迭代分类法、提示和模型选择后生成了标签。GPT-5.6-luna独立标注了开发集。本报告描述了任务、数据和评估。更新版本将添加参与系统和共享任务结果。 |
| LearnAI:大学跨学科即时AI共创 |
Weihao Qu |
2026-08-19 |
PDF |
随着生成式人工智能重塑专业与教育实践,各机构面临一项挑战:如何支持从非编程者到进阶学生的多元学习者,在人工智能辅助的问题解决中建立信心并开展实践。大多数机构的应对措施分化为面向普通受众的概念性工作坊或面向计算机科学专业学生的技术课程,鲜有空间让混合能力的学习者能在与其先前经验相匹配的层次上参与常见的人工智能任务。本经验报告介绍了LearnAI框架,这是一种在一所综合性教学大学试点的即时人工智能共创双层模型。广泛接触层将简短演示嵌入现有课程,以规模化提升人工智能意识,覆盖五个学科18门课程的学生和教师。定制共创层提供自愿参与的一对一环节,客户与受过培训的本科生导师合作,遵循五阶段教学脚本:问题框架、工具-任务映射、迭代共同提示、部署与验证,以及伦理反思。在两个学期中,35位客户共创了36个作品集网站和20多个已部署的Web应用。对五位客户和两位导师的访谈显示,客户描述人工智能使用的方式发生了反复出现的变化,从将人工智能视为被动答案机器转向将其作为人类指导下的协作工具。一项小型配对前后人工智能准备度数据集(N = 7)提供了初步的描述性背景,导师记录则展示了教学脚本在不同客户类型中的实施与调整情况。我们报告了边界案例,包括感到不知所措的客户和故意拒绝使用人工智能的受访者。本文贡献了一个实用、可采纳的框架,并附有来自单一机构的初步证据。 |