| MM-Future:面向自动驾驶的多模式联合世界-动作建模 |
Shuai Liu |
2026-09-17 |
PDF |
自动驾驶涉及多模态不确定性下的耦合决策与场景演化。为捕捉这种耦合与不确定性,我们提出MM-Future,一种世界-动作模型,能够生成多对配对的场景-动作假设,并在每对内部建模双向交互。每个假设由结构化动作先验和独立未来场景源初始化,随后通过模态感知扩散Transformer共同演化。为支持高效多模态推演,MM-Future将多视角视频压缩为面向规划的表示,称为MM-Tokens。最后,未来条件提议评分器根据共享历史上下文及其配对预测未来对轨迹候选进行排序。在NAVSIM navtest上,MM-Future达到94.0 PDMS和91.5 EPDMS,同时在HUGSIM零样本闭环评估中获得32.3 HD-Score。消融实验表明,相较于单模态和仅动作变体均有一致提升,验证了多模态联合世界-动作建模的优势。 |
| 说得越多,付得越多:对LLM服务中提供商侧代币膨胀的黑盒审计 |
Leilei Chen |
2026-09-17 |
PDF |
在按 token 计费的 LLM 服务中,模型说得越多,用户付费越多。不诚实的提供商可以暗中操纵生成过程以膨胀输出 token,同时大体保持任务效用。我们将此类操纵定义为提供商侧 Token 膨胀攻击(PTIA),并在提供商控制流水线的查询、提示、表示和模型四个层面实例化了五种代表性攻击。我们的实验表明,每种攻击都将平均输出长度增加到干净基线的 10.2 倍以上,证明了 PTIA 在生成多个阶段的经济吸引力和可行性。然而,用户很难从黑盒响应中审计 PTIA。我们的关键观察是 PTIA 饱和:初始攻击会急剧拉长输出,但进一步强化或组合的效果要小得多。我们将这种饱和追溯到停止行为:初始 PTIA 会急剧降低序列结束 token 的概率,而进一步干预只会略微降低它。基于这一洞见,我们设计了一种轻量级单探针审计,施加受控的拉长干预。在 PTIA 下,该探针诱导的额外 token 远少于正常服务下。该审计既不需要可信的本地参考模型,也不需要历史干净响应,并且其分别发出的原始请求和探测请求类似于普通流量,使得规避变得困难。在四个开放权重模型上,它实现了 85.1% 的平均检测率,假阳性率低于 2%。在 15 个真实 LLM API 服务上,该审计标记出 7 个存在与 PTIA 一致的行为。 |
| 利用联邦学习加速大规模分片数据并行 |
Gianluca Mittone |
2026-09-17 |
PDF |
人工智能模型与高性能计算系统的共生扩展在其融合过程中不断带来算法挑战。基础模型(FM)是一个关键例子,需要在数千块尖端GPU上训练数月。分片数据并行(DP)是通过将数据和模型拆分到多块GPU上来加速此类计算的主流策略。然而,在大规模部署时,它会产生高得令人望而却步的通信开销,尤其是在性能异构的多层互连上。受联邦学习(FL)高效通信原理的启发,这项工作引入了两种混合算法——FL+FSDP和FL+HSDP——将分片DP与FedAvg式聚合交错结合。此类方法将大型DP部署解耦为更小、松耦合的联邦组,仅需极少的组间流量,同时使全局批量大小受组大小约束。对通信成本的形式化分析和实验验证证明了它们的可扩展性和灵活性。在512块A100 GPU上进行的Llama3.1 8B预训练表明,在相同超参数下,FL+FSDP和FL+HSDP相比其对应方案实现了最高8.04倍的数据处理速度和4.48更低的评估困惑度,展现出更优的计算效率和更高的模型质量。这些特性源于通信开销的降低以及全局批量大小相对于联邦组大小的有界增长。 |
| 利用稳定扩散-对抗模型从二维图像生成非均质三维地质微观结构 |
Ali Aouf |
2026-09-17 |
PDF |
表征黏土和胶凝材料的物理性质在从材料科学到地质废物处置的许多领域都至关重要。性质模拟通常需要三维成像,而三维成像成本高昂、并非总是可及,且对某些材料存在技术限制。深度生成模型的最新进展提供了一种绕过这一难题的途径,即从更易获取的二维图像重建三维体数据。在基于GAN的三维微结构生成方法中,SliceGAN在同质各向同性和各向异性体系上表现出良好结果。然而,它难以捕捉更复杂的异质微结构的精细细节,这促使人们探索替代的生成框架。我们引入了一种混合方法,借鉴了去噪扩散模型的稳定性和生成质量。由于没有三维真实数据可用,我们用对抗损失替代标准的去噪损失,这在我们实验中带来了稳定的训练过程。我们表明,所得模型能够生成不同复杂度的微结构,切片伪影极少,且与真实相分数和结构描述符高度吻合。 |
| 具有无限制有界契约的极小极大最优在线契约设计 |
Rui Ai |
2026-09-17 |
PDF |
我们研究当委托人观察结果但不观察产生这些结果的行动时的重复合同设计。委托人可以使用任意有界的结果依存支付向量,而代理人的最优反应可能使期望利润在这些支付上不连续。对于每个固定的结果数 $m\ge2$,$T$ 轮上的极小极大遗憾为 $T^{m/(m+1)}$ 阶,至多相差对数因子。上界允许任意行动空间和代理人异质性,无需光滑性或单调剩余假设。其关键是一种有效维度约简,即即使固定平局打破规则不具有平移不变性,基准也可以被规范化,此后显示偏好产生支付差坐标中的单调响应映射。基于该映射的 Lipschitz 参数化构建的学习策略仅使用观察到的结果类别即可达到该速率。下界构造考虑了激励损失如何跨结果维度累积。它表明,每个额外的可缔约结果都会在学习的最坏情况成本中造成精确且不可避免的增加。 |
| COMPASS:十万规模下的有序聚类路由 |
Ido Greenberg |
2026-09-17 |
PDF |
大规模路径规划通常需要按指定顺序访问节点簇,这引出了有序聚类旅行商问题(OCTSP)。独立优化每个簇看似自然,却忽略了非局部依赖关系。我们提出用于OCTSP的COMPASS算法,它通过协调并行子求解器,将搜索与学习加速的路径规划相结合。COMPASS没有质量上限,其解随计算量增加而持续改进。它利用聚类结构,能够在与簇规模而非实例规模成指数的时间内达到精确解。在实证中,COMPASS始终优于其他方法。与常见的大规模路径规划求解器不同,COMPASS可处理一般距离矩阵,不限于坐标输入。我们展示了其可扩展至10万个合成节点以及2.85万个真实电商节点。据我们所知,后者是已报道的基于非对称距离的最大路径规划解,比现有ATSP基准超出9倍。 |
| 关于路径与支持的定性推理模型 |
Abhishek Jaiswal |
2026-09-17 |
PDF |
空间推理能力与STEM领域的表现密切相关。游戏为培养具有天然游戏倾向的儿童提供了训练这些关键技能的理想媒介。然而,为了实现类人辅导和玩家引导,这些游戏需要一个能够从空间事件中进行常识推理的AI智能体。定性推理模型似乎是这些应用领域的合适框架。由于这些模型以符号表示进行推理,它们可以将游戏状态无缝转化为可解释的反馈,以实现类人玩家引导。本文介绍了一种为Camelot Jr.设计的混合定性模型,这是一款积木拼图游戏,要求建造多层桥梁以连接驻留在不同塔楼上的两个角色。该游戏对玩家构成挑战,玩家必须使平台保持稳定、规划路径,并确保使用所有提供的积木。为了处理该领域所需的精确物理计算,我们集成了一个数学质心稳定性逻辑来指导我们的定性求解器。我们的工作促进了Camelot Jr.中的空间技能训练,并为开发以人为中心、可解释的游戏智能体做出了贡献。 |
| EliGSiR:有界计算下的高斯泼溅连续RGB-D建图 |
Björn Ellensohn |
2026-09-17 |
PDF |
传统3D高斯泼溅假设观测集是封闭的且优化计划较长。相比之下,持续RGB-D建图带来的问题是新观测在线到达,而先前重建的区域必须被保留。我们提出EliGSiR(证据引导的自适应负载增量高斯泼溅与图像回放),一种持续高斯建图器,随着重建的演进控制可用优化预算的使用方式。地图引导视图调度过滤冗余的传入视图,并根据地图当前状态重新考虑保留的视图。负载自适应保真度根据当前建图负载调整监督分辨率,而非遵循固定的分辨率计划。定向几何增长将深度监督与高斯创建分离,仅在重复RGB-D观测表明存在缺失或错位结构的位置增加几何容量。这些机制共同调整哪些视图被优化、使用多少图像细节以及表示在何处增长,同时建图保持活跃。我们在Replica、TUM RGB-D、ScanNet++和真实RGB-D传感器序列上评估EliGSiR,同时考虑最终重建和整个采集过程中可用的地图。在TUM RGB-D fr3/long_office_household上,EliGSiR使用与受控基线相同的地面真值建图位姿达到21.52 dB,而SplaTAM为19.42 dB。在跟踪位姿比较中,使用实时ORB-SLAM3位姿的EliGSiR在155.5秒内达到23.02 dB,而CaRtGS使用其原生跟踪器在230.9秒内达到20.10 dB。我们进一步评估整个采集过程中的重建,并展示EliGSiR的自适应视图调度、监督保真度和几何增长如何改善可用建图预算的使用。 |
| STR-Agent:一种用于LEO卫星网络中QoS感知路由的LLM驱动代理 |
Bowen Lu |
2026-09-17 |
PDF |
LEO卫星网络具有动态拓扑、时变链路和多样化服务需求等特征,使得传统路由方案难以支持细粒度的服务质量(QoS)保障。现有研究主要在网络状态上以预定义目标优化路由,但很少解决将非结构化自然语言服务请求转化为自适应路由决策这一实际挑战。为弥补这一差距,我们提出STR-Agent,一种由LLM驱动的LEO卫星网络QoS感知路由框架。STR-Agent的核心创新在于将意图感知、基于工具的执行、经验积累和基于反思的策略自适应统一在单一智能体架构中。具体而言,感知模块将自然语言请求转换为结构化路由语义,而反思模块根据实时拥塞状况和历史路由结果动态调整服务到路由策略的映射,而非依赖固定的路由目标。此外,我们开发了一个专用感知模型,并构建了面向LEO服务理解的领域特定监督微调数据集。在Walker-Delta星座中的仿真结果表明,STR-Agent显著优于传统基线:与DQ-Dijkstra相比,端到端时延最多降低60%,监督微调后平均意图理解准确率从45.4%提升至92.45%,反思模块在600 Mbps下进一步将时延降低120 ms。这些结果证明了LLM驱动的智能体架构在未来LEO卫星网络中实现服务感知和自适应QoS路由的潜力。 |
| 量子储备计算中的耗散相变 |
Da Zhang |
2026-09-17 |
PDF |
量子储备池计算性能的提升与动力学相变相关联,但这种关联是否延伸至耗散系统以及哪些弛豫机制是其基础,仍未得到充分理解。我们系统地比较了驱动耗散克尔储备池在一阶和连续耗散相变中的表现,发现其在两个相边界附近均具有增强的记忆和非线性处理能力。尽管Liouvillian能隙的闭合在热力学极限下标志着相变,但计算性能通常并不随能隙抑制而变化。一种精确的训练后Liouvillian模式分解将训练后的记忆定量归因于内禀弛豫通道。结果表明,能隙模式贡献较弱,而有限速率模式及其交叉贡献主导了增强的能力。这些结果通过直接将记忆容量与内禀Liouvillian弛豫谱联系起来,超越了唯象关联。此外,这些发现为设计耗散量子储备池以及在实验可及的克尔平台上测试记忆增强机制提供了物理基础。 |