跳转至

arXiv 2026-09-16

标题 作者 发布日期 PDF链接 摘要
面向现代GPU ISA压缩的自动化指令编码合成 Mingyuan Ma 2026-09-16 PDF 现代GPU内核日益加重指令供给路径的压力,而固定指令容器则会留下大量占用空间余量。本文提出了一种自动化编码合成框架,将指令布局视为在经校验的指令形式字段规范上的受约束槽位分配问题。该形式化方法将语义字段身份与物理比特位置分离,并支持绑定、固定和自由放置约束,使其适用于重复出现的解码字段未被公共格式契约冻结的情形。我们为NVIDIA SASS实例化了该框架:将原始公共编码文本规范化为机器可读规范,在378万条指令上对照nvdisasm验证了SASS反汇编器,将其作为开放基准发布,并使用CP-SAT合成进行定长和变长编码。在142个Blackwell内核输入上,变长合成将指令占用空间减少33%,在Ampere和Hopper上重新合成后也有相当程度的减少;在同一规范上的定长合成,相比由同一生成器和流程根据NVIDIA观测到的128位布局生成的解码器,将解码器面积减少16%。生成的取指/解码RTL在TSMC 22 nm工艺下达到1.5 GHz,复制面积增量为GA100级裸片的0.12%;同节点SRAM比较表明,占用空间减少所对应的指令SRAM位单元面积约为该新增逻辑的9倍。
重新审视基于符号的分布式方差缩减 Wei Jiang 2026-09-16 PDF 基于符号的方法降低了分布式环境中的通信成本,但当数据异构时,聚合局部符号会引入偏差。因此,现有的基于符号的方差缩减方法无法获得最优收敛速率。本文解决了这一问题,并获得了非凸随机优化和有限和优化的最优速率。我们首先给出一个反例,表明即使具有精确的局部梯度,多数投票也可能无法逼近稳定点。受此局限性的启发,我们提出通过递归梯度增量的无偏压缩在服务器端跟踪全局梯度。结果,我们对于 $\ell_1$-范数可以得到 $O(\sqrt{d/K}+\sqrt d (a/(nK))^{1/3})$ 的收敛速率,对于 $\ell_2$-范数可以得到 $O(\sqrt{a/K}+\sqrt a/(nK)^{1/3})$ 的收敛速率。这里,$K$ 是迭代次数,$n$ 是工作节点数量,$d$ 是维度,$a=1+ω$,其中 $ω$ 表示压缩器的相对方差。对于具有 $M$ 个分量的有限和问题,我们将周期性精确梯度刷新与压缩的分量梯度差相结合。由此得到的总样本复杂度在梯度范数至多为 $ε$ 时,对于 $\ell_1$ 和 $\ell_2$ 分别为 $O(M+d\sqrt{aM}ε^{-2})$ 和 $O(M+a\sqrt M\ epsilon^{-2})$,与集中式设置中的相应界相匹配。
学习为机器学习编程自适应非局部可观测量 Yu-Ting Lee 2026-09-16 PDF 量子神经网络(QNNs)通常由变分量子电路(VQCs)构建,而变分量子电路受限于局部测量。自适应非局部可观测量(ANO)通过联合优化电路参数和多量子比特测量来解决这一问题。然而,现有的基于 ANO 的 VQC 仅学习一个在所有输入上保持不变的单一静态可观测量。我们提出 QFWP-ANO,一种新颖架构,它采用经典超网络来根据每个输入动态编程 VQC 参数和/或非局部可观测量。在四个 ETT 数据集上的多变量时间序列预测中,QFWP-ANO 在 20 个设置中的 16 个取得了最低的 MSE,在其余四个中取得第二低,超越了基于 ANO 的方法和其他强基线。在强化学习任务中,QFWP-ANO 持续超越 ANO-VQCs。我们的结果确立了输入条件化的 ANO 作为增强 QNNs 的有效方法。
DyMT-ESB:用户与大语言模型交互中社会偏见的动态多轮评估 Rem Hida 2026-09-16 PDF 警告:本文包含刻板印象和社会偏见的示例。大语言模型正日益被公众用于交互式场景,这使得评估模型在多轮对话场景中的行为对安全性而言十分重要,包括与刻板印象相关的危害。然而,现有的多轮社会偏见评估往往依赖预先指定或基于模板的用户输入,这些输入不会根据模型响应进行调整,并且通常预先假定固定的对话长度。在本文中,我们通过一种受控评估协议研究响应条件下的多轮交互中的社会偏见动态,该协议根据不断演变的对话历史生成后续用户查询,并允许在可变轮数上进行评估。实验结果表明,大语言模型即使在连贯的、响应条件下的多轮交互中也会表现出社会偏见,揭示了晚期出现的偏见、非单调的偏见模式以及偏见的重新出现。这些结果推动评估超越固定轮次、预先脚本化的协议。我们的发现凸显了将社会偏见作为轮级动态现象进行分析的重要性。
谬误基准测试衡量的是论证图式识别,而非谬误检测 Navyansh Singh 2026-09-16 PDF 谬误检测基准将谬误类别与一个单一的“有效”或“无”类别配对,该类别将所有数据收集过程中未被标注为谬误的内容都纳入其中。这种构建方式具有误导性:分类器可以学到在该类别上表现良好的线索,却并未学会区分谬误与正确论证。我们表明,基准所报告的低假阳性率是类别构建方式的产物,而非检测能力的证据。对谬误而言,最具信息量的负例是使用同一论证图式的正确论证,而在我们考察的四个基准中,此类论证至多占有效类别的百分之几。在构建的图式匹配负例上评估时,假阳性率在CoCoLoFa上从16.6%升至58.9%,在Reddit上从5.7%升至62.0%。该比率取决于负例的撰写方式,因此我们还比较了同一流程中仅图式身份不同的两种条件。分类器将图式匹配负例标为源谬误类型的频率比错误图式负例高出40.9个百分点,而后者被识别为其实际使用的图式的比例为85.9%,被识别为源类型的比例仅为0.4%。分类器学到的是论证使用何种图式,而非其使用是否正确,而在基准自身的测试集上,二者无法区分。同样的分离现象出现在三个从未见过这些基准的零样本LLM检测器中,而在一个刻意构建的负例类别上,该测量值要低得多。我们将这些项目作为Scheme Foils发布。在有效类别经过图式匹配覆盖度审计之前,所报告的假阳性率不应被信任为检测能力的度量。
拓展边界:渐进式LLM演化的统一自教框架 Yajie Yu 2026-09-16 PDF 大型语言模型(LLMs)在自我改进训练中常常遭遇能力停滞,因为固定难度级别无法适应其不断演进的熟练程度。为解决这一问题,我们提出STRETCH(通过定向挑战的自我教学推理演化),一个受认知脚手架理论启发的统一框架。STRETCH引入动态拉伸区机制,持续将问题难度与模型的求解能力对齐。在单一参数空间内,模型在生成自适应、边界推进挑战的脚手架器与通过强化学习优化其求解轨迹的学习器之间交替。这种双循环协同演化有效稳定了训练,缓解了奖励黑客并促进了渐进式推理增长。在谈判和运筹学研究基准上的实验表明,STRETCH始终优于强提示和领域特定基线。进一步的脚手架器配置分析表明,动态难度对齐对于持续能力提升和同步推理演化至关重要。
CoRe-MARL:未知动态下使用循环多智能体强化学习的合作再分配 Naimur Rahman Chowdhury 2026-09-16 PDF 应急管理援助项目,例如救援物资分发,对于向受灾社区提供必要物资至关重要。然而,这些项目运行在一个由地方中心组成的去中心化网络中,这些中心面临不确定的本地需求和供应动态,导致本地服务的可用性不一致。在这些地方中心之间重新分配物资可以缓解这些失衡,但各中心往往独立决策,信息有限且运输中断。本研究开发了CoRe-MARL,一个协作式多智能体强化学习(MARL)框架,通过构建去中心化部分可观测马尔可夫决策过程(Dec-POMDP)来实现。我们将每个中心视为一个智能体,学习重新分配策略,以改善最坏情况区域的服务,缩小区域间的服务差距,同时保护全网服务。我们引入了一个循环网络,在没有直接观测的情况下捕捉不断演变的供需动态,而多智能体近端策略优化(MAPPO)实现了集中训练与去中心化执行(CTDE)。我们在一个具有多样化轨迹的模拟环境中评估该框架,其中精确动态未被执行者和MAPPO评论家观测到。我们将循环MAPPO与循环独立PPO(IPPO)以及仅本地启发式方法进行比较,发现MAPPO缩小了地方中心之间的服务差距,并提升了服务最差中心的服务水平,同时保持了具有竞争力的全网服务。循环MAPPO在不同轨迹模式上也表现出一致的性能,展示了其适应不断演变动态的能力。研究结果证明了协作学习在去中心化重新分配以及在不确
GenStream:面向以人为中心的媒体生成式重建的语义流式框架 Emanuele Artioli 2026-09-16 PDF 视频流媒体主导了全球互联网流量,然而传统流水线对于结构化、以人为中心的内容(如体育、表演或交互媒体)仍然效率低下。标准编解码器对整个帧进行重新编码,无论前景还是背景,对所有像素一视同仁,忽略了场景的语义结构。这导致了显著的带宽浪费,尤其是在背景静态、运动仅限于少数显著主体的场景中。我们提出GenStream,一种语义流媒体框架,用紧凑的结构化元数据替代密集的视频帧。GenStream不传输像素,而是将每个场景编码为骨骼关键点、相机视角参数和静态3D背景模型的组合。这些元素被传输到客户端,由生成模型重建逼真的人体形象,并从原始视角将其合成到3D场景中。这一范式实现了极致压缩,在连续数据流上相比HEVC实现了超过99.9%的带宽缩减。我们在奥运会花样滑冰影像上对GenStream进行了部分验证,并展示了在极少数据下实现高感知保真度的潜力。尽管承认大量计算成本转移到了客户端以及泛化方面存在挑战,GenStream仍开辟了体积化虚拟形象合成、跨视角规范3D演员融合以及个性化观看体验等新方向,为后编解码器时代的可扩展智能流媒体奠定了基础。
VibeAvatar:对齐语音运动学与人类美学的高保真说话头像合成 Qilin Wang 2026-09-16 PDF 多模态说话头像合成旨在从参考肖像和语音生成逼真的说话视频。尽管基于扩散的方法取得了快速进展,现有方法仍难以同时实现准确的唇部发音、符合人类偏好的运动美学以及高效推理。我们观察到,语音准确性和运动美学源于根本不同的来源,应在互补阶段加以处理,而非由单一生成器隐式学习。基于这一洞见,我们提出VibeAvatar,通过语音运动学适配器(PKA)在条件阶段将面向识别的语音特征转换为语音运动学条件,并通过美学运动策略(AMP)在后训练阶段利用组相对策略优化(GRPO)优化流一致的随机采样策略,从而解耦这两个目标。借助在紧凑的一维基于扭曲的潜在运动空间中运行的轻量级基于流的运动生成器,VibeAvatar在客观指标和用户研究中均在发音、美学和效率方面取得最先进的结果,同时仅需约3GB显存即可在10秒内生成10秒512像素的视频。
FIVE-VLA:基于循环动作记忆的快速高效自动驾驶 Kemal Oksuz 2026-09-16 PDF 用于自动驾驶的最先进视觉-语言-动作模型(VLA)面临关键局限:参数量过大、高分辨率图像处理效率低下,以及缺乏时间记忆。我们提出Fast and EffectIVE VLA(FIVE-VLA),通过两项关键贡献来解决这些问题。第一,我们采用高效视觉编码器,在处理高分辨率($448 \times 896$)图像时仅生成98个token,比现有方法少$5\times$以上,并完全绕过文本生成以进行单次轨迹预测。第二,我们提出循环动作记忆(RAM),这是一个轻量级模块,根据先前的动作token来条件化动作预测,为超车和紧急制动等机动提供关键的时间上下文。FIVE-VLA仅有641M参数,在具有挑战性的Bench2Drive闭环驾驶基准上,相比此前最先进的VLA,在无交通规则违规的情况下多完成约10%的路线。在大规模真实世界NVIDIA Physical AI AV数据集上的非反应式开环仿真显示,在单视图和四视图设置下,碰撞违规率分别比SimLingo低10.2%和7.7%。此外,FIVE-VLA在A100上以约30 fps运行,在T4 GPU(作为边缘设备的代理)上以约4 fps运行,相比此前方法实现了8-30$\times$的加速。