跳转至

arXiv 2026-08-05

标题 作者 发布日期 PDF链接 摘要
ParVL:面向多模态大语言模型的并行扩展与可扩展计算分配 Yang Yang 2026-08-04 PDF 现有的多模态大语言模型(MLLMs)扩展策略通常要么扩大模型参数,要么增加序列推理计算量,导致显著的内存或延迟开销。更重要的是,大多数现有方法无法改变视觉Transformer(ViT)和大语言模型(LLM)组件之间固定且刚性的计算分配,限制了任务特定优化。为解决这一问题,我们提出了面向MLLMs的并行视觉-语言(ParVL)扩展框架,该框架通过复用现有ViT和LLM骨干参数,在多个视觉和语言分支间扩展并行计算。此框架引出一个核心问题:在给定固定骨干参数预算下,额外的共享骨干计算应如何在视觉和语言模态之间分配?我们在共享骨干上为每个并行计算流实例化分支特定的前缀参数,并通过全参数监督微调在约130亿个token上端到端训练整个模型。我们系统研究了ViT编码器和LLM解码器之间的计算分配权衡。ParVL在整体多模态性能上优于同配方单分支基线,且最佳评估的视觉-语言分配因任务而异。代码可在https://github.com/YangYangGirl/ParVL获取。
SocietyBench:反事实社会世界演化的预测 Zhenran Wang 2026-08-04 PDF 大型语言模型(LLMs)及其上构建的智能体,如今在基准测试中主要考察其能否完成任务——如修复漏洞、驱动浏览器、操作图形界面。然而,一种互补的社会能力,即模型理解和预测真实社会事件发展方式的能力,却鲜有衡量。我们引入SocietyBench,一个端到端基准测试,它从一行事件主题出发,收集五个平台上的网络新闻和社交媒体帖子,将其提炼为按日期索引的时间线,将事实事件与公众舆论层分开,并将时间线上的每个截止日期转化为一组经审计的预测问题。问题在两个正交的百分制轴上评分:概率校准和时间准确性。在任何模型看到时间线之前,一个三阶段流程会替换所有命名实体,并按每个事件的常数平移所有日期,将真实事件弧转化为反事实的社会世界——结构上与已发生事件相同,但去除了模型可能匹配预训练记忆的表面标签。在五个异质事件和125个预测点(中英文版本)上,六个前沿LLM中最强者仅达到75.0分(满分100),而一个简单锚点得分为50。两个轴表现分化:模型可能在校准上强但时间上弱,或反之。基于共享基础模型构建的三个智能体框架未能超越该基础模型,而两种无模型启发式方法均落后于所有LLM。单个轴上的事件间差距可达21.4分,这成为我们主张在多个事件而非单一事件上评估的主要论据。所有匿名化时间线、问题库、真实答案及评分代码均已发布。
世界杯竞技场:对前沿大语言模型在实时锦标赛中的前瞻性、无泄漏评估 Zhenran Wang 2026-08-04 PDF 衡量大型语言模型预测能力的基准测试几乎总是回顾性的:事件已经发生,答案在互联网某处,评估必须防范记忆效应。我们报告了相反的设计。在2026年世界杯的39天赛程中,六个前沿大语言模型——均具备扩展思维和原生服务器端网络搜索——在每次开球前,逐场比赛被要求填写一份覆盖全部104场比赛的七市场预测卡,外加12个小组冠军和赛前总冠军池;提问时答案尚不存在,因此评估通过构造而非过滤实现无泄漏,冻结存档包含4,494个计分预测。该赛事揭示的是六个系统共有的行为模式。在比赛结果上,它们平均准确率为63.9%,与押注博彩公司热门持平——这实际上是它们通常的做法。它们彼此之间的共识远多于正确性,因此多数投票无增益。它们对平局和进球数投入不足,并将比分预测集中在单一典型结果上。准确性跟随赛事的失衡程度而非对其了解程度:在最接近的对抗中,档案资料最丰富,但准确性崩溃,而关于整个赛事的问题则回答良好。在此任务上,当前一代前沿系统差异不显著:排名在运行期间顶部和底部保持稳定,中间波动,且差距始终狭窄。简报档案、赛程和官方结果作为基准发布,附带计分代码。
TurnSight:面向工具集成推理的回合级事后自我蒸馏 Changle Qu 2026-08-04 PDF 工具集成推理(TIR)使大型语言模型能够通过迭代工具交互解决复杂任务。然而,现有的强化学习方法往往依赖轨迹级监督,限制了在长时程TIR场景中的细粒度信用分配。同策略自蒸馏通过具有特权上下文的教师分支提供更密集的信号,但现有方法通常从地面真值答案或检索技能中获取此类上下文,这可能无法反映智能体实际访问的状态。此外,令牌级监督无法捕捉工具交互的回合级结构。为解决这一问题,我们提出了TurnSight,一种回合级事后自蒸馏框架,直接从执行条件化的事后中获取监督。随后,它构建多个具有不同前瞻视野的事后视图,并通过跨视野方向一致性选择可靠监督。最后,所选的事后信号在兄弟回滚之间进行归一化,并用于自适应调节强化学习优势,同时保持其原始优化方向。在三个基准上的广泛实验证明了TurnSight的有效性。我们的代码可在https://github.com/quchangle1/TurnSight获取。
校准可信度:共同设计用于评估教育领域大语言模型的指标与可视化方案 Adam Coscia 2026-08-04 PDF 大语言模型正在重塑教育技术,然而对其回应进行教学法对齐评估的研究仍显不足,目前主要依赖构建该技术的学习工程师的专业知识。为弥合这一差距,我们探索将可信度作为结构化评估视角,利用现有的大语言模型可信度度量,系统性地识别潜在的教学干扰。通过与开发大语言模型驱动的数字教科书的学习工程师进行纵向协同设计过程,我们:(1)共同构建了五项可信度指标,包含20项针对教学用途定制的度量;(2)设计了将可信度违规映射到大语言模型回应上的可视化工具;(3)评估了这些工具如何帮助学习工程师对大语言模型回应进行A/B比较。明确可信度提高了评估者间信度,同时帮助学习工程师解决冲突目标并产生更一致的判断。我们讨论了可信度作为教育中大语言模型评估视角的新兴益处,并为未来评估工具提出了新设计指南,以支持教学对齐的大语言模型驱动学习工具。
语义捆绑:利用大型语言模型通过交互式节点与边捆绑简化知识图谱 Adam Coscia 2026-08-04 PDF 我们提出语义捆绑(Semantic Bundling),一种用于理解以知识图谱(KGs)表示的文本文档的可视分析技术。将文档语料库表示为知识图谱使实体间的关系明确化,这使得知识图谱既可直接分析,也可用于包括机器学习流水线和生成式AI后端在内的计算工作流中。然而,随着知识图谱的增长,它们变得难以针对特定任务进行解释和可视化(例如,“毛球问题”),每条关系的含义往往深埋在密集的源文本中。语义捆绑利用大型语言模型(LLMs)支持用户驱动的知识图谱中节点和边的捆绑,形成更高级别的图结构:超级节点,它折叠并总结图的某个区域,以及超级边,它总结两个实体之间的连接。结果与底层三元组和源文档相关联,将总结基于证据。我们在AgentK中实现了语义捆绑,这是一个开源系统,从文本文档构建知识图谱,并将图交互映射到捆绑操作。通过电影评论和情报分析场景的用例,我们展示了语义捆绑如何揭示文档集合中的新见解,并将我们的发现综合为对知识图谱理解中新兴挑战和机遇的讨论。
PAST-Bench:个人智能体中递归自我改进基础的基准测试 Shuhan Xue 2026-08-04 PDF 递归自我改进要求智能体将积累的经验转化为更好的未来行为。个人AI智能体为研究这一能力提供了具体场景,因为它们在会话间保留偏好、任务历史、工具例程和习得技能。然而,保留的经验是否真正随时间提升其表现尚未被系统测试。我们引入PAST-Bench,一个旨在隔离此问题的基准。每个智能体在匹配条件下运行有序的新会话任务序列,以开启或关闭经验保留。它涵盖26个场景和204个片段,涉及记忆、程序复用、信息收集和更新。我们报告后续任务的增益,以及这些增益是否遵循预期的保存、检索和更新路径。在七个基础模型和四个智能体框架中,改进是真实的但不均衡地分布在不同能力上。具有相同总体增益的智能体在增益是否由预期路径证据支持方面可能差异显著。基于这些发现,我们开发了Hermes+,它通过智能体循环各阶段的五项针对性干预扩展了Hermes。Hermes+提高了从保留经验中获得的平均增益,并提供更清晰的路径证据,其在需要替换过时状态的任务上改进最强,尽管效果仍依赖于能力和模型。总之,PAST-Bench和Hermes+为研究持久智能体如何从保留经验进展到系统改进提供了评估和诊断基础。代码:https://github.com/Gen-Verse/PAST-Bench
推理大语言模型中的测试时扩展:推理机制、评估与可复现性 Mohsen Hariri 2026-08-04 PDF 大型语言模型借助更多的推理时计算,能够解决难度显著更高的推理问题。然而,“测试时扩展”这一术语如今涵盖了多种推理算法,这些算法或沿单一轨迹延长思考过程,或采样完整候选结果并通过投票或验证进行聚合,或对未完成的中间状态进行搜索。这些算法在统计结构、计算核算和失败模式上各不相同。若将这些过程视为在单一标量“预算”下可互换,或仅报告准确率而不说明产生该结果的推理协议,则会使不同研究间的结果难以比较。我们沿三个维度对测试时扩展进行了系统性阐述。首先,我们将测试时扩展形式化为自回归模型隐式前缀树上的预算推理,并区分三种结构模式:单轨迹顺序扩展、叶级扩展(带终端归约)以及前缀级扩展。其次,我们将评估对象视为整个推理系统,并制定评估原则,将端到端系统性能与候选库诊断分开。我们引入一种评估概况,其坐标和简单泛函能够恢复或界定常见的重复采样指标,并规定计算与不确定性的协议匹配报告方式。第三,我们明确了推理协议的可复现性要求,区分精确重放与分布性可复现,并识别支持每种要求所需的工件。我们还按模型侧和接口机制组织了开放权重推理生态系统,将这些原则应用于广博知识、符号推理和竞赛数学基准测试,并汇编了超过20亿条完整推理轨迹以供发布,这些轨迹带有逐步丰富的验证器和词元级信号。
agogic:面向LLM原生文本到符号音乐生成的表演计时音乐令牌 Junhao Chen 2026-08-04 PDF 文本到音乐的语言模型通常从一个默认选择开始:如何对音乐进行分词。这一选择通常与主干网络、数据和训练方案纠缠在一起,其影响从未被单独衡量过。我们固定了预训练的Qwen3.5(0.8B-27B)、数据、预算和解码方式,仅替换七种分词方案中的表示,并将纹理指标锚定到每种表示的无模型上限。结果排序清晰且出人意料:表示而非模型大小,是分布保真度的决定性变量。将主干网络扩展34倍几乎不改变Frechet音乐距离(FMD),而切换表示则使其减半。PMT,一种我们发布的表现分辨率流(10毫秒时序、逐音符力度、多轨纹理;609个符号),在0.8B规模下达到FMD 159,而节拍网格(1.7-1.8倍更低,其他情况下高达2.8倍;非重叠自助置信区间)为272-286,因此一个0.8B的表现分辨率模型优于27B的节拍网格。这一优势在26M从零开始的主干网络和第二个表现分辨率分词器上重现:这是该类别的属性,而非某个幸运词汇表。它也不是更细网格的伪影:将PMT的起始时间对齐到节拍网格的分辨率后,其FMD仍领先两者67-129(n=500)。该效应是分布性的;是否可听是另一个问题,由我们的探针留待开放,并预注册了人类研究。原生字幕遵循度较弱但可分离:一个轻量级的解码时约束将乐器F1从.28提升到.60,正确调性从.16提升到.35,且无分布成本。我们发布了测试工具、25多个检查点、两个语料库(86.6k个跨字幕/MIDI/ABC/音频对齐;625万个带字幕,为音乐领域最大),以及一个印记诊断:已发布的文本到MIDI系统几乎不变地复现其训练分布,对字幕近乎不变(不同领域上和弦时间为72%对71%)。该领域的下一个表示声明现在可以被衡量,而非断言。
当注意力失明:ALiBi位置编码中的数值失效 Christopher Schröder 2026-08-04 PDF 我们识别出ALiBi位置编码中一个此前被忽视的失效模式:其线性偏置缩放会下溢浮点精度,导致大量注意力权重归零,使受影响的注意力头部分失明。我们分析了这一失效模式,刻画了其影响,并考察了四种缓解策略。我们进一步证明了该失效模式在基于ALiBi的最新预训练模型中的出现。通过使用1.48亿参数解码器模型的全面预训练实验,我们将其影响与上下文外退化区分开来。我们发现,ALiBi的失效模式能显著损害令牌检索,而对标准解码器基准的影响较小。我们提出了四种训练时缓解策略,并分别及组合评估了它们,发现对数缩放距离在针包检索中带来最一致的改进。尽管存在此问题,默认的ALiBi斜率仍是一个令人惊讶的强基线,特别是在大海捞针检索中。基于这些发现,我们为使用ALiBi训练模型提供了具体建议。