跳转至

arXiv 2026-08-24

标题 作者 发布日期 PDF链接 摘要
OmniAssistBench:面向全模态大语言模型的助手式交互基准 Xianyun Sun 2026-08-21 PDF 近期,全模态大语言模型(Omni-LLMs)展现出作为实时视频助手的巨大潜力,能够持续感知环境并引导用户实现特定目标。与传统被动式视频理解不同,交互式助手应主动结合视觉状态、用户目标及先验知识,以提供有效帮助。评估这一能力颇具挑战性,因为模型不可预测的响应会动态改变用户后续行为,而静态离线数据集无法适应这种变化。为突破这一瓶颈,我们引入了OmniAssistBench。针对同一用户目标可通过多种方式实现而导致交互路径分叉的问题,我们为模型提供源自源视频的预定义先验,要求其引导用户沿完全相同的路径行进。由于真实交互视频稀缺,我们通过对现有互联网视频进行逆向工程来构建数据集。我们推断逻辑性用户目标,并将视频分割为多轮片段以模拟连续交互。这一严谨流程耗时超过1000个专家工时以构建数据集。结果显示,专有模型Gemini-3-Pro达到满分100分中的66.4分,而开源模型Qwen3-Omni-Instruct获得51.2分。尽管当前模型普遍能理解用户输入,但常给出错误或不完整的回答。具体而言,它们在处理视觉提示(如手势)时存在困难,在多轮交互中难以维持历史上下文,且无法延迟响应直至目标事件发生。结果表明,在模型成为可靠助手之前,仍有大幅改进空间。
牛顿法的原始加速 Nikita Doikov 2026-08-21 PDF 我们提出了一种新的直接加速牛顿法,用于最小化具有Lipschitz连续Hessian的凸函数。该算法仅使用原始变量,并且每次迭代只需进行一次线性求解。通过简单预定的参数选择,它在函数残差方面实现了$O(1/k^3)$的全局收敛速率。据我们所知,这是针对此类问题首次达到该速率且仅依赖每次迭代一次线性系统求解的二阶方法(无需求解辅助非线性正则化子问题,如三次正则化,执行非线性参数搜索,或使用对偶外梯度校正)。我们的方法可以以无Hessian方式实现,使用不精确的线性系统求解器,同时保持快速全局速率。我们进一步将我们的构造扩展到通过Bregman散度的任意几何,以及复合优化问题。
VIALS:生命科学中人工制品视觉解读的基准 Elaine Lau 2026-08-21 PDF 在专业生命科学工作流程中,科学家们常规性地解读视觉产物(凝胶印迹、显微镜图像、质粒图谱、流式细胞术图、分子结构等),以指导研究决策。我们引入VIALS,一个视觉问答基准,包含161项此类解读任务,涵盖生物技术行业实验工作流程中检查的各种产物类型(而非出版物和教科书中的精美图表)。尽管前沿视觉语言模型现在能流畅描述自然图像,我们发现它们无法准确解读这些科学图像,反映出领域知识和特定领域视觉推理能力的局限。相比之下,具备相关领域专业知识的科学家认为这些视觉解读任务直截了当。无法类似地解读此类图像的人工智能,在专业生命科学工作流程中的实用性将受限,因为在这些流程中,此类产物是科学家推理、沟通和决策的核心。
从应用到芯片,权威级AI Jason Hickey 2026-08-21 PDF 六十年来,机器验证一直是主要的成本开销,仅对特殊工件而言才负担得起。在此我们报告,生成式AI逆转了这一关系:在AI速度下,机器验证不仅经济,而且对生产力至关重要——它是不可腐蚀的裁判,使一个人能安全地大规模指挥自主机器工作。在五周内,一位使用消费级AI订阅的研究者指挥一小队AI代理,从应用代码,经过验证的编译器和执行器,到在社区硅穿梭上流片的RISC-V处理器;没有证明经过人工审查,也没有RTL由人类编写。工作纪律——Salt方法——依赖于一个无法通过任何幻觉证明的证明内核:数学主张作为内核检查的工件在代理间传递,人类注意力保留给陈述、设计和裁决。验证逐环节陈述,从Lean 4内核到硅边界的SAT检查等价性。我们发布完整账目:定理来源、预注册的令牌计量器、下限约束的人工时间,以及错误分类账,其捕获编号运行至#256——一个在数学战役的仅追加标志账本上维护的单调计数器,时间从2026-07-07至2026-07-20(一个编号,#79,从未分配;后续捕获记录为无编号)——对照零个错误证明到达记录。
PerturbRx:学习治疗条件下的潜在转换以预测患者药物反应 Yoshitaka Inoue 2026-08-21 PDF 稀缺数据与肿瘤异质性限制了患者层面的癌症治疗反应预测。现有方法基于治疗前分子谱和药物表征预测反应,未显式建模治疗预期诱导的分子变化。我们提出PerturbRx,一种治疗条件化表示学习框架,学习干预诱导的潜在转移,并将其用作患者-药物反应特征。PerturbRx从上下文匹配但细胞未配对的对照和处理的单细胞群体中训练药物和剂量条件化转移预测器,然后冻结并将该预测器迁移至治疗前患者谱,无需治疗后测量。该转移与患者和药物表征结合以预测反应。在TCGA和患者来源异种移植基准上,PerturbRx在评估方法中实现了最强的综合预测性能。这些结果支持扰动预训练的潜在转移作为患者层面药物反应预测的有效表示。
顺序预测中的真实校准度量 Anagha Gokul 2026-08-21 PDF 校准要求概率报告在条件上无偏,并能可靠地解释为概率。校准度量将数值误差分配给未校准的报告。Haghtalab等人(2024)为在线预测提出了一种近似真实的校准度量,但未解决精确真实性与完备性和可靠性是否兼容的问题。我们针对序列二元预测给出了否定答案:即使对于独立结果,精确真实性也与完备性和可靠性不相容。随后,我们证明这种不可能性仅针对精确真实性。我们给出了两种从基础校准度量出发的一般性归约,分别产生加性和乘性近似真实的校准度量。应用乘性归约,对于每个$0 < \varepsilon < 1$,我们构造了一个完备且可靠的校准度量,该度量是$(1+\exp(-T^{(1-\varepsilon)/2}/2))$-乘性真实的。这改进了Haghtalab等人(2024)的近似真实性保证。
自优化流水线中的非对称容量分配 Zhuoyi Yang 2026-08-21 PDF 自我精炼,通常构建为生成、批判和修订三个阶段,是提升大语言模型生成质量的广泛采用范式,也是许多LLM智能体的核心机制。尽管这三个阶段涉及不同的认知需求,但大多数现有方法将模型大小视为实现细节而非研究对象,这可能导致资源浪费。很少有工作系统性地考察模型大小如何影响每个阶段,或有效的自我精炼是否要求生成、批判和修订阶段具备同等能力的模型。我们首次在5个不同领域的基准上,使用Qwen3的6种模型大小和Gemma 3的4种模型大小,对自我精炼流程进行了分阶段模型大小研究。我们得出结论:更大的生成器和修订器通常能提升流程性能,而尺寸不足的修订器甚至可能损害性能。其次,性能对批判器的大小极不敏感,尽管包含即使很小的批判器也始终优于完全省略批判环节。我们的发现表明,模型容量不应在自我精炼流程中均匀分配。相反,不同阶段展现出不同的规模缩放特性,为设计更计算高效的多阶段语言模型系统提供了实用指导。
TurboBias 2.0:面向生产高效ASR系统的流式上下文偏置 Vladimir Bataev 2026-08-21 PDF 上下文适配对于生产级自动语音识别(ASR)系统至关重要,在这些系统中,用户提供的短语必须在严格的延迟约束下被准确识别。尽管许多上下文偏置方法能提高识别准确性,但它们往往未能满足现代生产级ASR系统的实际需求:流式推理、高效的批量解码、用户特定的上下文列表以及低运行时开销。我们提出了TurboBias 2.0,一个面向生产的框架,用于在基于Transducer的ASR系统中实现高效的短语增强。该框架扩展了GPU加速的TurboBias,引入了不区分大小写的增强图以及每流批量解码,允许批次中的每个话语使用独立的上下文偏置配置。这使得多个同时用户能够实现个性化上下文偏置,而无需共享或混合他们的上下文列表。所提出的框架支持离线推理和流式推理,并可与贪婪解码和束搜索解码配合使用。实验表明,TurboBias 2.0在保持低延迟和高吞吐量的同时,提高了上下文短语的识别性能。
自然语言工作流尚非软件:面向可靠智能体执行的工件驱动编译 Xiangzhe Xu 2026-08-21 PDF 自然语言工作流为智能体提供了一种类似软件的接口:领域专家可以编写可复用的流程,智能体则能将其作为指令执行。然而,这一承诺尚不可靠。工作流描述往往隐含数据依赖关系,因此执行者必须推断某一步骤应使用哪些先前结果;智能体在上下文压力下也可能无法遵循长指令或分支指令。我们提出Artic,一种基于工件驱动的工作流编译器,它将自然语言工作流转化为工件驱动的工作流,其中每一步声明其读取和写入的工件,约束条件门控生成的工件,显式控制转移引导执行路径。这种表示暴露了智能体执行时承担的强制负担,使编译器能识别依赖过多状态或包含复杂控制逻辑的步骤,并通过约束优化对其进行细化。为验证LLM辅助转换,Artic将忠实性检查分解为局部义务,并使用基于场景的试运行来测试编译后的工作流区域是否与源工作流一致。我们在来自11个真实世界领域工作流的488个问题实例上评估Artic;它将任务解决率比原始文本工作流提高了28个百分点。我们还表明,Artic编译的工作流在跨模型和重复执行设置中分别提高了32和56个百分点的一致性。
跨设计不确定性在短期定价面板中的体现:来自模拟价格轨迹的证据 Pedro Cadahia Delgado 2026-08-21 PDF 短观测定价面板可能包含大量观测值,却仅提供少量不同的价格变动。本文在一个校准至稀疏定价机制的综合数据生成过程中研究这一区别的推断后果。我们将基于已实现价格轨迹的条件不确定性,与同一定价过程生成的不同轨迹间估计误差的变异分开。在基线模拟中,后者对梯度提升规格的估计误差方差贡献了97.6%。面板内重采样程序使用一条已实现轨迹的信息,无法识别这一跨设计成分。三个结果组织了分析。首先,跨设计离散度由经验关系sigma_hat约等于0.182 V^(-0.271)良好描述,其中V等于变动次数乘以幅度平方。其次,添加共享共同价格路径的区域减少了结果噪声,但不创建独立的价格轨迹;相反,对具有独立设计特定误差的单位进行平均,以标准平方根速率减少离散度。第三,在独立定价单位间估计的Paule-Mandel方差成分,在均匀模拟中显著提高了经验覆盖率,从0.469增至0.931。更广泛的含义是转向设计能创建独立识别变动的数据生成过程,而非仅依赖固定的被动面板。