跳转至

arXiv 2026-08-18

标题 作者 发布日期 PDF链接 摘要
不要丢掉“接力棒”:通过智能子任务探索与转换感知记忆实现长时程机器人操作 Bingxin Xu 2026-08-17 PDF 长程机器人操控将多个接触丰富的技能串联成一个多阶段任务。视觉-语言-动作(VLA)模型日益擅长掌握单个技能,但链条仍然失败:错误累积超出策略的纠正能力,且一个子任务默默限制下一个子任务。一种有前景的方案冻结VLA,并让LLM代理负责:它以语言规划,用解析原语在自由空间中移动,仅在接触丰富段调用VLA,并将适应写入语言记忆。应用于长程任务时,它两次失效。(1)能力来自测试时的全任务探索,其成本在阶段上呈乘法增长:若一个阶段需T次试验,K阶段任务约需T^K次,且失败不揭示由哪个阶段引起。(2)它没有转换表示:VLA原语携带退出条件但无进入条件,因此子任务可能以继任者无法使用的形式成功。我们提出BATON。针对(1),BATON将子任务作为探索单元:每个子任务在廉价的短程场景中探索,其解决方案存入记忆;长程轨迹随后由这些解决方案组合而成,而非整体发现。成本变为加法(T*K),且每次失败归因于单一阶段。针对(2),BATON为探索配备转换感知记忆。子任务内,验证代理管理调用转换:仅在腕部视图确认场景就绪后调用VLA。子任务间,交接转换恢复被前驱残留干扰的进入状态,前瞻转换选择继任者可继承结果的策略。不更新参数。在长程基准RoboMemArena上,BATON将任务成功率提升11.6%,累计成功率提升14.9%,优于SoTA。
基于Q的变分逆强化学习 Ondrej Bajgar 2026-08-17 PDF 开发安全且有益的AI,要求系统能够依据人类偏好进行学习和行动。然而,手工明确指定这些偏好往往不可行。逆向强化学习(IRL)通过从专家行为中推断偏好(以奖励函数表示)来解决这一挑战。我们引入了基于Q的变分逆向强化学习(QVIRL),这是一种新颖的贝叶斯IRL方法,主要通过学习最优Q值上的变分分布,从专家示范中恢复奖励的后验分布。与以往方法不同,QVIRL结合了可扩展性与不确定性量化,这对于安全关键应用以及主动学习至关重要。我们在多种任务中展示了QVIRL在学徒学习中的强大性能,包括网格世界、月球着陆器、高速公路环境以及两款ATARI游戏,既使用静态专家数据也采用主动学习。这是首个从原始像素观测中训练贝叶斯IRL的方法。
像素空间文生图扩散模型训练的实证研究 Dengyang Jiang 2026-08-17 PDF 本文探讨了生成建模中一个日益重要的课题:像素空间扩散模型。尽管已有大量研究涉足此领域,但多数聚焦于小规模或类别条件设定。因此,一种能够匹敌或超越成熟潜空间模型的像素空间训练实用方案仍难以实现。通过全面的实证研究,我们首先观察到,直接在像素空间进行大规模预训练比在潜空间收敛速度显著更慢。这一发现促使我们提出一种从潜空间到像素空间的策略,该策略在潜空间高效获取生成先验,并在后训练阶段过渡至像素空间。随后,我们系统研究了控制这一过渡的关键设计选择,包括权重初始化、数据组成、预测目标、解码器架构及噪声调度,并确定了一种实用方案,使所得像素空间模型能够匹敌或超越其潜空间对应模型,同时实现3.18至4.75倍的端到端推理加速。我们希望这些发现能为未来像素空间生成研究提供有价值的实证见解和实用指导。
超越屏幕的评估:资源受限创业者对AI生成商业计划的集体评估 Qi Zhao 2026-08-17 PDF 创业者越来越多地使用ChatGPT等终端生成式AI技术来处理高风险的文档,如贷款申请和商业计划书,其中AI生成的错误——错误的价格、虚构的产品——可能影响贷款或融资结果。当前支持AI生成文本评估的方法假设单一用户独自在屏幕上评估输出。这对资源受限的创业者来说尤其具有挑战性,因为他们的数字和AI技能差异很大。在这项早期阶段的工作中,我们探索如何将评估改为在小组环境中组织并作为集体活动完成。我们扩展了BizChat,一个AI驱动的商业规划工具,增加了一个评估模块,将每个生成的声明与创业者的原始输入相连接。我们与马里兰州的社区组织合作,将BizChat嵌入各种创业项目中,其中工作坊参与者(N=14)通过思考-配对-分享讨论评估他们的计划。初步发现表明,像声明到输入链接这样的界面脚手架为参与者提供了具体、个人化的评估基础,而小组环境则将其扩展到屏幕之外:参与者要求打印副本,使用评分标准跨计划比较,并利用同伴的知识来验证他们难以独自判断的内容。
$τ_0$-VLA:一种具有世界模型引导测试时计算的层级机器人基础模型 Xiaowei Cai 2026-08-17 PDF 长程机器人操作要求机器人既能可靠地执行单个技能,又能在扩展任务中连贯地编排这些技能。大多数分层视觉-语言-动作(VLA)模型通过单次前向传播做出每个此类决策,缺乏为困难或关键选择分配额外计算的机制。我们引入τ₀-VLA,一种分层机器人基础模型,将高层子任务生成表述为通过世界模型引导的测试时计算实现的可扩展计算推理问题。在每个推理步骤中,高层策略使用执行记忆生成一个子任务,并在必要时在提交输出前搜索替代方案。低层策略随后在多种机器人实体上执行生成的子任务。该策略在40,115小时的异构真实世界数据上训练,并采用多模态协同训练。在领域内和分布偏移设置中,分配额外的测试时计算显著提高了下一子任务预测准确性,这些增益转化为长程机器人操作任务中更高的闭环成功率。
利用现代优化与AlphaEvolve改进矩阵乘法指数 Emilien Dupont 2026-08-17 PDF 当前关于矩阵乘法指数$ω$的最佳界限是通过激光方法的改进版本——组合损失分析获得的(Duan等人,2022;Williams等人,2024;Alman等人,2025)。在本笔记中,我们处理了这一方法核心的优化问题,并提出了若干改进。首先,我们重新表述了优化问题,使其能够在比以往更广泛的设置中求解。其次,我们利用机器学习的最新进展,为此问题设计了一种新的优化算法。最后,我们通过AlphaEvolve对所得优化算法进行了细化。我们的综合方法得出了$ω$ < 2.371177的上界,改进了此前的最佳界限2.371339。
Hit-and-Run与坐标Hit-and-Run的谱间隙 Yunbum Kook 2026-08-17 PDF 对于任意包含单位球的凸体 $\mathcal{K}\subset\mathbb{R}^{n}$,Hit-and-Run 的谱间隙为 $Ω(1/(n^2 C_{\mathsf{PI}}))$,其中 $C_{\mathsf{PI}}$ 是 $\mathcal{K}$ 上均匀分布 $π$ 的庞加莱常数。这意味着 Hit-and-Run 从任意起始分布 $π_0$(其中 $M=χ^2(π_{0}\,\
AutoSR:通过搜索研究状态实现自动符号回归 Kejia Zhang 2026-08-17 PDF 我们引入自动符号回归(AutoSR),一个全自动系统,通过搜索持续的科学调查而非孤立的方程来实例化研究空间符号回归。有限且含噪的数据往往产生数值上竞争性的表达式,这些表达式在观测范围之外暗示非常不同的行为,使得数值拟合和句法复杂度不足以衡量科学可信度。现有方法主要集中于改进表达式,但搜索通常仅保留结果公式和分数,丢失了科学记录,如动机和探针,这些信息指导下一步尝试什么。AutoSR在\textbf{研究状态}中保留此记录,将每个候选方程与其分支上发展的推理、计算证据和独立审查相结合。提议者-审查者代理在渐进加宽蒙特卡洛树搜索(PW-MCTS)下发展这些状态,该搜索在竞争调查间分配计算,而累积的研究记录最终综合成最终报告,解释主导关系及其选择依据。在两个基准套件的九个选定挑战中,AutoSR在每个案例中恢复代数等价关系,包括三个没有已发表系统恢复的cp3-bench问题和六个结构多样的LSR-Transform问题。总体而言,AutoSR将符号回归从方程级搜索扩展到自动化科学调查,使科学知识和累积证据塑造探索内容及结果方程的论证方式。
矩形侧支亥姆霍兹谐振器降噪频率数据高效预测的分析先验框架 Jiaming Li 2026-08-17 PDF 高保真有限元模拟能够为侧支谐振器提供准确的数值预测,但生成大型模拟数据集成本高昂,且当模拟标注数据稀缺时,纯数据驱动的替代模型可能变得不可靠。本研究开发了一种解析先验学习框架,重用低成本解析模型,在有限的高保真模拟预算下提高数据效率。考虑了两条互补路径。当推理时解析模型仍可用时,将其保留为显式基线,模拟数据仅用于学习解析与模拟之间的差异。当需要自包含预测器时,首先从大量低成本评估中将解析映射蒸馏为学习先验,然后用有限的模拟数据进行校准。该框架在矩形侧支亥姆霍兹谐振器上进行了评估,使用了86个模拟标注几何体和8,998个非重叠的仅解析几何体。解析模型实现了平均绝对误差(MAE)为1.333赫兹。直接支持向量回归(SVR)达到3.375赫兹,而残差SVR将MAE降至0.426赫兹。直接多层感知器(MLP)达到1.109赫兹,而解析先验预训练将误差降至0.556赫兹(冻结先验残差适应)和0.371赫兹(全模型微调)。在20至70个模拟标注案例的训练预算范围内,解析校正和解析先验预训练均相对于直接学习持续提高了数据效率。这些结果表明,当模拟数据稀缺时,解析先验信息能显著提高高保真预测性能,显式校正和先验蒸馏满足互补的部署需求。
基于深度学习的微流控装置中循环肿瘤细胞表型的数据高效且可解释的分类 Serena Su 2026-08-17 PDF 循环肿瘤细胞(CTC)表型的准确分类可为评估转移潜力提供有价值的信息。无标记微流控装置提供了一种流体动力学障碍路径,能将CTC的微妙生物物理特征(包括大小和可变形性)转化为独特的运动学轨迹。然而,控制这些轨迹的高度非线性流固耦合作用使得从轨迹数据推断细胞表型的逆问题在解析上难以处理。尽管深度神经网络(DNNs)已成为解决这一逆问题的强大方法,但其有效性受到轨迹数据有限性和缺乏物理可解释性的制约。为应对这些挑战,我们提出了一种可解释且数据高效的DNN框架,用于基于轨迹的CTC分类。为缓解数据稀缺问题,我们开发了子序列(SubSeq)策略,这是一种有针对性的增强方法,在训练过程中随机提取信息丰富的局部轨迹片段,以促进对局部模式的学习。我们进一步应用梯度加权类激活映射来识别驱动模型预测的轨迹特征和微流控装置的物理区域。实验结果表明,SubSeq在评估的基线和增强方法中提高了分类准确性。此外,可解释性分析表明,局部轨迹片段包含与准确分类相关的大量生物物理信息。这为SubSeq提供了合理性依据,并突显了全长轨迹的冗余性。更广泛地,所提出的框架将微流控几何结构视为细胞力学特性的物理编码器,提供了可能为未来诊断装置设计提供参考的机制性见解。