跳转至

arXiv 2026-08-13

标题 作者 发布日期 PDF链接 摘要
StateFlow:为预可视化构建、演化与访问三维世界状态 Yuyang Yin 2026-08-12 PDF 预可视化是电影、游戏、建筑和城市设计中连接创意与制作之间的中间层。它使创作者能够迭代地细化场景、动作、摄像机以及时空动态。然而,现有的生成方法依赖于简单提示,通过一次性图像或视频合成来联合控制所有这些因素,提供了较弱的可控性,并对迭代编辑支持有限。从根本上讲,一个世界包含多个具有几何、外观及其他属性的元素,以及摄像机。不同帧是通过对共享状态的局部修改或重组产生的,而该状态在其他情况下大多被复用。因此,我们认为缺失的组件是一个明确且持久的工作状态。为解决此问题,我们提出了StateFlow,一种面向生成式预可视化的状态中心框架。StateFlow并非一次性生成视频,而是利用可编辑的3D世界来组织场景结构、演变和摄像机,同时,在需要更高保真度时,现成的视频模型可增强视觉质量。这个世界被维护为场景元素和摄像机配置的持久结构化3D状态,作为预可视化的核心工作表示。基于此洞察,StateFlow包含三个阶段来构建、演变和访问世界状态。状态构建通过先验引导、冲突感知的双视图初始化,将生成的2D内容提升为连贯的3D世界;状态演变则将用户意图转化为结构化的状态转换,同时保留世界记忆,避免每次编辑时全场景重新生成。状态访问利用渲染反馈反射来细化摄像机计划,使其成为视觉上可行的轨迹,避免仅依赖VLM语义。实验表明,StateFlow为视频创作和游戏式原型制作生成了高质量的3D世界。
AVA-Encoder:迈向智能体原生视频表示学习 Chuyue Li 2026-08-12 PDF 创意代理仍然缺乏从高质量人类电影中学习的有效途径,这限制了它们生成电影级视频的能力。一个关键挑战是缺少一种结构化的视频表示,这种表示既要忠实于电影内容,又要能直接用于代理推理和操作。为解决这一难题,我们提出了代理视频自动编码器(AVA-Encoder),一种通过代理自编码学习代理原生视频表示的框架。AVA-Encoder将视频转换为知识图谱(KG)表示,然后将其重建回视频。其层级和状态节点存储结构化文本,而关联的资产层则保存生成的图像、音频和视频。类型化边以代理易于理解、查询和编辑的形式保留了这些文本描述与资产之间的关系。视频重建差异驱动了一个文本梯度优化框架,该框架将评估反馈表达为自然语言更新方向,用于外循环中的数据无关编码策略伪训练,以及测试时内循环中可选的数据相关KG表示细化。大量实验表明,AVA-Encoder比最强外部基线提高了20.7个百分点。在受控的仅策略设置中,其伪训练的镜头级代理视频编码器策略也优于精心人工调优的策略,同时使用的系统提示令牌减少了74.3%。我们发布了完整的AVA-Encoder框架、一个可靠的代理视频重建基准,以及首个高质量电影KG表示数据集。
角色专业化模型(RSM):协调基于LLM的工具在智能体软件开发中的应用——一项探索性案例研究 Carlos Alberto Fernández-y-Fernández 2026-08-12 PDF 将大型语言模型(LLMs)集成到软件开发工作流程中,催生了一种被称为智能体软件工程(SE 3.0)的范式,其中自主智能体在人类监督下管理完整的开发生命周期。本文提出了一项探索性案例研究,其中三种基于LLM的工具——Antigravity(一个具有Gemini 2.5后端的智能体IDE)、Gemini CLI和Qwen Code(通过Ollama本地执行)——根据本文提出的角色专业化模型(RSM)这一角色分配框架进行协调。三项研究问题指导了本研究:(RQ1)如何通过RSM在真实开发工作流程中协调具有不同能力的基于LLM的工具;(RQ2)在RSM执行过程中,计划角色分配会出现哪些偏差,以及哪些因素解释了这些偏差;(RQ3)最终产品如何与ISO/IEC 25010质量模型进行比较。目标是提出RSM,并逐步开发一个用于交互式气候数据可视化的Python桌面应用程序。本文记录了工作流程、观察到的偏差、提示加固技术以及定性质量评估。结果表明,显式角色协调可以支持开发周期组织和架构质量,但需要深思熟虑的协调策略、上下文管理以及对智能体生成输出的人工验证。
DreamFly:面向空中视觉-语言导航的因果记忆与滚动时域扩散规划 Yan Deng 2026-08-12 PDF 航空视觉语言导航(VLN)要求具身智能体在部分可观测条件下,随时间整合视觉证据、规划未来动作,并判断是否已到达导航目标。尽管近期VLA模型提供了有前景的感知到动作范式,但将其适应于航空导航仍面临挑战,原因在于历史上下文有限、规划视野短以及隐式终止不可靠。为解决这些问题,我们提出DreamFly,一种基于Dream-VLA的扩散式航空VLN框架。DreamFly引入因果对齐的历史记忆,仅利用当前决策步骤之前的观测来增强当前视觉表示,从而在不泄露未来信息的情况下实现时间推理。我们进一步将导航表述为滚动时域扩散规划,其中策略预测一个$K$步动作块,但仅执行第一个动作后重新规划。这种“规划K步,执行一步”策略将未来动作作为辅助规划目标,同时保持闭环视觉反馈。最后,LiteStop直接从初始全掩码状态下的动作logits估计停止概率,将显式终止与动作生成解耦。在OpenFly基准上的实验表明,在可见和不可见环境中均取得一致改进。DreamFly在测试可见/测试不可见分割上分别达到32.04%/29.46%的SR和28.22%/23.54%的SPL,在两个指标上均优于所有对比方法,同时实现最低导航误差。这些结果证明了联合建模历史上下文、未来动作结构和显式终止对航空VLN的有效性。
测试时AI4AI:通过约束实现强到弱的能力迁移 Cheng Qian 2026-08-12 PDF 近期关于蒸馏的研究通常通过教师强制、在线策略蒸馏及相关训练时方法,更新较小模型的参数,从而将大型模型的能力转移至较小模型。本文探讨这种转移是否能在测试时实现。我们研究强到弱脚手架:更强的构建模型能否构建推理时辅助框架,帮助较弱的靶模型更可靠地解决问题,而无需任何参数更新。使用四个具有代表性的心智理论基准,每个构建模型利用5%的数据作为验证集,在多轮迭代中优化其辅助框架,最终确定的框架在完整测试集上评估。实验表明,这种测试时能力转移极为有效,平均靶模型性能从0.49提升至0.91,近乎翻倍。分析显示,性能提升主要源于将不稳定的模型推理卸载至确定性代码、基准特定路由及严格答案格式执行,而非鼓励靶模型更广泛推理或采样。我们进一步发现,构建模型的推理努力单调提升辅助框架质量,平台效应相对于构建模型自身能力较小,且较弱的靶模型获得最大增益。这些结果表明,推理时辅助框架设计是传统训练时蒸馏的重要补充,使强模型无需重训练即可将认知结构转移至弱模型。
基于再分配的成本推断提升稀疏安全离线强化学习 Ebenezer Gelo 2026-08-12 PDF 安全离线强化学习通常假设能够获取密集的每步成本标注,但在实际应用中,监督者仅提供轨迹级别的停止反馈:即在第一个不安全转换处的二元信号,且没有每步归因。我们将此问题定义为时间信用分配问题,并提出基于再分配的成本推断(RCI)框架,该框架通过回报分解将稀疏停止反馈转换为密集的每步成本,然后在增强数据集上训练约束离线策略。我们证明,回报等价的再分配在CMDP中保留了可行策略集和最优拉格朗日乘子,从而在理论上确立该转换是无损的,同时在实际中改善了成本评论家学习的条件。在高速公路驾驶和机器人操作上的实验表明,与稀疏和基于分类器的基线相比,违规率显著降低,并且对异构数据集组成和标签噪声具有鲁棒性。
使用检索增强的大型语言模型构建动态主逻辑模型作为知识图谱,用于复杂系统诊断 Saman Marandi 2026-08-12 PDF 动态主逻辑(DML)提供了一种分层框架,通过将功能目标与底层结构元素相连接来表示系统行为。然而,DML的构建通常依赖于专家对技术文档的解读,这限制了其在复杂系统中的可扩展性。本研究提出了一种框架,用于从系统描述中自动构建DML模型,并将其表示为知识图谱(KG-DML),利用检索增强生成和大语言模型作为支持工具。基于先前在小规模系统中的工作,该框架将自动KG-DML构建和评估扩展到更大且更复杂的系统。模型构建通过针对性检索在DML层级中进行,同时保留功能依赖关系和显式逻辑关系。生成的KG-DML支持诊断推理、安全评估、向上故障传播和向下依赖追踪。一种多级验证方法评估了层特定精确度和召回率、逻辑门一致性以及整体结构完整性。应用于一座退役沸水反应堆的低压冷却剂注入系统,展示了在重复运行中的一致重建。结果表明,自动KG-DML构建可以将技术文档转化为可执行的功能模型,用于诊断和可靠性分析。
奖励函数设计框架:从目标到特征再到人类对齐的奖励函数 Di Yang Shi 2026-08-12 PDF 我们提出了一种正式流程,使非专家能够实例化和迭代符合人类对齐的奖励函数,即遵循给定轨迹偏好排序的奖励函数。给定一个用自然语言描述的任务,我们的流程通过三个步骤生成一个线性奖励函数:将任务的目标提炼为一组基本目标,并推导出捕捉这些基本目标的可测量结果变量;选择一组因果代表性的结果变量作为奖励项;通过偏好引导拟合这些奖励项的权重。我们的贡献描述了第一步,并形式化了后两步。第一步是用于推导结果变量的引导式工作流。第二步是将奖励项选择简化为因果有向无环图上的最小成本部分覆盖问题,通过最大流在多项式时间内求解。第三步是将权重拟合几何化为一个凸可行性问题,通过偏好查询迭代缩小范围,并利用现有的分离预言机方法求解。据我们所知,这是首个保持确定性无冲突可行权重区域的奖励设计方法,通过分离预言机以O(n log κ)次偏好查询将区域缩小到所需容差。
可解释计算机视觉中的类激活映射:以方法为中心的CNN、Transformer与基础模型时代视觉解释综述 AmirHossein Eshghi 2026-08-12 PDF 类别激活映射(CAM)是解释性人工智能中应用最广泛的视觉解释方法家族之一。其目的直观:将模型内部证据转化为热力图,突出支持目标类别或概念的图像区域、卷积通道、令牌或补丁。自2016年首个CAM公式提出以来,该领域已远超全局平均池化CNN分类器的范畴。CAM风格方法现包括基于梯度的后置解释、无梯度评分与消融方法、高分辨率上采样、弱监督定位与分割、Transformer令牌归因、因果与去偏方法,以及利用CLIP、DINO、SAM或特征分布比较的基础模型时代方法。本综述综合了自2016年以来发表的57篇以方法为中心的严格文献集。论文构建了一个按归因机制、架构依赖性和评估目标区分方法的分类体系,随后回顾了基于梯度的CAM、近期及混合CAM风格方法,以及基于模型或架构感知的方法。在整个文献集中,主要趋势清晰:该领域正从解释单个低分辨率CNN层中的单一类别分数,转向比较性、多层、概率性、令牌感知及基础模型感知的解释。同时,评估仍显碎片化。忠实性、定位能力、鲁棒性、计算成本和人类信任常采用不同协议衡量。因此,本综述不仅强调每种方法的贡献,还指出其遗留的空白及后续方法试图填补这些空白的方式。
教授大型语言模型导师克制作答:一种监督者架构与基于证据的苏格拉底行为调优方法 Yusuf Pisan 2026-08-12 PDF 高效的大语言模型(LLM)辅导教师往往必须拒绝给出它能轻易生成的答案。在一项随机研究中,使用无约束聊天机器人的学生在练习时得分更高,但在后续无此工具参与的测试中得分较低,而同一模型的苏格拉底式约束版本则保持了练习收益并消除了后续损失[4]。因此,可靠的答案拒绝是辅导教师价值的关键,但面对受挫学生施压时,仅靠提示词,能力强大的模型无法可靠地拒绝。我们报告了一个已部署的辅导系统,该系统将答案拒绝作为每轮可机器验证的契约强制执行,并提供一种基于证据调整该拒绝行为的方法。一个非LLM的策略核心,仅读取可信的学习者状态,在八级帮助阶梯上设置每轮上限;一个确定性检测器剥离解决方案代码;一个独立的LLM评判器对照契约检查每个有风险的回复。我们使用无需人类受试者的自动化评估来调整行为:脚本化的学生角色被驱动通过实时管道,并由更强的模型重新评分,我们记录每次拒绝的陈述理由,以便按原因修复失败。这揭示了一个可解释的“过度帮助阶梯”,从明显的解决方案泄露,到指出确切错误,再到过度引用一般事实,每次修复都暴露下一个问题。该辅导教师在全部四项验收标准上达到完全合规。我们提供度量、诊断和修复循环,作为任何必须拒绝其具备能力的LLM代理的可复用配方。