| 认识自我,理解世界:面向多模态大语言模型的无人机时空推理双认知基准 |
Like Liu |
2026-07-17 |
PDF |
多模态大语言模型在多种视觉-语言任务中取得了优异表现,但在无人机场景下的能力尚未得到充分探索。近期面向无人机的基准测试开始评估多模态大语言模型在航空场景中的表现,但这些测试通常聚焦于场景理解、事件识别或导航完成,而非联合评估无人机智能体所需的双重认知能力:在多视角时空上下文中同时推理无人机自身状态与外部环境。为填补这一空白,我们提出UAV-DualCog——基于双重认知视角构建的航空多视角时空推理基准。UAV-DualCog包含图像与视频任务,可联合评估自身状态与环境状态推理能力,同时要求超越离散答案预测的空间或时间定位。我们还开发了自动化流水线,从场景级语义点云中构建数据,形成包含多样化场景、数百个地标及数千个问答样本的可扩展基准。大量评估表明,当前多模态大语言模型在无人机双重认知方面仍远未达到可靠水平。自身状态推理、视角变换、精确空间定位及时间区间定位是持续存在的瓶颈,通过思维模型/前沿模型及人类基线的额外验证确认,该基准对人类可理解但对现有模型具有挑战性。我们进一步从非重叠场景构建UAV-DualCog-Train,并通过轻量级优化探针实验表明其能提供有效的结构化监督,证明该基准不仅可作为评估基准,还可作为推动基于多模态大语言模型的无人机智能体发展的数据资源。项目网站及补充材料:https://uav-dualcog.lozumi.com |
| MotionForesight:重新利用视频模型进行未来3D场景流预测 |
Homanga Bharadhwaj |
2026-07-17 |
PDF |
人类可以通过被动观察推断物体可能的运动方式:杯子可能被提起,抽屉可能滑动,盖子可能旋转闭合。这类预测揭示了在现实世界中行动所需的交互物理后果。我们研究如何从普通的人类-物体交互单目视频中学习这种预判能力。给定一段短观察视频上下文,MotionForesight 预测被操作物体上各点的未来三维轨迹。该方法将交互预测转化为以物体为中心的三维运动预测,无需对物体属性做任何假设。我们的核心洞察在于:视频预测模型已编码了人类交互过程中物体运动的丰富先验知识。我们将这些先验从像素预测重定向至未来三维场景流。基于预训练视频模型构建的密集三维追踪器,我们从完整视频片段生成伪真实轨迹,并仅使用观察帧训练预测器。我们以学习到的掩码潜变量替代未来RGB与几何信息,训练轻量级适配器将回溯性追踪表征转化为前向预测器,同时冻结大型视频与追踪组件。仅使用4万段人类视频且无需语言等辅助输入,MotionForesight 即可泛化至各类分布外物体、环境、视角及交互场景,其性能甚至超越使用百万级训练视频的更大规模模型。这些结果表明,我们能够高效地将视频先验重新用于具身智能的显式几何预测。https://motionforesight.github.io/ |
| FVAttn:面向视频生成的运行时负载均衡自适应稀疏注意力机制 |
Hao Liu |
2026-07-17 |
PDF |
视频扩散Transformer处理长时空序列时,自注意力机制成为高分辨率视频生成的主要瓶颈。免训练稀疏注意力虽能降低计算成本,但在多GPU序列并行场景下,自适应Top-p路由会导致各注意力头负载不均。这种负载异构性将稀疏注意力转化为层级拖后腿问题。我们提出\method{}——一种免训练稀疏注意力系统,可提升自适应稀疏注意力在多GPU序列并行下的分布式执行效率。\method{}采用Top-p路由、Top-k安全阈值及视频感知块组织作为稀疏路由前端,并在运行时修复掩码矩阵。运行时负载均衡通过点对点通信迁移少量重负载头以缩短当前关键路径。松弛感知稀疏增强利用剩余非关键层级空闲计算资源填充高价值数据块,同时通过计算重叠隐藏调度与迁移开销。在步蒸馏Wan2.2 I2V模型上,\method{}将平均负载不均衡度从1.34降至1.08,相比FlashAttention实现4.41倍注意力加速,同时以2.02-2.11倍DiT推理加速保持竞争性视频质量。 |
| 将视频搜索视为树结构:用于基于长视频问答的自我修正智能体 |
Ce Zhang |
2026-07-17 |
PDF |
基于长视频的问答(Grounded LVQA)要求回答关于长视频的问题,同时定位支持答案的简短证据区间。近期基于智能体的方法将这一任务建模为多轮探索,使用单一的crop_video(start, end)动作,支持从粗到细的逐步缩小范围,但缺乏从细到粗回溯的基本操作。因此,这些智能体通常过早收敛,无法从早期错误中恢复。我们提出VideoTreeSearch(VTS)框架,将基于长视频的问答建模为在自适应时间树上的迭代自纠正搜索。VTS根据视觉场景边界构建非均匀树,使每个节点对应语义连贯的片段,并训练智能体通过四种离散操作导航树:zoom_in、zoom_out、shift和answer。这些操作将回溯和恢复作为显式、可学习的基本操作,而非隐式行为。为训练这种导航能力,我们引入轨迹合成流水线,生成通过树的多步路径,包括故意进入错误分支后恢复的迂回路径。我们使用这些轨迹进行监督微调,随后结合定位和答案准确性奖励进行强化学习。在三个Grounded LVQA基准测试(CG-Bench、Haystack-LVBench、Haystack-Ego4D)上,VTS在CG-Bench上比最强先前智能体方法高出+12.5 mIoU,在Haystack-Ego4D上高出+7.4 T-F1。学习到的策略也能迁移到通用长视频问答,在Video-MME、MLVU和LVBench上超越所有先前智能体基线,最高提升+7.1准确率点。消融实验证实,自纠正分层搜索是这些增益的核心机制:移除自适应下降或显式回溯都会显著降低性能。代码见https://github.com/CeeZh/VTS。 |
| PagedWeight:基于动态质量感知权重量化的高效MoE大语言模型服务 |
Yuchen Yang |
2026-07-17 |
PDF |
混合专家模型(MoE)是一类流行的大语言模型(LLM),兼具高效率和准确性。然而,在KV缓存密集型服务场景中,MoE模型常面临模型权重的GPU内存需求与不断增长的KV缓存之间的矛盾。我们提出PagedWeight——一种面向MoE大语言模型服务的新型管理方法,该方法能在运行时动态量化MoE模型权重,并平衡专家权重精度与KV缓存大小。PagedWeight揭示并有效驾驭了模型任务精度、内存消耗与吞吐量/延迟之间的复杂权衡。在多个内存敏感的MoE服务场景中,PagedWeight相较于现有多种量化基线方法,显著改善了质量-内存权衡。PagedWeight在实现FP16等效精度的同时,最高可节省72.0%的GPU内存并提升1.94倍吞吐量;在相似内存预算下,其质量相比量化方法最高提升39.3%,且吞吐量损失不超过4.1%。 |
| 基于平衡的可微连续变量热力学计算蓝图 |
Owen Lockwood |
2026-07-17 |
PDF |
为应对机器学习工作负载日益增长的能耗与延迟需求,我们提出了一种能效高且速度快的热力学计算架构蓝图,该架构利用物理硬件中的随机模拟过程。本研究聚焦于基于能量的热力学计算,其中随机过程可通过具有可调能量势的朗之万动力学进行精确描述。通过在物理硬件中实现此类能量势,我们能够生成并采样基础参数化能量模型。基于概率图模型框架,我们展示了如何构建并训练以这些硬件原生能量模型为基础的流行机器学习模型类别。通过理论分析与数值研究,我们评估了该热力学范式下不同模型的运行时间与能耗。作为此类硬件的初步实验实现,我们展示了由热噪声驱动的随机模拟超导电路。综合这些成果,我们为概率机器学习领域的高能效热力学硬件发展指明了路径。 |
| 面向风险驾驶情绪反应的视觉语言助手 |
Harine Choi |
2026-07-17 |
PDF |
本研究提出了一种视觉-语言管道,用于检测危险驾驶行为并生成情感化表达,以提升驾驶员的感知与舒适度。尽管视觉-语言模型在自动驾驶的感知与推理领域取得进展,现有系统鲜少考虑情感维度或真实用户体验。KYA系统可实时检测高风险驾驶操作(如突然切入),并通过适配驾驶员偏好的大语言模型生成情感化响应。该框架包含两大核心模块:视觉模块采用YOLOv8变体检测邻近车辆并识别突然切入等危险行为,提取并标准化相对距离、速度、预计到达时间等关键驾驶指标,生成结构化行为日志;语言模块则根据用户定义的情感基调(如中性、幽默、分析型)处理日志,并利用ChatGPT-4o、Claude 3、Gemini 2.5、Copilot等先进大语言模型生成语音反馈。我们通过包含危险驾驶行为的行车记录仪视频及108名参与者用户研究评估系统。参与者选择偏好响应风格,大语言模型基于情感对齐度进行评测。所有模型均获良好评分,但偏好因用户画像而异。其中YOLOv8s与ChatGPT-4o组合以5分制获得4.29最高分。通过融合真实世界感知与情感自适应对话,KYA为车载人工智能的情感智能开辟了新范式,为提升传统及自动驾驶车辆的安全性、信任度与情感健康提供了可行方向。 |
| 基于拉普拉斯最优传输的聚类感知匹配 |
Gabriel Samberg |
2026-07-17 |
PDF |
在许多匹配应用中,待匹配的点云并非简单的无序点集,而是具有内在聚类结构的分布样本。在此类场景中,由于单个点往往在连贯区域内可互换,建立稳健的区域间对齐比实现精确的点对点对应更具价值。为此,我们提出一种基于拉普拉斯最优传输(LapOT)的聚类感知匹配新方法。其核心思想是通过点云相似图构建的二次拉普拉斯项来正则化最优传输问题,从而促使最优耦合尊重两个点集的聚类结构。我们还引入了精化同步聚类(RSC)方法,该方法利用LapOT获得的聚类感知耦合来生成跨点集的一致性分区,能够克服独立聚类的局限性,产生更稳定且可解释的结果。通过理论分析与实验验证,我们证明了LapOT确实能生成聚类感知匹配,从而在点云间实现更一致、更有意义的对齐。 |
| 面向动力系统实时最优控制的物理增强强化学习 |
Matteo Tomasetto |
2026-07-17 |
PDF |
强化学习(RL)近期已成为非线性复杂动态系统的一种有前景的反馈控制策略。然而,RL算法样本效率低下,需要与环境进行大量交互才能合成最优控制策略。因此,由于高维空间中探索-利用困境带来的维度灾难,RL的应用通常局限于稀疏传感器和执行器。本研究通过提出一种新颖的物理增强强化学习(PEARL)范式,将RL与传统最优控制相结合,专门针对高维参数化动态系统的控制问题,并利用其动力学的可微性。具体而言,PEARL采用演员-伴随算法,利用自动微分计算短时域策略梯度,并通过神经网络近似未来回报的伴随灵敏度,显著减少环境交互次数,同时缓解长期梯度不稳定性。通过非定常流中两个具有挑战性的参数化导航问题,我们证明PEARL能够:(i)有效利用可微环境超越最先进的RL算法;(ii)通过物理引导的策略学习实现样本高效性;(iii)跨多种场景泛化,这对处理参数化系统至关重要;(iv)实现RL向高维状态与动作空间的扩展,无需低维状态表示或多智能体策略。 |
| 评估用于生成自动驾驶汽车漏洞结构化威胁信息的开放权重大语言模型 |
Md Erfan |
2026-07-17 |
PDF |
网联自动驾驶车辆依赖互联的软硬件组件,包括传感器、电子控制单元、车载信息娱乐系统和远程信息处理单元,这些组件的漏洞可能危及资产、用户和车辆运行。此类漏洞通常以纯文本形式记录在通用漏洞与暴露数据库中,但安全从业者需要关于受影响资产、弱点类型及攻击行为的结构化信息,才能有效缓解这些漏洞带来的风险。为此,我们评估了开源大语言模型生成结构化威胁信息表达的能力——STIX是表示威胁信息的知名结构化格式,用于处理CAV相关CVE。我们构建了名为CAV-STIXGen的数据集,将CAV漏洞描述映射至STIX域对象、STIX关系对象、通用弱点枚举及MITRE ATT&CK技术映射。基于该数据集,我们评估了11个开源大语言模型(参数规模4B至120B),采用不同提示策略和温度参数。单模型配置在SDO、SRO和CWE映射上分别达到0.94、0.63和0.99的F1分数,而完整MITRE ATT&CK映射仍具挑战性。在多智能体设置中,Gemma-4-31B和Codestral-22B在SDO和SRO上分别取得0.91和0.43的F1分数。最后,我们分析CWE与MITRE ATT&CK的共现模式,识别CAV领域反复出现的威胁特征,展示AI辅助的漏洞到STIX翻译如何实现威胁情报自动化并优先防御运输安全。 |