| PHINN-EEG:梦境状态脑电图的拓扑时间序列分析——用于梦境内容分类的动态贝蒂曲线与拓扑条件神经信号合成 |
Ren Takahashi |
2026-07-10 |
PDF |
当前基于脑电图(EEG)的梦境检测依赖于功率谱密度(PSD)和统计矩特征,在DREAM数据库上实现了约0.70的受试者工作特征曲线下面积(AUC)(Wong等,2025,《自然·通讯》)。我们提出PHINN-EEG(持久同调启发式脑电图神经网络),这是首个用于梦境思维分析的时间序列拓扑框架。通过在多通道觉醒前脑电片段上应用滑动窗口Takens延迟嵌入和Vietoris-Rips过滤,我们提取了动态贝蒂曲线,该曲线刻画了神经活动的几何架构而不仅仅是其能量。这些拓扑不变量结合拓扑条件流匹配,经分析预测将超越现有PSD和catch22基准,在DREAM数据库的1462次觉醒开放访问子集(来自20个独立实验室263名参与者共3191次觉醒的完整注册数据)上实现AUC=0.82-0.90。我们进一步引入拓扑条件整流流模型用于梦境状态脑电图合成——以特征维度相当的谱条件流模型作为额外消融基线以隔离拓扑条件的价值——并提出一组候选贝蒂过渡原型,将拓扑结构与梦境报告类别相关联,作为待实证验证的探索性假设空间。若经验证,这项工作将代表神经罕见事件检测从谱能量到相空间几何的范式转变,对可穿戴脑机接口梦境监测具有潜在未来意义。 |
| PanoWorld:真实世界全景生成 |
Haoyuan Li |
2026-07-10 |
PDF |
在本研究中,我们旨在通过利用全向表征的旋转等变性(即旋转可视为隐式几何变换)来解决全景世界模型中的长程记忆挑战。基于此洞察,我们提出PanoWorld,通过固定航向将相机轨迹简化为平移,并借助密集全景射线条件(DPRC)与几何感知记忆增强(GMA)实现当前动作建模与长程记忆。随后引入三阶段训练流程逐步优化各组件。为在大尺度空间变化与多样光照条件下更准确评估物理一致性(现有数据集在此方面相对稳定),我们构建了World360——一个包含全景无人机采集的真实世界视频片段与AirSim360生成的高质量模拟片段的大规模数据集。在World360上的大量实验证明了PanoWorld的有效性,其性能大幅超越对比方法。我们的模型、训练代码及数据集将公开,更多信息请访问项目页面:https://lihaoy-ux.github.io/panoworld-page/。 |
| 面向语言智能的可扩展视觉预训练 |
Yiming Zhang |
2026-07-10 |
PDF |
大型基础模型的快速进展主要得益于在大规模文本语料上的预训练。然而,许多知识通过视觉表征传递,例如图表、排版公式和页面布局所承载的丰富信息,仅靠文本无法准确或完整地捕捉。但当前的预训练方法在获取语言智能时,会将文档和网页等视觉丰富的资源转换为纯文本,从而丢弃这些视觉线索。本文挑战了语言模型必须在纯文本表征上训练的默认假设,并证明视觉预训练是基础模型智能的可扩展学习方式。为此,我们对直接利用视觉文档(无需文本提取)的无监督视觉预训练范式进行了系统研究。在多种骨干网络和基准测试中,基于相同底层语料库的视觉预训练始终优于纯文本预训练,为可扩展的语言智能提供了高效路径。 |
| OpenLongTail:长尾驾驶数据的生成式扩展 |
Lulin Liu |
2026-07-10 |
PDF |
扩展稳健驾驶策略的根本瓶颈在于精心策划的数据集中边缘案例的稀缺性。尽管现实世界持续捕捉这些关键事件,但从异构来源收集时,这些长尾事件仍未得到充分利用。具体而言,多样但宝贵的野外长尾视频缺乏训练策略模型所需的完整视角覆盖,往往缺失多视角姿态或仅来自单目行车记录仪。这种模态差距阻碍了将这些普遍存在的观测转化为可扩展的训练数据以实现长尾泛化。我们提出OpenLongTail,一个用于在长尾事件下扩展自动驾驶策略的开源生成式数据引擎。为将异构数据源转化为视角对齐且时间连贯的多视角资产(这对策略学习至关重要),我们开发了一种基于姿态推断的外推视角合成流程,用于生成缺失视角。我们进一步通过将Plücker射线几何注入可扩展生成引擎,增强了新生成视角的跨视角一致性和时间对齐。通过合成异构长尾数据,我们观察到在应对长尾事件时闭环驾驶鲁棒性显著提升。通过测量外推视角合成和姿态指标,我们验证了OpenLongTail在视觉保真度、跨视角一致性和自我轨迹恢复方面的有效性。 |
| 过去十年中,视觉-语言AI模型在准确性与视觉-认知错误方面的演变 |
Shravan Murlidaran |
2026-07-10 |
PDF |
视觉语言模型在过去十年中在视觉推理方面取得了显著进展。大多数评估使用简单场景(MS-COCO),这些场景未展示复杂的人类互动或行为,仅以少量非策划的人类描述作为基准,且未关注理解模型的错误类型。在此,我们引入了复杂社会行为数据集,包含100张描绘复杂社会互动/行为的图像。我们分析了十年间(2017-2025年)视觉语言模型(四个前多模态大语言模型和五个多模态大语言模型)的场景描述进展。在CSB数据集和MS-COCO样本上,我们评估了模型及20个人类描述相对于黄金标准的准确性。我们分析了五种视觉认知错误类型:目标检测、识别、幻觉、场景理解和空间依赖。CSB数据集在场景描述准确性上的提升比MS-COCO更为显著,前多模态大语言模型的准确性远低于排名最低的人类描述,而多模态大语言模型达到了与排名最高的人类描述相似的准确性。我们证明,多模态大语言模型已消除了简单MS-COCO场景与描绘复杂行为的场景(CSB)之间在场景描述准确性上的差距。多模态大语言模型几乎消除了我们测试数据集中的所有错误类型,除了偶尔在场景描述中依赖与人类不同的图像区域(空间依赖错误)。我们还发现,检测、识别和幻觉错误对场景描述准确性的影响最大。综合来看,我们的研究为视觉语言模型在过去十年中的进步提供了更全面的评估。 |
| VEXAIoT:利用AI代理实现物联网漏洞的自主利用 |
Katherine Swinea |
2026-07-10 |
PDF |
物联网(IoT)系统因硬件受限、固件过时及默认配置不安全而固有脆弱性,亟需可扩展且自适应的安全测试方法。尽管近期大型语言模型(LLM)代理在渗透测试和夺旗赛(CTF)环境中展现出潜力,但其在物联网特定漏洞中的应用尚未被探索。本文提出一种自主多代理框架——基于AI代理的漏洞利用系统(VEXAIoT),通过LLM推理与进攻性安全工具实现物联网环境中的漏洞发现与利用。该框架整合漏洞检测代理与攻击执行代理,执行侦察、规划攻击序列,并对脆弱物联网服务实施漏洞利用。系统在IoTGoat和Metasploitable环境中,针对映射至OWASP物联网漏洞的十个攻击场景进行评估。实验结果显示,攻击成功率最高达100%,且多数攻击的令牌开销低、平均执行时间不足两分钟。在260次攻击执行中,VEXAIoT整体成功率达95.0%,其中IoTGoat环境成功率为94.5%,Metasploitable2环境成功率为96.7%。这些结果表明,LLM驱动的代理可在受控环境中实现物联网漏洞评估与进攻性安全流程的自动化。 |
| 使用Kolmogorov-Arnold网络重新审视欧拉角回归 |
Yangting Sun |
2026-07-10 |
PDF |
在许多实际系统中,包括关节型机器人和生物力学模型,旋转运动在关节空间内定义,并通常由具有有界范围的欧拉角进行参数化。然而,回归欧拉角仍具挑战性,因为其不连续性和奇异性常导致训练不稳定。本文重新审视欧拉角回归问题,并证明其有效性关键取决于旋转表示、回归架构与领域约束之间的相互作用。我们提出一种新框架,将范围感知的欧拉建模与Kolmogorov-Arnold网络(KAN)相结合,后者用边上的可学习单变量函数替代固定的节点激活函数。我们进一步提供理论分析,表明有界欧拉角范围促使回归函数呈现近加性结构,这有利于KAN的加性函数形式,并通过实验验证了这一趋势。在受控旋转回归、物体姿态估计、机器人及人体逆运动学上的大量实验表明,该方法在精度、收敛性和效率上均有持续提升。代码将公开提供。 |
| 概念SMILE:审计基于概念的可解释AI的可信度 |
Mohadeseh Mollapour |
2026-07-10 |
PDF |
基于概念的可解释人工智能(AI)能使模型推理更符合人类理解,但概念级输出并非天然可信。我们提出ConceptSMILE,一种模型无关的基于扰动的审计框架,用于评估概念解释的可靠性。ConceptSMILE并非替代SMILE,而是将其基于扰动的逻辑从特征或区域级归因扩展到可理解概念解释的审计。该框架扰动输入区域,测量概念响应偏移,应用局部加权,并拟合XGBoost代理模型以近似局部概念行为。通过归因准确性、代理保真度、忠实性、稳定性和一致性评估可靠性。我们在视网膜眼底图像上评估ConceptSMILE,比较MedSAM导出的视觉概念与VLM语义概念。结果表明,不同概念和路径的可靠性存在差异:MedSAM在空间归因上表现更强,且代理保真度最高($R^2 = 0.8503$,$R_w^2 = 0.8465$),而VLM路径在特定伪影条件下展现出更强的血管忠实性和稳定性。ConceptSMILE为评估基于概念的可解释AI的可信度提供了独立的审计层。 |
| 有向无环图上的深度高斯过程 |
Federico L. Perlino |
2026-07-10 |
PDF |
许多现实世界的过程可以表示为有向无环图上的函数组合。在因果建模中,这些对应底层机制;在工程中,对应多保真度层级;在基因调控网络中,对应转录因子。这些函数在有向无环图上被部分观测,且测量数据存在噪声和异质性采样,给重建、不确定性传播和推断带来了重大挑战。为应对这些挑战,我们在函数上引入先验,自然推导出有向无环图上的深度高斯过程。我们从理论上研究了其先验坍缩行为,以及图拓扑结构和中间观测对信息保留的影响。我们获得了输入区分度得以保留的深度渐近频率的几乎必然下界,识别了适用该结论的广泛核函数类别,并证明了关于输入连接作用的观察结果。我们提出了一种结构化变分近似方法,该方法保留图依赖关系、保持组合不确定性,并捕捉碰撞节点的解释消除行为。最后,我们通过实验验证了理论结果和方法论,并建模了潜在碰撞有向无环图、蛋白质信号网络以及多保真度重离子碰撞仿真任务,在恢复低保真度贡献的同时实现了最先进性能,并提供了模拟器层次结构的可解释性。 |
| 语义帕累托-DQN:一种用于金融异常检测的多目标强化学习框架 |
Cláudio Lúcio do Val Lopes |
2026-07-10 |
PDF |
金融异常检测面临严重的类别不平衡问题,导致传统单目标算法出现"欺诈坍塌"现象——默认预测为多数类,无法在异常拦截与客户摩擦之间取得平衡。为在不使用失真数据重采样的情况下解决该问题,我们提出语义帕累托深度Q网络(Semantic Pareto-DQN),一种多目标强化学习框架。该方法将异构交易特征整合为连贯的自然语言叙事文本,经大语言模型编码后生成鲁棒且尺度不变的状态表征。智能体优化一个显式解耦金融效能、运营摩擦与语义发现的向量化奖励函数。通过映射连续帕累托前沿,系统动态权衡漏检异常与误报的不对称成本。在电子商务欺诈与UCI信用数据集上的实证评估表明,语义帕累托DQN成功打破零召回率陷阱,相较于标量化基线方法实现了更优的少数类召回率,为以可控运营摩擦换取金融异常发现提供了替代方案。 |