| VideoRAE:通过表示自编码器驯服视频基础模型以进行生成建模 |
Zhihao Xie |
2026-07-15 |
PDF |
视频生成模型通常依赖于3D变分自编码器(3D-VAE)学习的潜在空间。然而,传统3D-VAE主要针对像素级重建进行优化,这限制了其潜在表示所捕获的语义和时空结构。与此同时,V-JEPA 2和VideoMAEv2等视频基础模型(VFM)展现出强大的视频理解能力,但它们的冻结表示能否转化为紧凑、可重建且适合生成的视频潜在表示,仍是一个待探索的问题。我们通过VideoRAE回答了这个问题——这是一种表示自编码器,它利用冻结的视频基础编码器的多尺度层次特征,并通过轻量级1D自注意力投影器进行压缩。VideoRAE既支持扩散Transformer的连续潜在表示,也通过多码本高维量化为自回归模型提供离散标记。在解码阶段,与冻结VFM教师模型的局部-全局表示对齐目标提升了语义保留能力,并实现了无需KL正则化的训练。实验表明,VideoRAE在连续和离散模式下均实现了强重建性能。在UCF-101上,使用AR和DiT生成器分别获得了40和93的类到视频gFVD最优结果,同时收敛速度比竞争的自编码器基线快约5倍。在受控的2B规模文本到视频研究中,用VideoRAE替换LTX-VAE在可比设置下实现了更快的收敛。这些结果验证了冻结VFM表示可作为通用且适合生成的视频潜在表示。模型和代码将在https://zhxie0117.github.io/VideoRAE发布。 |
| 利用未标记数据实现可泛化的神经群体解码 |
Ximeng Mao |
2026-07-15 |
PDF |
鲁棒且精准的神经解码器是脑机接口和闭环实验等神经技术的核心组成部分。近期研究表明,在尖峰层级对神经数据进行标记化处理,能够促进多会话预训练并实现最先进的解码性能。然而,当前基于尖峰的模型仅限于监督学习,训练过程依赖带有行为标签的数据集。为解决这一局限,我们提出MOJO(基于掩码自编码器的联合训练框架),这是一种针对尖峰标记化模型的训练框架,通过掩码自编码实现自监督学习与监督学习目标的联合利用。我们在三个尖峰数据集上评估MOJO,涵盖猴子运动皮层在伸手任务中的记录以及小鼠多脑区在视觉与决策任务中的记录,结果显示其性能优于纯监督学习模型。这种提升在有限标签数据训练时尤为显著,特别是在仅需少量新会话标签数据的少样本微调场景中。引入自监督学习还能产生更具可解释性的神经元表征,在无需显式优化的情况下提升脑区分类和尖峰统计预测的性能。我们进一步证明MOJO可泛化至人类言语期间的皮层脑电图数据,其性能持续超越纯监督学习模型,并与专为连续信号设计的神经基础模型表现相当。总体而言,为尖峰标记化模型增强自监督学习可提升标签匮乏场景下的性能,支持跨任务和物种利用无标签数据,同时泛化至其他神经模态。这些结果揭示了训练神经基础模型时实现更灵活、可扩展数据使用的路径。 |
| 在Lean中构建Shor算法:针对RSA-2048和P-256的量子攻击的代理形式化 |
Lei Zhang |
2026-07-15 |
PDF |
大型语言模型正越来越多地协助完成高要求的正式定理证明任务,尤其是在基于机器检查库(如Lean)的场景中。智能体系统通过搜索、复用和扩展现有形式化成果来发现新知识,进一步强化了这一过程。在量子计算领域,Shor算法及其变体为Lean形式化提出了一个高难度挑战。在本工作中,我们通过智能体形式化方法在Lean中实现了该算法族的形式化:软件智能体分析文献、编写Lean代码并修复证明,科学主张由人类审核,最终的形式化证明由机器检查。我们的形式化工作为分析两种密码学场景中的量子攻击奠定了数学基础:RSA-2048中的2048位模数,以及256位素数域上的标准化椭圆曲线(P-256)。为支撑这些分析,形式化内容涵盖从量子阶查找算法到模运算和椭圆曲线算术的可逆量子电路。基于[Quantum 5, 433]和[ASIACRYPT 2017, 241–270],我们分别形式化了RSA-2048和P-256的逻辑资源估算,并提供了经典操作的额外估算。我们预期这些成果将为更广泛的机器检查量子密码分析铺平道路,并标志着向AI辅助量子算法设计与验证迈出一步。 |
| 基于最优传输的线性独立成分分析 |
Ashutosh Jha |
2026-07-15 |
PDF |
线性独立成分分析(ICA)从线性混合信号中恢复联合独立的源信号。为实现这一目标,经典ICA算法试图最大化非高斯性,通过信息论与独立性关联的负熵来度量。由于精确的负熵优化难以实现,这些算法依赖代理对比函数(如四阶累积量)和参数化对数似然。我们提出改用平方Wasserstein距离$W_2^2$到标准高斯分布来度量非高斯性。我们证明,当投影恢复独立成分时,标准正态分布与数据线性投影之间的Wasserstein距离达到最大。基于这一发现,我们提出OT-ICA算法,通过梯度优化寻找该投影。模拟数据实验表明,对于不同分布的潜变量,OT-ICA优于基于代理的方法。在脑电图伪影去除和计量经济学价格发现中的应用证实,OT-ICA无需分布假设即可用于实际ICA任务。 |
| 从像素到状态:将交互式世界模型重新构想为游戏引擎 |
Zhen Li |
2026-07-15 |
PDF |
构建能够根据玩家行为做出连贯响应的交互式世界,长期以来一直是计算机图形学、游戏和人工智能领域的共同目标。近期视频生成模型提供了一条数据驱动的实现路径——通过预测基于用户行为的未来观测结果,这些模型正逐渐被视为潜在的下一代游戏引擎。然而,实现真正交互式的游戏世界,需要交互结果遵循随游戏状态演变的规则、产生能长期持续的后果,并实现实时运行的生成循环。传统游戏引擎通过循环的动作-状态-观测机制实现这些特性:玩家行为根据预设规则更新显式游戏状态,观测结果则从更新后的状态渲染生成。本文以该循环为组织框架,从四个维度考察交互式游戏世界建模:玩家行为控制、游戏状态动态、状态-观测持续性以及实时交互生成。针对每个维度,我们首先明确交互式游戏世界所需的能力,将现有方法归类为代表性技术族,并讨论各族的优势与权衡。为补充分析,我们为《黑神话:悟空》构建了可扩展数据引擎,采集超过90小时的游戏过程,包含帧对齐的玩家动作、真实游戏状态、视觉观测数据,以及结构化与语义化标注,作为状态感知游戏世界建模的资源。希望本文能清晰呈现该领域的发展现状,推动交互式游戏世界的进步。 |
| VisualRepair:面向视觉软件问题修复的动态工具调用与区域聚焦 |
Jingyu Xiao |
2026-07-15 |
PDF |
随着大语言模型(LLM)的出现,自动程序修复(APR)取得了显著进展。然而,随着现代软件系统日益呈现丰富的图形用户界面,有效利用错误截图中的视觉信息已成为在多模态场景中理解错误并生成精准修复的关键。真实世界的问题报告常包含异构视觉附件,包括UI截图、IDE快照、GIF动图和以文本为主的图像,每种类型都具有独特的视觉模式和领域特定语义,对多模态大语言模型(MLLM)提出了巨大的感知需求。此外,错误截图往往包含大片无信息且与错误无关的区域,这会分散模型注意力并限制补丁多样性。为解决这些问题,我们提出VisualRepair——一个基于MLLM的视觉软件问题修复框架,包含两个核心模块:图像类型感知工具调用(ITTC),该模块对输入图像进行分类并动态调用定制化工具链以实现稳健的视觉理解;以及动态测试时区域聚焦(DTRF),该模块定位多个与错误相关的候选区域,并通过自适应缩放策略进行优化,以改进故障定位并促进多样化补丁生成。在SWE-bench Multimodal基准上的大量实验表明,VisualRepair始终优于现有最先进方法。VisualRepair在测试集和开发集上分别解决了196个和25个实例,比最佳基线分别多出10个和11个实例。这些结果凸显了类型感知视觉理解和区域聚焦定位在自动化视觉软件问题修复中的有效性。 |
| MetaPerch:从元数据中学习构建生物声学基础模型 |
Mustafa Chasmai |
2026-07-15 |
PDF |
生物声学基础模型依赖Xeno-Canto等大规模公民科学平台获取地理和生态多样性数据。近期研究表明,仅通过监督学习即可在大规模数据上训练出最先进的物种检测模型——然而,这些社区驱动数据平台中现成的录音元数据仍存在未被充分利用的潜力。本研究探索将位置、时间等元数据作为辅助监督信号,使模型能够在其学习表征中利用物种-元数据相关性。辅助元数据损失函数提供的额外信息超越了单纯的声音特征,可促进更丰富、更鲁棒的表征生成,从而更好地泛化至物种分布变化和声学域偏移——这些正是真实场景被动声学监测部署中的关键挑战。我们提出MetaPerch新基础模型,在多个具有挑战性的领域实现了强大的物种识别性能,并针对9种不同元数据源对17个生物声学数据集的影响开展了广泛的实证研究。 |
| 使用Evo 2探针对宏基因组数据中的生物安全特征进行筛选 |
Jeremy Guntoro |
2026-07-15 |
PDF |
诸如Evo 2等基因组基础模型能够学习丰富的序列表征,但其在生物安全筛查中的价值尚未得到充分探索。我们通过在不微调底层模型的情况下,在冻结的Evo 2第26层激活上训练最小线性探测器和注意力探测器,探究这些表征中可线性获取的生物安全相关信号量。在保留的宏基因组测试集上,探测器对抗微生物耐药性(AMR)表现出强判别能力:线性探测器(均值池化)的区域级ROC-AUC达到0.888,而单头注意力探测器提升至0.977。探测器能解析更细粒度的AMR药物类别亚型,并将其与无关功能基因区分开,进一步证明所学信号并非仅由通用功能基因状态解释。细菌毒力也可解码,但效果较弱(区域级ROC-AUC为0.833)。AMR探测器无需重新训练即可在模拟短读段上保持相当的排序性能,从而在组装计算成本高昂或不可靠的场景中实现组装前的评估。其读段级ROC-AUC达到0.898(均值池化),与全区域均值池化结果相当。在SynGenome中,Evo 1.5生成序列中仅能弱恢复AMR相关提示标签;这些提示衍生标签无法确定生成响应序列的功能。互补的稀疏自编码器分析可恢复可解释的抗性相关特征,但一致性不如监督式探测器。综合而言,这些结果将轻量级嵌入探测器定位为宏基因组生物监测中快速、低成本的首轮检测层,并映射了该方法的优势与当前局限。本研究是BlueDot Impact、Apart Research和Cambridge Biosecurity Hub主办的AIxBio Hackathon 2026的一部分。 |
| 基于最小最大理论的似然深度学习散斑回归 |
Soham Jana |
2026-07-15 |
PDF |
散斑噪声是一种乘性噪声,常见于合成孔径雷达、光学相干断层扫描和数字全息等相干成像模态中。尽管深度学习方法在实际应用中已取得最先进的散斑去噪性能,但其基本统计极限仍鲜有探索。与加性噪声模型不同,乘性散斑噪声使得回归函数无法通过条件均值识别,导致传统基于最小二乘的深度学习方法失效。我们研究在同时包含乘性散斑噪声和加性高斯噪声的模型下,使用基于似然的深度神经网络(DNN)估计器对光滑非参数回归函数进行极小极大估计。我们的框架同时适用于低维和稀疏高维特征。我们建立了所提出的DNN估计器估计误差的有限样本上界,并推导了该模型下非参数函数恢复的极小极大下界,证明两者在样本量的对数因子范围内匹配。此外,这些极小极大速率(在对数因子范围内)与仅存在加性高斯噪声的非参数回归速率一致,表明尽管乘性散斑噪声带来挑战,估计的内在难度基本保持不变。数值实验进一步支持了我们基于DNN的去斑方法的一致性,并展示了其有效性。 |
| 回溯:重放预测市场以评估大语言模型预测者 |
Xiao Ye |
2026-07-15 |
PDF |
预测模型通过回溯测试进行评估,即回放已解决的事件,并评估系统在结果揭晓前本应给出的概率。对于大语言模型而言,存在两条信息泄露渠道会影响测试结果。具备检索能力的模型能调取事件发生后的报告,将预测任务简化为查表操作;而每个新模型训练数据的时间节点更接近事件发生时间,因此去年模型尚属未来的问题,今年已出现在训练数据中。无论哪种情况,测试名义上评估预测能力,实则衡量记忆能力。我们提出Hindcast方法,通过模拟模型处于选定历史日期$t_0$(此时两个渠道均未产生结果)的状态,同时封堵两条泄露渠道。该方法将已解决的Polymarket预测市场事件与Reddit公共数据的冻结快照进行回放,仅允许模型读取$t_0$之前的帖子,并依据实际结果及$t_0$时刻市场自身价格(即基于相同历史信息的人类预测)对每个预测进行评分。由于每个市场的截止日期独立设定且快照永不更新,评估可随模型改进持续应用于新市场而不会过时。封堵泄露后,检索功能仍对多数模型有助益,但仅限于Reddit在事件发生前已有讨论的领域;若存档仅包含推测性内容,检索反而会降低模型表现。 |