| ELSA3D:面向统一三维理解与生成的弹性语义锚定 |
Tianjiao Yu |
2026-07-07 |
PDF |
统一的3D基础模型旨在通过单一骨干网络生成3D资产并基于语言进行推理,但其文本-3D交互仍高度隐式。现有方法将文本与3D令牌拼接为扁平序列并依赖自注意力机制,导致粗粒度结构线索与细粒度几何细节被压缩为无差异的表示。我们提出ELSA3D——一种通过弹性语义锚定实现语言与几何推理在匹配抽象尺度上联合建模的统一3D模型。ELSA3D采用尺度感知八叉树分词器表征几何结构,并引入锚点令牌——一种稀疏跨模态单元,可筛选语义线索、将其路由至最相关的3D尺度、检索特定尺度的几何证据,并将融合信号写回统一表征,保持交互的稀疏性与精确性。轻量级逐块路由器使计算与推理均具备弹性,能动态选择哪些文本令牌在何种几何尺度实例化锚点,使跨模态容量集中于最需要对齐的区域。ELSA3D在图像到3D生成、文本到3D生成及3D描述任务中均达到最优性能,超越最强统一基线模型,同时相较于同模型非弹性版本,FLOPs与推理延迟降低约50%。 |
| Lift3D-VLA:将VLA模型提升至具备3D几何与动力学感知的操作能力 |
Jiaming Liu |
2026-07-07 |
PDF |
近期,视觉-语言-动作(VLA)模型在多样化任务中展现出强大的泛化能力。然而,物理环境中的有效机器人操作本质上需要几何理解与空间推理能力。尽管部分VLA方法尝试融入三维信息,但受限于当前三维编码流程中数据可用性不足与几何信息损失,这些方法无法在动态环境中联合捕获三维几何结构与时间结构化动作。为解决上述局限,我们提出Lift3D-VLA——一个统一的VLA框架,该框架赋予模型显式三维点云推理能力,并实现时间连贯的动作生成。首先,基于我们先前的工作Lift3D,我们提出一种增强型二维模型提升策略,通过几何对齐将三维点与预训练的二维位置嵌入相关联。该设计在最小化空间信息损失的同时,使VLA视觉编码器能够直接进行点云编码。基于显式三维输入,我们提出几何中心掩码自编码(GC-MAE)——一种双目标自监督框架,在重建当前点云的同时预测其未来几何演化。这种设计使二维视觉编码器能够内化三维结构与物理动力学。为充分挖掘三维表征潜力,我们进一步设计分层时间动作建模,利用大语言模型的多层结构协同预测动作块,从而实现时间一致性预测。在22个模拟任务与8个真实世界操作任务中,Lift3D-VLA在MetaWorld和RLBench上的平均成功率分别比最优VLA方法高出10.8%和11.1%,在真实世界基准测试中超越最强基线4个百分点,同时展现出更强的分布外扰动泛化能力。 |
| 视觉作为统一的多模态生成 |
Xiaoyang Han |
2026-07-07 |
PDF |
我们将计算机视觉建模为统一的多模态生成任务,通过统一多模态模型的原生文本与图像生成空间表达异构视觉任务,无需任务专用架构。在此框架下,SenseNova-Vision 使用自然语言指令与可选视觉提示来指定任务、目标区域或视角及解码约定,并生成文本形式的符号输出、图像形式的密集空间预测结果,或面向组合任务的图文混合输出。为支持大规模训练,我们将多样化的计算机视觉标注转换为与这些生成空间兼容的指令-响应样本,构建了涵盖文本、图像及混合目标的计算机视觉指令-响应语料库 SenseNova-Vision Corpus。基于现成的预训练统一多模态模型,SenseNova-Vision 主要在该语料库上训练,并辅以能力保持型多模态数据混合训练,无需任务专用预测头或架构修改。该模型覆盖检测、OCR、关键点估计、分割、深度估计、表面法线预测、点图及相机位姿估计等广泛视觉任务,同时支持由语言定义的变体,可组合类别、颜色、区域及其他视觉线索。实验表明,单一统一模型在结构化视觉理解、密集几何预测、分割及多视角视觉几何任务中可媲美领先的专用系统。这些结果表明统一多模态生成是将计算机视觉能力集成到通用基础模型中的可扩展路径。模型与语料库已公开。 |
| ProxyPose:通过视频到视频转换实现六自由度姿态追踪 |
Ruihang Zhang |
2026-07-07 |
PDF |
从单目视频中追踪物体和表面的六自由度(6-DoF)位姿是计算机视觉领域长期存在的问题。现有方法需要视频本身之外的输入——如3D模型、深度图、物体掩码或特定任务的学习特征——且难以处理无纹理、透明、反光或可变形表面。本文提出ProxyPose,将6-DoF位姿追踪重新定义为视频到视频的转换。仅需输入视频和首帧中一个标记像素,微调后的视频扩散模型即可将输入转换为代理视频——一个合成视频,其中彩色多面体与标记像素处的表面区域经历相同的局部刚体运动。由于代理的几何形状和外观由构造已知,恢复其完整6-DoF轨迹可简化为使用现成求解器的经典位姿估计。该公式利用大规模视频预训练,将位姿追踪中最困难的方面——处理挑战性材质、遮挡和变形——吸收到转换步骤中,同时在像素级别运行,无需对物体身份、边界或全局刚性做任何假设。ProxyPose在无需竞争方法所需的额外输入的情况下,实现了最先进的6-DoF位姿追踪精度,且仅需在合成数据上微调视频模型。我们进一步证明ProxyPose可扩展至人脸追踪、相机位姿估计以及现有方法无法处理的挑战性野外场景。项目页面:https://ruihangzhang97.github.io/proxypose/。 |
| 从RGB生成到密集场读出:基于文本到图像模型的像素空间密集预测 |
Zanyi Wang |
2026-07-07 |
PDF |
大规模文本到图像模型是密集预测任务的有吸引力的骨干网络,因为RGB生成预训练学习了丰富的语义、结构和几何先验。现有的生成和编辑方法通过将密集预测转化为目标生成来复用这些先验:深度、法线、alpha抠图、掩膜和热力图等标注被编码到RGB训练的VAE潜空间中,再解码回类似图像的目标。我们认为这继承了比密集预测所需更多的生成输出接口:与RGB合成不同,密集预测要求在相同图像平面上获得像素精确、任务原生的场,而非渲染新的RGB内容。我们的关键观察是,预训练的DiT已通过图像平面上的块到令牌到块网格组织RGB输入,因此每个令牌索引一个固定输出块,其通道可携带任务原生量而非RGB外观。我们将其实现为ReChannel:保留DiT输入分布的VAE编码器,但移除目标侧解码器,用任务LoRA适配冻结的DiT,并通过共享的令牌局部线性头(约33K参数,无空间混合)将每个令牌映射到其p×p×K_t像素空间块。使用FLUX-Klein,我们在六个密集预测任务和十余个基准上进行了评估。这种最小化接口在无三元图抠图、KITTI深度和指代分割上设立了新的最先进水平,并在法线、显著性及姿态估计上保持竞争力。在匹配的4B设置下,它比编辑加潜解码方案更准确且快2.48倍——密集感知可从生成预训练中受益,而无需继承其输出接口。 |
| MonoIR-RS:基于CLIP与VLM适配的红外遥感视觉-语言学习 |
Jiaju Han |
2026-07-07 |
PDF |
红外遥感影像捕捉的是强度结构、目标-背景对比度以及光照不变性线索,这些信息在RGB影像中往往不可见。然而,大多数遥感视觉-语言资源与模型聚焦于可见光波段语义,导致红外视觉-语言理解领域研究不足。我们提出MonoIR-RS——一个大规模红外遥感视觉-语言数据集与基准,它结合了红外感知数据构建、CLIP风格对比适应以及VLM指令微调。该数据集与FusionRS共享同一源数据池和划分方式,以红外影像作为模型输入模态,生成60万张合成红外图像和59,032条保留红外感知特征的描述记录。模型实验使用该保留语言监督子集,其描述文本围绕灰度结构和红外风格对比度重写监督信息,而非RGB外观。实验表明,在AVIID基准上,合成红外影像相比灰度转换图像更接近真实热红外影像。我们微调了五个CLIP骨干网络和六个VLM骨干网络,并与零样本行为进行校准:红外感知适应使CLIP平均召回率提升最高12.8个百分点,驱动VLM描述的红外线索覆盖率达到100%,同时将残余RGB色彩泄漏降至接近零。通过将红外模态从RGB-红外双模态学习中分离,MonoIR-RS为红外遥感证据与语言的对齐提供了可控、可复现的测试平台。 |
| 跨站点数据集中乳腺摄影钙化分类的无监督域适应 |
Xuan Liu |
2026-07-07 |
PDF |
基于深度学习的计算机辅助诊断系统在乳腺癌诊断中表现出色,尤其在乳腺X线摄影的分类任务中。然而,多中心数据集间的域偏移仍是一大挑战,特别是当模型应用于未见过的域时。本研究提出了一种钙化分类框架,旨在提升多中心乳腺X线摄影数据集中恶性与良性乳腺疾病的分类性能。该框架包含两个组件:(1) 基于风格迁移模型(AdaIN和CycleGAN)的无监督域适应模块,无需额外标注即可生成特定厂商和特定技术的训练样本;(2) 以Swin Transformer V2为主干网络的监督分类模块。我们在三个数据集上评估了该方法:在OPTIMAM(英国国家卫生服务体系;n=2994)上进行交叉验证,随后在EMBED(埃默里大学;n=125)和Duke钙化数据集v1(n=788)上进行外部验证。这些数据集涵盖多个厂商,并包含全视野数字乳腺X线摄影和由数字乳腺断层合成生成的合成二维图像。所提出的框架提升了EMBED(AUC从0.68提升至0.72)和Duke钙化数据集(AUC从0.68提升至0.73)的跨中心性能。这些结果表明,域适应能够减少域偏移,并提升钙化分类在多中心数据集上的泛化能力。 |
| 图卷积注意力:图去噪与扩散的谱视角 |
Shervin Khalafi |
2026-07-07 |
PDF |
图去噪是图学习中的基础问题,也是图扩散模型的核心操作。基于注意力机制的架构(如图Transformer)近期在图去噪任务中展现出潜力。然而,我们对基于注意力的图去噪原理性理解仍十分有限,这使得标准注意力机制是否适合该任务尚不明确。本文证明,在去噪目标下,线性注意力是次优的,仅能学习训练分布上的平均谱去噪滤波器。这造成了根本性局限,因为图在分布中的谱特性往往存在差异。为克服这一局限,我们提出谱注意力机制,该机制直接利用输入图谱,并证明其性能优于线性注意力的程度由分布的谱多样性决定。进而推导出图卷积注意力(GCA)——这一思想的实用化且置换等变的实现,通过图滤波的查询和键实现谱去噪。对于随机块模型,GCA可证明地匹配理想化的谱注意力机制。我们进一步证明,注意力后的softmax操作通过将含噪特征向量近似投影到干净特征空间,提供了额外去噪能力。实验表明,在合成和真实数据集上,将线性注意力替换为GCA能持续提升图去噪与扩散性能,且提升幅度与谱多样性高度相关。在DiGress中,GCA无需计算昂贵的结构特征即可匹配标准图Transformer性能,当与近期提出的PEARL位置编码结合时,可避免显式特征分解计算,在保证质量的同时实现更快的推理速度。代码见:github.com/shervinkhalafi/graph_conv_att |
| 从文化遗产保护的角度重新思考印度人工智能 |
Aparna Madva |
2026-07-07 |
PDF |
随着人工智能(AI)逐步深入印度次大陆的各个领域,学界对AI如何影响该文明的语言与文化根基产生了浓厚兴趣。AI被视为一把"双刃剑":一方面它能促进庞大人口群体的可及性与包容性,另一方面也可能导致世界观的同质化,并排斥未被充分代表的语言与世界观。本文通过剖析印度语言学的广泛特征及其与文化实践、世界观的紧密关联,试图界定这一问题。我们纵向梳理了自然语言处理(NLP)技术在该领域的发展历程,追溯印度语NLP的历史演进,涵盖关键里程碑、方法论变革及资源建设成果。此外,本文还考察了印度语言的结构性与社会语言学特征(如丰富的形态变化、复杂的文字与语法规则、双言现象及巨大的方言差异),阐释这些特征如何为构建AI基础模型带来独特挑战。随后,我们探讨了印度语基础模型日益重要的作用,分析这些模型如何应对长期存在的资源与表征缺口。最后,我们提出名为"文化感知"的研究方向,基于诠释学推理重新构想AI。文化感知旨在解决开放性问题,例如确保低资源语言的公平性能表现,并生成具有文化意义的输出。通过整合既有研究、当前技术与新兴趋势,本文勾勒出可指导印度语NLP下一阶段发展的研究方向,助力构建更稳健、更具包容性的印度语基础模型。 |
| 关于在没有黄金标准的情况下对非人类序列进行依存句法分析的可行性。在其他物种中是否可能进行评估? |
Ramon Ferrer-i-Cancho |
2026-07-07 |
PDF |
依存句法分析旨在为序列找到一种树状表示。无监督依存句法分析的目标是在模型训练过程中无需使用黄金标准即可开发解析方法。在人类语言中,由于通常存在或可以创建某种黄金标准,因此可以对无监督解析器进行评估。而对于其他物种,黄金标准是未知的。因此,人们可能认为无法确定无监督解析器的准确性,从而推断依存句法分析在其他物种中不可行。然而,我们在此应用网络科学的最新进展证明,由于非人灵长类动物产生的发声或手势序列的长度分布快速衰减,解析器检索到的正确边的比例必然较高。相比之下,人类语言序列缺乏这一特性。因此,在非人灵长类动物中无需黄金标准即可进行评估,但在人类中则是一个难题。 |