| WorldSculpt:从基于真实世界的视频生成组合式世界 |
Muyao Niu |
2026-09-04 |
PDF |
我们研究的是生成包含数百个物体的杂乱场景的组合式三维表示问题。目标是像游戏、增强现实/虚拟现实、仿真和机器人等下游应用所需的那样,将场景表示为放置在共享世界坐标系中的一组独立物体网格。这一任务在物体相互严重遮挡、每个视角仅显示其几何形状一部分的密集杂乱场景中尤为挑战。基于几何的方法通常将场景重建为单一表示,并在遮挡区域留下不完整的几何形状,而现有的带有生成先验的组合方法则大多局限于相对简单的场景。我们证明,通过将强大的单物体三维生成先验适应于多视角观测,可以组合式地生成包含数百个物体的复杂场景。我们以Pixal3D为例实现了这一范式,通过增加一个多视角条件路径,将物体生成锚定在多个有姿态的观测上。尽管模型完全在规范空间中的单一物体上进行微调,它无需任何场景级训练即可泛化到具有严重遮挡的大规模场景,展示了这一范式的可行性和可扩展性。我们进一步引入了UE-MeshyScene,一个包含数百个物体、逐物体标注和真实网格的密集杂乱场景的光照真实基准。在单物体、受控多物体和UE-MeshyScene评估中,我们的方法始终优于先前方法,并且随着场景复杂度和遮挡的增加,优势更为显著。最后,我们通过将生成的3DGS世界(如Marble和HY-World 2.0)转换为组合式网格场景,展示了更广泛的应用性。 |
| UniMate:一个统一模型以驱动多样骨骼动画 |
Linzhan Mou |
2026-09-04 |
PDF |
自动蒙皮技术的最新进展已能大规模生成可直接用于动画的3D资产,但生成驱动这些资产的运动仍是一大瓶颈。现有的学习型动画器受限于拓扑结构:它们依赖特定类别的模板,或在推理时需要针对每个骨架进行微调和参考动作。我们提出了UniMate,一个统一的基础模型,能够根据已蒙皮的3D资产和文本提示,为任意骨架合成关节运动,无需测试时优化或针对每个骨架重新训练。UniMate引入了一个拓扑感知的扩散变换器,通过三种机制将骨架拓扑整合到注意力中:(1)基于成对关节关系和测地距离的图感知注意力偏置;(2)一种谱旋转位置嵌入,通过图拉普拉斯算子将RoPE推广到任意运动树;(3)一个从静止姿态骨架中通过注意力池化得到的全局拓扑调节器。我们还整理了UniML3D数据集,包含13,006个运动序列,涵盖双足、四足、鸟类、海洋、昆虫、蛇形及关节刚体对象,并进行了统一的规范化和文本配对。在该数据集上训练后,UniMate在质量、泛化能力和效率上均优于最先进的基线方法,并支持零样本跨拓扑迁移、中间帧生成、扩展和文本引导编辑。我们的项目页面可在https://linzhanmou.com/unimate/访问。 |
| 面向基础时间序列模型分类的量子微调规模化探索 |
Sang Hyub Kim |
2026-09-04 |
PDF |
时间序列基础模型生成丰富的嵌入表示,但量子模型能否利用这些嵌入,以及混合经典-量子架构能扩展到何种程度,仍不明确。我们通过使用量子头对模型嵌入进行微调,针对电网事件分类(PSML-5)任务优化Chronos来解决这一问题。在汇总前按物理传感器类型对嵌入进行分组,已超越了该基准上最佳已发表基线;使用更细粒度特征时,量子头在相同输入上比更大的经典多层感知机在平衡准确率上高出1.7至2.0个百分点。然而,增益趋于饱和:超过某一点后,向相同固定宽度寄存器输入更多信息不再带来改进。我们证明瓶颈既非信息供给也非电路表达能力,而是数据摄入的带宽。为克服此限制,我们引入了翼模块,一种自包含的少量子比特电路,通过稀疏单向耦合向核心电路馈入额外信息。在预注册的四种子协议下,我们将翼附加到固定12量子比特核心及固定特征上。平衡准确率随每个翼的添加而提升,从无翼时的83.6%(13量子比特,含后选择量子比特)到两个翼时的85.2%(19量子比特)。消融实验表明,无新信息而扩大的电路无增益,而翼接收错误样本信息则会损害准确率。这些结果重新定义了量子微调的扩展方式:新增量子比特在携带新增输入时有帮助,而不仅仅是增加参数。翼模块为拓宽该带宽提供了一条模块化且稳定的路径。 |
| 超越标量灵活性:从合格的人工智能工作负载到可靠的负载缓解 |
Meiyi Li |
2026-09-04 |
PDF |
电网研究常将数据中心灵活性表示为负载的固定百分比,尽管没有任何公开的生产轨迹显示在事件持续期间有多少合格负载持续存在或跨集群协同移动。我们从155,410个GPU的185天轨迹中重建了4,439个每小时功率观测值,并推导出工作负载语义灵活性包络。该集群的时间平均蒙特卡洛中位数设施需求为55.8 MW,而在保留已分配GPU空闲功率后,即时合格削减平均为3.55 MW:占工作负载功率的12.1%和中位数设施功率的6.35%。在该资格完全实现下,95%可用缓解量从一小时的2.51 MW降至四小时的2.32 MW和24小时的1.95 MW;常见的可实现分数q精确地将每个值按q缩放。均值校准的标量将这些量高估了17%、25%和47%,而四小时尾部校准的标量将一小时产品低估了6%并将24小时产品高估了17%;重现该曲面的份额在不同持续时间和可靠性水平间变化达1.6倍。聚合13个集群将四小时稳固性从0.38提升至0.66,但跨集群协方差限制了增益。生产调度器几乎未暴露额外的基于延迟的容量:新可延迟到达平均为0.008 MW,且零95%可用容量。这些结果用持续时间、可靠性、组合和可实现性条款取代了假定的灵活性百分比,这些条款可写入互联和需求响应合同中。 |
| WearableQA:面向真实世界可穿戴数据的健康推理基准 |
Ji Soo Lee |
2026-09-04 |
PDF |
可穿戴传感技术的最新进展使得对生理和行为信号的连续监测成为可能,然而现有基准测试很少评估AI系统能否对真实用户的长期可穿戴记录进行推理。我们引入了WearableQA,这是一个基准测试,包含从200名真实用户的可穿戴时间序列、血液生物标志物和人口统计数据构建的4,084道10选项多项选择题,每位用户拥有长达500天的每日测量数据。WearableQA保留了真实可穿戴分布,包括设备噪声和个体间变异性。为评估不同的推理能力,我们引入了16种问题类型,沿两个互补轴组织:数据推理与健康推理,区分对纵向测量的计算与生理解释;以及单信号推理与跨信号推理,区分对单个信号的推理与多信号的整合。为大规模构建可靠问题,我们采用双重基础框架,结合文献基础的生理发现与统计验证的人群基础生理模式。这使得能够捕捉真实世界可穿戴数据中观察到的有意义关系。对14个专有和开源LLM的评估表明,WearableQA有效区分了模型能力,性能范围从19.6%到72.9%,而随机猜测基线为10%。此外,WearableQA远未解决:大多数模型准确率低于60%。总体而言,WearableQA为评估LLM对真实世界可穿戴数据的推理提供了一个现实且诊断性的基准测试。 |
| 扩散TV:通过有形、具身的交互体验扩散模型 |
Sihwa Park |
2026-09-04 |
PDF |
Diffusion TV是一个互动式AI艺术装置,通过改装过的CRT电视,为扩散模型提供了一种可触可感的具身体验。观众通过物理操控电视天线,控制AI生成图像和声音的清晰度,隐喻性地演绎了扩散生成背后的去噪过程。利用调谐旋钮,参与者可在三个频道间切换,这些频道分别展示来自过去(灭绝物种)、现在(濒危物种)和未来(推测性生物)的AI生成动物,将互动置于时间与生态的叙事框架中。通过持续的视听反馈和物理交互,Diffusion TV将生成过程置于最终输出之上,让观众得以将中间状态作为体验材料进行探索。该作品并未提供明确的技术解释,而是呈现了一种替代性的、具身的可解释AI模式,邀请人们对生成技术进行探索性参与和反思。 |
| RegionFed:面向异构零售环境中个性化查询理解的联邦学习 |
Quoc H. Nguyen |
2026-09-04 |
PDF |
零售搜索系统服务于具有不同查询模式、词汇表及产品偏好的地理区域,由此产生的显著数据异质性对隐私保护训练和模型个性化均构成挑战。联邦学习为隐私问题提供了自然解决方案,但标准联邦学习方法生成的全局模型会牺牲区域性能,而现有个性化联邦学习方法在参数层面操作,并因嵌入层绑定和层归一化交互而在现代Transformer模型上灾难性崩溃(在T5上准确率低于10%)。我们提出RegionFed,一种\textit{架构稳健}的联邦学习框架,通过完全在梯度层面操作来规避此问题。RegionFed利用区域梯度与全局梯度之间的$\ell_2$冲突作为统一信号,该信号能够(i)诊断异质性,(ii)将每个区域路由至成本最低的充分个性化策略,以及(iii)自适应控制个性化强度。由于将模型视为可微黑盒,RegionFed可在T5-Small、T5-3B、RoBERTa和CNN上零代码改动部署,在Transformer模型(参数层面方法崩溃之处)上带来显著提升,并在CNN上实现持续改进。在三个公开数据集(Amazon ESCI、Amazon Reviews、LEAF-FEMNIST)和四种架构上,RegionFed-Meta达到92.27%的准确率,缩小了与违反隐私的集中式上限(集中式+区域加权:92.04%,$\Delta$=0.23个百分点,在1$\sigma$范围内)的差距,同时提供$(\epsilon{\approx}0.60)$-差分隐私和$\mathcal{O}(1/\sqrt{T})$收敛速度。 |
| 相同轨迹,矛盾奖励(ROBORMBENCH):视觉语言奖励模型中的释义脆弱性 |
Wonje Jeung |
2026-09-04 |
PDF |
视觉-语言模型越来越多地被用作机器人学习中的奖励函数,但这一角色要求具备释义不变性:在语义等价的目标描述下,相同轨迹应获得相同奖励。我们表明,当前的VLM奖励模型常常违反这一性质。仅对指令进行改写就可能大幅改变预测的进度分数,甚至可能将相同的机器人行为从失败翻转为成功。为衡量这一失效模式,我们引入了ROBORMBENCH基准,包含2,390条真实机器人轨迹、真实进度标签以及21,673个经过验证的释义,涵盖词汇、句法和动作目标改写。在专有和开源的VLM中,释义引发的不稳定性普遍且严重,随着改写差异增大而加剧,并且不能通过模型规模或显式推理可靠地降低。使用轨迹监督训练的专用奖励模型则显著更稳定。这些结果表明,释义鲁棒性是机器人领域中基于VLM的可靠奖励建模的核心要求。 |
| 面向阿尔茨海默病相关脑MRI任务的通用特征提取器 |
Reza Rajabli |
2026-09-04 |
PDF |
当标记数据不足以充分训练深度学习模型时,迁移学习可以提供帮助。我们对其在神经影像学中的有效性,尤其是针对阿尔茨海默病研究,尚未完全理解。也不清楚这些迁移模型是否能在不针对每项特定任务重新训练的情况下,适用于新数据集。我们评估了一个紧凑的、有监督的预训练模型是否能作为下游神经影像任务的可复用基础模型。我们冻结了一个先前为脑龄预测训练的3D CNN的718万权重,并使用低秩适配(LoRA)将其适配到每项任务,仅需约1%的额外可训练参数。我们在六项实验中评估了泛化能力。将模型适配为在ADNI上区分认知正常与痴呆,在留出折上获得了0.964的AUC(实验#1)。将该适配模型不变地应用于OASIS-3,无需重新训练,获得了0.871的AUC(实验#2)。复用其输出logit连同年龄和认知评分,区分稳定与进展性MCI,AUC为0.828(实验#3)。将同一骨干适配为从结构MRI预测淀粉样蛋白阳性,AUC为0.804(实验#4)。最后,相同方法直接从T1w图像估计ICV归一化的海马体和白质低信号体积,R^2分别为0.80和0.91,这些任务通常需要更大的U-Net网络来处理(实验#5和#6)。因此,一个在脑龄上监督训练的紧凑模型可以作为可复用的骨干,通过约1%的额外参数适配到每项任务,并在无需任何训练的情况下迁移到未见过的队列。我们的发现表明,一个精心训练的脑龄模型可以作为阿尔茨海默病相关任务的有效基础模型,即使在严格的数据限制下也是如此。 |
| 从可解释性方法到可解释模型 |
Julien Colin |
2026-09-04 |
PDF |
十余年过去,面向计算机视觉的可解释人工智能(XAI)已构建起一套成熟的工具箱:涵盖归因、特征可视化、基于概念及基于电路的方法。然而,该领域几乎全部精力都投入于构建和比较这些方法,却很少关注它们本应回答的问题——我们的模型可解释性如何,以及随着模型演进,我们是否在取得进展?我们主张将领域焦点从方法转向模型,沿两条互补路径推进。其一已触手可及:现有工具使我们能够刻画并比较不同模型所表征和计算的内容。其二则更为艰难,且在很大程度上被忽视:模型能否真正被依赖它的人类所理解——这些独立评估者关乎信任与认证,而非那些仅确认自身预期的专家。这只能通过测量获得,无法凭推断得出。我们回顾了为何现有工具箱已足够成熟以支撑这两条路径,综述了比较模型的少量研究,借鉴系统神经科学的平行视角,并以一项以模型为中心的XAI议程作结。 |