跳转至

arXiv 2026-06-24

标题 作者 发布日期 PDF链接 摘要
DiffusionBench:扩散Transformer的整体评估 Xingjian Leng 2026-06-23 PDF 扩散Transformer(DiT)在图像生成领域的研究已收敛至单一评估框架:基于ImageNet的类别条件生成。尽管各类方法持续提升FID及相关指标,但这些指标能否反映生成建模的真实进展愈发存疑。作为自然替代方案,文本到图像(T2I)生成常因训练与评估成本过高或操作不便而被研究者跳过。我们论证这一认知已不再成立。现提出NanoGen——统一DiT训练与评估框架。该框架在ImageNet上达到当前最优DiT基线水平,仅需修改12行配置即可训练出具有竞争力的文本到图像模型。目前支持RAE、VAE、像素空间及MeanFlow扩散方法在ImageNet与T2I两种设定下的应用。在NanoGen框架下,训练T2I模型所需算力与ImageNet相当。通过训练21个潜在扩散模型,我们观察到方法排名在ImageNet与T2I生成任务间无显著相关性:三项指标的皮尔逊相关系数介于-0.377至-0.580之间。这表明提升类别条件ImageNet FID的方法未必能带来T2I性能的相应提升,明确揭示了在两类任务上评估DiT的必要性。为此,我们整合ImageNet与文本到图像结果,构建了DiT研究综合基准DiffusionBench。建议研究者以DiffusionBench替代单一ImageNet评估:能提升DiffusionBench的方法更可能反映生成建模的实质性进展。
InSight:通过可操控的视觉-语言-动作模型实现自主技能习得 Maggie Wang 2026-06-23 PDF 视觉-语言-动作(VLA)模型能够通过演示学习操作技能,但其能力受限于训练数据中的技能范围。我们提出InSight框架,通过使VLA在原始动作层面(例如"将夹爪移至碗边"、"向上提起"、"倾倒瓶子")具备可操控性,解锁自主技能获取能力。InSight包含两个核心阶段:(1)自动化分割流程,通过VLM计划分解与末端执行器位姿将演示分割为带标签的原始动作,实现VLA原始动作可操控性;(2)VLM引导的数据飞轮,识别完成新任务所需的缺失原始动作,自主尝试通过VLM提出的底层控制执行缺失动作的演示,并自动对成功演示进行标注、存储与整合至VLA训练集。我们在仿真与真实世界操作任务中评估InSight,包括方块翻转、抽屉关闭、清扫、旋转和倾倒,全程无需任何目标技能的人类演示。习得这些原始动作后,无需额外人类演示即可组合执行新颖的长时域任务。实验结果表明,原始动作可操控性为VLA策略的持续技能获取提供了实用基础。项目网站:https://insight-vla.github.io
BenchX:针对人口统计与协议偏差的AI癌症检测与定位模型基准测试 Qi Chen 2026-06-23 PDF 人工智能在医学影像领域取得了显著成功,但业界普遍认识到这些模型在真实临床环境中的表现往往不一致。当患者人口统计学特征和成像方案存在差异时(例如检测小肿瘤、分析不同对比剂时相的扫描图像,或评估不同年龄/性别的患者),这种不一致性尤为突出。为量化这些差异,我们构建了包含85,355例CT扫描的大规模开放基准测试,系统评估了12个肿瘤检测AI模型在肿瘤大小、位置、患者亚组及成像方案维度上的表现。我们利用大语言模型从临床数据中提取并组织亚组信息,使分析兼具可扩展性与可复现性。基准测试表明,当前以平均准确率为优化目标的先进AI模型,在年轻非裔美国女性等罕见或代表性不足的亚组中表现欠佳。然而为这些罕见病例收集充足的标注数据往往不切实际。本基准测试为构建更可靠稳健的肿瘤检测AI模型奠定了基础,并凸显了在医学影像与计算机视觉领域开展严格亚组级评估的必要性。数据集、代码
随机次梯度方法最后迭代的新界 Guglielmo Beretta 2026-06-23 PDF 我们研究一维凸Lipschitz目标函数下随机次梯度方法的最后迭代。对于固定时间范围$n$,考虑标准固定步长$η=Θ(1/\sqrt n)$。我们证明,在此类步长策略下,若加性独立同分布次梯度噪声具有一致有界方差,则最后迭代的优化误差为$1/\sqrt n$量级,从而消除了现有通用界中多余的$(\log n)$因子。另一方面,我们证明在没有独立同分布假设的情况下,优化误差可达$(\log n)/\sqrt n$量级。因此,仅凭一致有界方差假设,即使在一维情形下,SsGM的最后迭代也是次优的,这否定了Koren和Segal在COLT 2020中提出的一个开放问题。
FLAT:面向几何精确场景生成的前馈潜在三角泼溅 Orest Kupyn 2026-06-23 PDF 从单张图像生成可探索的3D场景需要强大的生成先验和适用于下游任务的精确几何表示。当前视频扩散模型能够生成高质量内容,并在隐空间中隐式编码多视图几何结构。然而,现有的前馈隐场景解码器通常输出缺乏明确表面的体积3D高斯体,限制了其在仿真或标准图形管线中的应用。这促使我们解码与表面对齐的基元,这些基元不仅可渲染,而且更接近显式几何资产。我们探究是否可以将压缩的视频扩散隐空间直接映射为单次前馈中的显式表面基元。为此,我们提出FLAT,首次证明三角形面片可以直接从视频扩散隐空间解码。与解码3D高斯体相比,预测平面基元因对基元方向高度敏感而更具挑战性,常导致梯度流不佳。FLAT通过两个关键组件解决该问题:用于三角形回归的射线中心旋转参数化,以及改进可微三角形渲染中梯度流的新型乘积窗口函数。在标准基准测试中,FLAT在保持与最先进前馈基线相当的视觉质量的同时,实现了显著更优的几何精度。我们进一步证明,轻量级测试时优化步骤可将预测的三角形网格转换为完全不透明、支持游戏引擎的实时渲染表示。通过在相同训练设置下评估3DGS、2DGS和三角形面片变体,我们首次系统分析了前馈场景生成中不同表示的权衡。项目页面见https://flat-splat.github.io
FLUX3D:基于扩散对齐稀疏表示的高保真3D高斯生成 Haorui Ji 2026-06-23 PDF 稀疏体素表示已成为图像到三维高斯泼溅(3DGS)生成的可扩展基础,但现有方法因两个结构性瓶颈难以保留输入图像的高频视觉细节。首先,现有方法采用针对语义抽象优化的判别式二维特征来构建稀疏体素潜在表示,这抑制了重建线索并导致表征瓶颈。其次,在生成阶段,标准扩散变换器缺乏有效机制将密集的二维图像标记与稀疏的三维体素潜在表示对齐,导致跨模态对应瓶颈。为解决这些问题,我们提出FLUX3D——一种可扩展的图像到3DGS框架,在生成过程中同时提升表征学习与跨模态对齐能力。我们首先重新审视基于稀疏体素的三维表征学习中的二维特征选择,提出扩散对齐结构化潜在表示(DA-SLAT),并将其与仅解码器架构结合以提升3DGS重建保真度。我们还设计了稀疏结构感知扩散框架,集成稀疏结构多模态扩散变换器(SMDiT)与模态感知旋转位置编码(MARoPE),实现几何无关的二维-三维对齐。大量基准实验表明,FLUX3D在外观保真度上取得显著提升,并在生成高质量3DGS资产方面全面超越所有现有最优方法。
以“放大视角”审视作为辅助技术的智能网页浏览器:一项与低视力技术专家的案例研究 Laura Colazzo 2026-06-23 PDF 由大语言模型驱动的智能网页浏览器正逐步成为能够代表用户自主浏览网络的系统。除了提升生产力,这类技术作为面向视障群体的辅助工具展现出巨大潜力,能将网页交互转化为流畅的对话式交流。本文通过一位低视力技术专家的案例研究,探讨智能网页浏览器如何支持视障用户进行网络导航。研究结果表明,尽管当前存在局限性,但导航体验已展现出显著的流畅性与灵活性,凸显了智能网页浏览器在增强网页交互无障碍性、降低使用障碍方面的强大潜力,其影响可能超越无障碍领域,延伸至更广泛的智能用户体验设计。
OpenThoughts-Agent:面向智能体模型的数据配方 Negin Raoof 2026-06-23 PDF 智能体语言模型极大地拓展了人工智能的应用范围,但关于如何为通用型智能体筛选训练数据,目前公开信息甚少。现有的开源项目(如SWE-Smith、SERA和Nemotron-Terminal)通常针对单一基准测试,未能解决如何训练模型以泛化至多样化智能体任务的问题。OpenThoughts-Agent(OT-Agent)项目通过构建完全开源的数据筛选流程,填补了这一空白。我们开展了超过100项受控消融实验,系统性地探究流程的每个阶段,揭示了任务来源与多样性的重要性。随后,我们利用该流程构建了包含10万条样本的训练集,并基于此数据集对Qwen3-32B模型进行微调,使其在七项智能体基准测试中平均准确率达到44.8%,较现有最强的开源智能体数据模型(Nemotron-Terminal-32B,40.9%)提升了3.9个百分点。此外,我们的训练数据展现出强大的扩展特性,在计算资源受控的对比中,无论训练集规模如何,均优于其他开源数据集。我们已在openthoughts.ai公开发布训练集、数据流程、实验数据及模型,以支持未来智能体模型训练领域的开源研究。
复杂之困:关于AI赋能辅助沟通接口的设计与评估 Blade Frisch 2026-06-23 PDF 人工智能(AI)能够提升使用辅助与替代沟通(AAC)系统用户的操作能力。然而,评估AI驱动的AAC界面存在困难。人类是具有交叉性的存在,当前评估指标难以捕捉人们对AAC系统可能存在的多元且细微的需求。我们探讨了六个AAC问题空间的复杂性,分析了AI在这些空间中的应用潜力,并提出更完善的评估方法,以充分考虑人类身份的交叉性特征。同时,我们讨论了这些不同问题空间中存在的共性议题,以及如何通过所提出的评估方法加以解决。
神经算子中的实谱基与复谱基:格林函数对齐的作用 Jason Sulskis 2026-06-23 PDF 傅里叶神经算子(FNO)通过在复数傅里叶域中参数化全局卷积来学习偏微分方程的解算子。对于实值PDE解,复数FFT通过共轭对称性引入了表示冗余。我们提出哈特利神经算子(HNO),它是FNO的精确实值镜像:用纯实数的离散哈特利变换替代FFT,并为每个保留的频谱模式学习单个实数乘子,无需复数运算。由于实数哈特利谱不会被共轭对称性减半,HNO保留的频率角点数量是FNO的两倍,但每个频率角点仅需一个实数权重(而FNO对应一个复数对),因此两者在相同宽度下参数数量相等,仅频谱基函数不同。我们的核心论点是:最优基函数取决于算子本身的属性。自伴椭圆算子(泊松方程、双调和方程)具有实对称格林函数,实数哈特利乘子可精确对角化此类算子,因此HNO在此类问题中占优。含时算子包含相位信息(从波动方程的振荡到对流、Burgers和Navier-Stokes方程中的输运现象),实数对角乘子无法表征相位,因此FNO在此类问题中占优,且优势随算子相位含量增加而增强,无相位的热方程则处于临界状态。通过相同方式训练两种算子,并在不同PDE类型、初始条件族和边界条件下进行基准测试,我们发现椭圆型与含时型算子的性能差异与算子相位含量单调相关,且与我们发展的格林函数理论完全吻合。我们的研究结论并非给出普适最优解,而是提供预测性准则:将频谱基函数与解算子的对称性相匹配。