跳转至

arXiv 2026-07-23

标题 作者 发布日期 PDF链接 摘要
ATSplat:基于自适应令牌扩展的紧凑型前馈式三维高斯泼溅 Cho In 2026-07-22 PDF 3D高斯泼溅(3DGS)通过在三维空间中优化自由放置的基元并在欠重建区域自适应稠密化,实现了高质量的新视角合成。然而,现有前馈式3DGS方法大多丢失了这种场景自适应容量分配能力——这些方法通常将高斯函数回归到输入像素上,并沿相机射线提升。这种像素对齐的公式使得基元的数量和位置取决于图像分辨率和输入视角而非场景复杂度,导致生成密集且往往冗余的高斯集合。我们提出ATSplat,一种通过自适应三维令牌恢复3DGS优化中自适应分配能力的前馈式3DGS框架。ATSplat首先将粗粒度的块级深度和相机线索提升为稀疏的三维锚点令牌,形成场景的紧凑骨架。随后每个令牌通过可学习的三维偏移回归为局部高斯函数,将基元放置与输入图像网格解耦。自适应令牌扩展模块通过渲染误差图监督预测令牌级不确定性分数,并通过可学习扩展层选择性扩展高不确定性令牌。这种从稀疏到自适应的公式使ATSplat能够在保持紧凑表示的同时,将基元集中于挑战性区域。在RealEstate10K和DL3DV两个代表性数据集上的实验表明,ATSplat在实现最先进渲染质量的同时,相比密集前馈式3DGS方法将高斯数量减少了5.7倍以上。从12张512×960分辨率的输入图像出发,ATSplat使用单块商用GPU可在不到一秒内完成重建,并以仅311K个高斯函数实现1136 FPS(512×960分辨率)的高质量新视角渲染。
随机函数的Lipschitzian强大数定律 Lai Tian 2026-07-22 PDF 我们证明了在Lipschitz伪度量下局部Lipschitz函数的强大数定律。我们的结果在拓扑条件或模型论条件下成立,后者涵盖在o-minimal结构中共同可定义的函数,但显著扩展了该类。应用包括极限和Clarke次微分的均匀收敛以及解的有限样本识别。因此,我们识别出广泛的函数类,在这些类中,我们先前负面结果[Tian and Royset, arXiv:2511.16568, 2025]揭示的失效现象不会发生。
LKValues:使大型语言模型与斯里兰卡社会价值观对齐 Nethmi Muthugala 2026-07-22 PDF 大型语言模型(LLMs)的价值对齐已被证明存在文化偏见,倾向于西方规范。这导致在斯里兰卡等拥有独特文化动态的多语言社会中,本地价值观被错误处理。现有基准测试忽视了斯里兰卡官方语言僧伽罗语中的本土化价值观,阻碍了文化敏感性的评估与微调。为填补这一空白,我们提出LKValues——首个基于调查的斯里兰卡价值对齐资源套件。通过对205名受访者进行三语调查,融合改编的全球框架与LLM引导的本地构念,我们提炼出40项多数人认可的社会价值观。基于这些价值观,我们构建了LKvaluesIT(一个包含15万条场景化实例的僧伽罗语-英语新闻衍生指令语料库)和LKvaluesBench(一个包含1000条实例的价值敏感评估基准)。我们使用LKvaluesBench评估了一系列专有及开源权重LLM,并对三个开源基础模型(Qwen3.5-4B-Base、Qwen3.5-9B-Base和Aya-Expanse-8B-Base)进行微调。实验表明,更新更大的LLM仍存在低资源和文化价值对齐差距。LKValues微调提升了Qwen系列模型在英语和僧伽罗语中的表现,减少了无效输出和跨语言差异,但改进效果仍依赖模型家族。这些结果凸显了LKValues在嵌入斯里兰卡价值观方面的有效性,为低资源、国家特定多元价值对齐提供了可复现的流程。数据集公开于https://github.com/NextME14/LKValues。
SoftReason:一种面向高维感知数据的全可微神经-软-符号演绎推理架构 Wael AbdAlmageed 2026-07-22 PDF 在许多推理问题中,前提并非以离散符号形式被观测到,而必须从高维输入中推断得出。此外,谓词词汇表、论元结构及可信证据由知识图谱或规则定义提供。经典的神经符号流水线在感知与演绎之间存在离散接口。我们提出一种神经软符号架构,用于对潜在感知事实和知识提供的谓词进行可微演绎推理。SoftReason通过将演绎状态表示为候选常量和谓词上的局部软解释张量,消除了梯度断层。感知模块提出概率性基本事实,知识图谱三元组以高置信度软证据形式输入,每个查询锚点、谓词选择及闭包更新均保持可微性。我们的核心创新在于对即时推论算子进行可微学习提升。该算子利用谓词定义嵌入和潜在组合通道形成软体谓词混合,聚合所有可能见证,提出查询条件化的头部事实,并通过单调概率OR更新解释。我们在知识感知视觉问答任务上实例化该框架,展示了SoftReason如何在一个可训练架构中支持端到端感知基础、知识图谱证据注入及可微演绎闭包。
使用虚拟现实与强化学习实现微型人形远程运动操控 Nicolas Kosanovic 2026-07-22 PDF 近年来,全尺寸人形机器人的能力呈指数级增长,其目标是在人类环境中实现通用化部署。制造商普遍采用的控制方法结合了虚拟现实的上半身远程操控与强化学习的下半身平衡与运动控制。通过这种方式,单个远程操作员能够观察、操控并导航至真实的远程物理环境。这种强大的控制栈通常仅应用于昂贵的全尺寸机器人,而许多此类机器人对研究社区而言难以获取。微型人形机器人虽更为普及,但其设计仿生性较低(例如传感器数量、自由度等较少),且缺乏类似的技术进展。本文描述了一套专为微型人形机器人从零开发的全身远程临场感控制栈。基于ROBOTIS OP3硬件的框架实验展示了独立于手臂运动的行走能力,最高速度达0.45米/秒。通过专家操作员进行的立方体搬运实验,验证了远程操控-运动-操作能力。平均而言,远程操控系统在10分钟内移动了2个40克的不同立方体,总行走距离达5米。总体而言,所开发的系统展现了微型人形机器人远程操控-运动-操作的潜力。
PercepCap:具有结构化时空感知能力的视频字幕生成器 Yifan Xu 2026-07-22 PDF 视频描述需要对视频进行细粒度的时空理解,包括物体所在位置的空间感知以及事件发生时间的时序感知。现有多模态大语言模型通常直接从视频输入生成描述,而不展示描述背后的感知证据。因此,时空感知中的错误仅在最终描述中显现,难以直接定位潜在的感知错误。为解决这些问题,我们提出PercepCap,一种感知感知型视频描述框架,在生成最终描述前先明确感知证据。具体而言,PercepCap遵循"感知-描述"生成链:模型首先生成包含物体轨迹和时序事件的时空感知轨迹,然后基于感知证据生成最终描述。为此,我们设计了两阶段训练策略:先感知后描述的监督微调将模型从仅生成描述调整为提出的感知-描述链,而基于感知的强化学习则通过联合奖励优化感知轨迹和描述质量。为支持两阶段训练,我们引入描述锚定感知数据构建流程。该流程通过首先生成纯描述、提取其中提及的物体和事件、并在视频中用边界框和时间戳进行定位,构建SFT和RL训练数据,从而获得与描述对齐的感知数据,提供可靠的训练真值,确保显式感知轨迹与最终描述指向相同的物体和事件。在直接描述和描述转问答评估中,PercepCap在Qwen3-VL基线基础上持续改进,展现出领先的描述质量。
波斯像素:面向波斯语的大规模合成OCR数据集 Pouria Mahdi 2026-07-22 PDF 波斯语的光学字符识别(OCR)技术成熟度仍远低于拉丁字母语言,尽管波斯语在多个国家拥有超过1.1亿使用者。这一差距源于两个根本性挑战:波斯-阿拉伯文字系统本身的复杂性,以及大规模高质量标注数据集的匮乏。波斯文字具有强制性连写特性、上下文相关的字形变形、大量连字、变音符号位置规则,以及Naskh体和Nastaliq体等书写形式的风格差异,这些因素都显著增加了文本识别的难度。与此同时,人工标注的高昂成本和劳动密集型特性造成了持续的数据瓶颈,限制了稳健OCR系统的开发,也延缓了波斯语文献数字化的进程。 本文提出Persian Pixel——一个专门应对上述挑战的综合合成OCR数据集。该数据集包含超过34.3万对高保真图像-文本对,覆盖句子、段落和整页文档布局,所有数据均基于精心筛选的700万词波斯语语料库,通过SynthOCR-Gen渲染框架生成。生成流程忠实还原了波斯文字排印特征,包括上下文字符连接、位置变体字形、变音符号放置,以及多种代表性波斯字体。为弥合合成数据与真实数据的领域差异,渲染图像进一步经过25种以上随机退化模型增强,模拟真实文档采集过程中出现的墨迹渗透、纸张老化、模糊、光照变化、扫描仪缺陷、压缩伪影及多种噪声干扰。 通过突破长期存在的波斯语OCR标注数据短缺问题,Persian Pixel为训练和微调现代OCR架构(包括TrOCR和Donut等基于Transformer的模型)提供了可扩展的开放资源。该数据集为波斯语文献分析、历史手稿数字化及端到端文档理解研究奠定了坚实基础,同时证明程序化合成数据生成是推动低资源且文字系统复杂语言OCR发展的实用、经济且可扩展的替代方案。
FMRP-LEAN:一种符合HIPAA标准的AI增强型LIMS架构,用于端到端临床检测工作流优化 Eva McCord 2026-07-22 PDF 在转化研究环境中,临床生物标志物工作流程通常依赖电子表格驱动的追踪、人工质控(QC)核对以及松散集成的系统,导致状态可见性有限、报告延迟以及运营风险增加。这些挑战在多日检测中尤为突出,例如基于Luminex技术的脆性X信使核糖核蛋白(FMRP)定量检测,此类检测需要符合HIPAA标准的数据治理、确定性的工作流推进,以及实验室与临床团队间的协调沟通。本文提出FMRP-LEAN系统——一种符合HIPAA标准、经AI增强的实验室信息管理系统(LIMS)架构,通过具有显式转换守卫和驻留时间可观测性的有限状态工作流模型,实现生物样本全生命周期管理的规范化。该系统集成了部署于医院可控基础设施内的自托管Supabase/PostgreSQL技术栈、混合边缘-内部隔离机制(含加密隧道与仅回环服务),以及双向REDCap同步功能。基于统一MRN-UUIDv7标识符框架与QR码追踪,确保在受保护健康信息(PHI)驻留约束下实现可溯源的临床-研究关联。FMRP-LEAN集成了自动化统计质控预筛查模块,以及受治理约束的AI操作模块(该模块仅对聚合投影进行操作,并具备确定性回退保障)。实际部署表明,该系统提升了工作流可观测性,降低了质控延迟,并增强了实验室技术员、研究协调员及面向患者团队之间的跨角色透明度。该架构为受监管医疗环境中的安全、状态显式且经AI增强的临床研究工作流提供了可复现的模型。
训练模型,而非读者:面向可验证激活解释的可解码性监督 Hiskias Dingeto 2026-07-22 PDF 自然语言自编码器通过重构来评估隐藏激活的解释:若能从解释中重新生成激活,则该解释被视为忠实。该测试对单个错误声明结构上不敏感:若翻转某个声明不改变重构结果,则该声明永远不会受到惩罚。我们展示了该测试可通过两种方式通过,但两者均不忠实。在已发布的Qwen-2.5-7B语言化器上,解释的重构效果显著高于随机水平,但仅有约2%的具体声明依赖于重构,因此评分追踪的是主旨而非具体事实。在精确合成真实标签下,标准流程在5/5次运行中发展出共适应私有编码(重构依赖的错误措辞),且不改变目标模型的修复措施无效。我们贡献了两种审计协议:基于真实标签的交叉验证与评估器交换,以及RECAP(通过协同训练辅助预测器实现可读编码):与目标模型并行训练的线性头,用于保持指定内容的可解码性。在RECAP训练的沙盒模型上,新语言化器能真实陈述指定内容且编码消失,代价仅为+0.001纳特。该结果在预训练的Pythia-160M上复现:内容变得可靠地可探测解码,尽管新语言化器仅部分传递该内容(真实度0.44-0.46,对照接近零)。对于可解释性,高重构不能验证单个声明。对于AI安全,RECAP使指定内部内容可通过探测独立验证,而非依赖模型可能操纵的散文断言:独立探测对语言化器的真实声明评分高于虚假声明(AUC 0.96,无RECAP时为0.82)。面对通过编辑解释以最大化重构分数同时说谎(抑制约87%的谎言惩罚)的对手,RECAP探测仍能识别谎言(AUC 0.95),而对照探测降至随机水平(0.51)。
PG-KINN:一种用于求解正问题和反问题偏微分方程的物理信息Petrov-Galerkin Kolmogorov-Arnold网络 Amirhossein Sadr 2026-07-22 PDF 物理信息学习偏微分方程(PDE)长期由多层感知机(MLP)主导,但其频谱偏差和密集参数化限制了准确性与可解释性。Kolmogorov Arnold网络(KAN)通过可学习样条激活函数,在结构上与经典离散化方法的分段多项式基函数对齐,从而缓解了这些局限。然而,PDE转化为损失函数的方式与近似器的选择同等重要:强形式残差最小化需要高阶导数和重加权损失,能量(Bubnov-Galerkin)形式仅适用于自伴算子且对参数识别问题会退化为平凡解(如我们所示),边界积分形式则需已知基本解。我们提出PG-KINN——基于Petrov-Galerkin格式的物理信息KAN,其中试验空间为KAN,测试空间为独立、紧支撑的分段多项式空间,并通过Gauss-Legendre求积计算。分部积分降低了微分阶数,同时保持对一般非自伴、非线性和反问题的适用性;局部化测试函数将全局残差转化为一组条件良好的单元弱残差。在涵盖裂纹奇异性、应力集中、Neo-Hookean超弹性、非均匀介质参数反演及复杂几何的基准测试中,PG-KINN持续优于传统MLP基线及基于KAN的最优强/能量/反演格式(PIKAN)。这些结果确立了KAN试验空间与多项式测试空间的Petrov-Galerkin耦合作为AI计算力学中稳健且精确的路径。