| 时间自蒸馏:无监督学习视频中的视觉状态跟踪 |
Shravan Venkatraman |
2026-09-03 |
PDF |
我们提出S$^3$T(时间上的自监督自蒸馏),据我们所知,这是首个完全自包含的连续视频状态跟踪框架。我们的方法将时间采样密度视为特权信息,基于假设:同一片段更密集的视图能更准确地恢复运行状态。该视图作为教师,而具有相同权重的稀疏视图学生则学习匹配其下一个令牌分布。模型自行生成目标,因此训练无需标签、独立教师或奖励信号,且不增加推理成本。在LLaVA-OneVision-2-8B上,S$^3$T将VSTAT准确率提升$+1.74$(单模型)、$+2.38$(通过模型汤)、$+2.70$(额外视觉编码器适应),而先前的自进化方法几乎未改变状态跟踪。从无标签合成片段学到的能力可迁移至真实视频,在VSTAT-YouTube状态跟踪问题上提升$+7.95$,在MVBench动作计数上提升$+4.50$。 |
| TokenMatch:基于曲率引导分词的三维网格对应Transformer |
Adeela Islam |
2026-09-03 |
PDF |
尽管基于数据驱动的三维形状对应估计近年来取得了显著进展,但在部分观测和强非等距变形下的鲁棒匹配仍然具有挑战性。现有的学习方法通常依赖手工设计的描述符或基于模板的表示,而近期基于函数映射的生成模型则面临推理成本高、可解释性有限以及对部分形状泛化能力差的问题。针对这些局限,本文引入了TokenMatch,一种新的基于Transformer的统一模型,用于估计三维形状对应关系。我们的前馈方法仅在BeCoS(一个具有挑战性的非等距部分到部分形状匹配数据集)上训练,能够无需重新训练或微调即可泛化到完整形状的匹配。TokenMatch利用自注意力和交叉注意力机制,高效学习补丁级和点级关系以及形状对之间的稠密对应。我们的核心洞见是,网格可以通过形状曲率引导自适应地标记化为补丁,从而有效学习用于对应估计的形状特定几何描述符。我们在标准基准上评估了TokenMatch,包括部分和完整形状匹配的CP2P、PSMAL、BeCoS、FAUST、SCAPE和SHREC'19。我们的方法在平均测地误差和交并比指标上持续取得高性能,在大多数情况下优于现有部分和完整形状匹配方法,同时以亚秒级推理速度运行更快。 |
| Scal3R:面向可扩展在线三维重建的高效多相对位姿查询学习 |
Chin-Yang Lin |
2026-09-03 |
PDF |
在线3D重建模型在长视频上表现不佳。这是因为相对于固定的首帧锚点回归位姿,迫使模型外推到远超训练分布的范围。微小的漂移不断累积并放大,导致显著的几何塌陷。然而,我们观察到,在此失败过程中,逐帧深度保持稳定。骨干网络的局部几何结构完好无损;只有全局位姿头失效。受这种解耦现象的启发,我们提出了Scal3R。该方法将在线重建重新表述为多参考相对位姿查询。我们使用轻量级可学习令牌,其参数约占全部参数的1%,并通过非对称注意力将其注入完全冻结的骨干网络。这种设置相对于多个过去的关键帧查询位姿。一个带有闭环的在线位姿图优化系统抑制了长距离漂移。Scal3R在单个GPU上8小时内达到收敛。与在线基线相比,它在KITTI上将平均ATE降低了超过60%。它还在Virtual KITTI、Sintel、TUM-Dynamic、ScanNet和7-Scenes上达到了最先进的性能。项目页面:https://linjohnss.github.io/scal3r/ |
| 《原理》:视频模型的关联物理测试 |
Varun Varma Thozhiyoor |
2026-09-03 |
PDF |
在视频模型中评估物理推理能力颇具挑战,因为绝对运动测量依赖于帧率、物体尺度及相机校准,而这些因素在生成视频中往往模糊不清或不可获取。我们提出了一种不同的方法。当同一场景中的两个物体遵循相同的物理定律时,它们的运动必须满足可预测的关系,且这些关系独立于校准而成立。我们引入了Principia基准,通过配对物体间的相对一致性来评估牛顿物理。Principia涵盖八种现象——重力、恢复系数、摩擦、转动惯量、抛体运动、动量、摆和质量-弹簧振荡——涉及平移、旋转、碰撞和振荡动力学,采用受控协议记录的真实场景。我们还引入了一种独立于校准的一致性评分,直接在图像空间中量化物理违背程度。在来自六个最先进视频生成器的数千次生成中,尽管所有模型在VBench上得分约0.8,但没有模型在Principia上超过0.42。我们还评估了视觉-语言模型检测相对物理违背的能力,最佳模型准确率仅为67%,多数模型表现接近随机水平。 |
| 通过训练进行编译:将自然语言规范转化为局部神经函数 |
Yuntian Deng |
2026-09-03 |
PDF |
许多重复出现的文本函数易于描述,但难以用规则实现,而针对每个输入调用大型远程模型会带来重复的成本、延迟以及对提供商的依赖。我们提出“通过训练进行编译”,将自然语言规范转化为可复用的神经函数。在编译时,教师模型生成任务特定的示例,用于训练一个小型适配器,以适配一个紧凑的解释器。由此产生的函数无需教师模型即可运行,并且可以像普通软件一样存储、版本控制和组合。在FuzzyBench-Hard上,这是一个Program-as-Weights快速编译器未产生任何精确匹配的子集,通过训练进行编译达到了83.6%的语义准确率。这种更高的准确率伴随着更高的编译时成本:大约需要一分钟,而快速编译器只需几秒钟。我们将该编译器部署在一个公共交互式服务中,并展示了编译函数在多站点网站助手、语言控制的3D虚拟形象以及双向英语-克劳迪什翻译器中的应用。 |
| 清洁工程,不稳定测量:共享端点上黑盒LLM观察者的预注册信度失效 |
Haoyaun Zhu |
2026-09-03 |
PDF |
语言模型裁判现在把关训练数据、给生成结果打分、并驱动排行榜。裁判因此成为一种测量工具,它建立在一个很少被言明的假设之上:同一个请求,发送给同一个模型名称,明天读起来是一样的。我们在两项预先注册的活动中审计了这一假设,所有阈值均事先固定;两者都未能通过其工具的验证阶段。在总共52,988次被审计的请求尝试中,同一窗口内的重复排名一致性为Spearman 0.400,而要求为0.90;字节完全相同的次日重放一致性为0.78,而要求为0.99,每次执行记录都处于上限水平。三种机制解释了这一差距:一种标签到含义的映射,其偏差强度与信号本身相当;候选差距比工具自身噪声底限低七个数量级;以及字节相同输入返回不同排名,这种噪声被精确排列读数进一步放大。在测试的网格上,指标替换或采样均未能修复问题。预先注册的后续研究界定了问题范围:等待在所采样的天数上没有帮助(0.805对0.800,并在另外五天重复验证);更换提供商没有帮助(四个提供商共享同一底限,中位数0.74至0.88,且它们暴露的元数据字段均无法预测);在批量不变内核上自托管仅在服务器空闲时有帮助;而在已知差距的构造错误上,读数的区分度跟随错误类型而非大小。我们将证据提炼为一个三级快照身份阶梯、八条设计规则和一份报告清单;一项约为研究调用量2%的试点本可提前暴露这两个不可达的门槛。所有结果均涉及共享服务基础设施上的外部可测行为。在共享端点上,模型名称并非冻结的工具;预先注册的评估必须在冻结任何门槛之前先测量其工具。 |
| ESPO:通过诊断、多样化与稳定化实现错误结构化提示优化 |
Lihao Liu |
2026-09-03 |
PDF |
进化提示优化器如GEPA存在提示膨胀问题:每次迭代都会附加规则和注意事项,导致提示长度增加至3倍,但准确性并未提升。我们将此归因于三个缺陷——错误观察不完整、搜索多样性有限及选择不可靠——并提出ESPO(错误结构化提示优化),它将提示优化分解为三个阶段:诊断阶段在一轮内将所有训练错误聚类为结构模式;提议阶段通过四种具有独立偏见的互补策略生成候选;选择阶段应用自助法稳定性选择。在七个公开NLP基准测试——Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer和PUPA上,ESPO相比最先进方法平均准确率提升+3.76个百分点(74.67%对比GEPA的70.91%),在每个数据集上均达到或超过GEPA,同时生成的提示缩短47%(1,004字符对比1,878字符),推理速度更快。跨模型实验在四个额外学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)上显示,ESPO在每个测试模型上均取得最佳平均准确率,其中在Qwen3 GSM8K上差距最大(15.00%提升至91.40%)。泛化界限(见附录)将每个阶段与测试时差距的相应项联系起来,消融实验证实了一个关键预测:在无自助法选择的情况下增加多样性实际上会损害性能(-1.20%)。 |
| Puffin-World:以原生3D世界状态扩展统一多模态模型 |
Kang Liao |
2026-09-03 |
PDF |
我们提出Puffin-World,一种统一的多模态架构,集成了物理理解、空间模拟以及3D世界生成与重建,无需依赖外部离线模块。为可靠构建并交互3D世界,我们的框架联合建模三种原生世界状态:物理(重力场和纬度)、几何(深度)和外观(图像),并配以统一的Omni-Camera表示,支持多样任务和灵活运动。除建模这些状态外,我们引入一种跨未来帧传播物理动态的策略。通过将绝对相机属性锚定于真实世界,Puffin-World实现物理一致且视觉稳定的世界生成。我们进一步将外观和几何耦合于单一生成过程中,联合合成每个未来视图并重建其底层几何。这一统一范式支持需要多任务协同的交错闭环应用,包括模仿和自我校准的世界探索。为将Puffin-World扩展至复杂场景,我们构建了Puffin-16M,包含1500万个视觉-语言-相机三元组和100万条具有多样且挑战性运动的轨迹。为促进该领域的进一步研究,我们发布了代码、模型和数据集。 |
| 可读性不等于可解释性:思维链推理中评判重要性与实际重要性的比较 |
Kevin Du |
2026-09-03 |
PDF |
思维链模型的推理痕迹似乎为模型如何得出答案提供了一个可读的窗口。越来越多的研究将其视为如此,使用LLM评判器来诊断错误、评估忠实性,并通过过程奖励模型和生成式批评者提供步骤级监督。这些实践依赖于推理步骤的文本携带其功能角色的信息。但文本是否真的编码了哪些推理步骤重要的信息?我们将推理步骤的重要性操作化为其优势:包含该步骤所带来的期望奖励变化,例如产生正确的最终答案,通过蒙特卡洛展开进行估计。基于这些估计作为真实基准,我们评估LLM评判器是否能识别高优势步骤,发现足够强大的LLM能超越流行率基线,但远未达到噪声上限。将模型微调为步骤级批评者对错误响应产生显著改进,但对正确响应仍远离上限,这表明步骤重要性仅能从推理痕迹文本中部分恢复。我们的发现为日益增长的思维链忠实性研究做出贡献,该研究警告不要将推理痕迹的可读性视为可解释性,尤其对过程奖励建模具有启示意义。 |
| 轴突延迟离散度决定了神经元是检测单个事件还是序列,并预测皮层柱直径 |
Cheng Bi |
2026-09-03 |
PDF |
皮层神经元稀疏放电——通常每个感觉窗口内少于一个脉冲——这使得速率编码不足,而时间编码成为必需。传导延迟将放电顺序转化为同步性,这一点早已确立。但何种因素决定神经元检测哪类时间特征——是一组同步输入,还是按特定顺序的两组——尚未被研究。我们提出一个延迟签名框架,其中汇聚到树突分支的轴突传导延迟构成一把物理钥匙:只有那些脉冲时间差被延迟补偿的输入序列才会同步到达,而通过钙平台阈值的重合检测,将这种同步转化为全或无的输出。在整合器神经元模型的模拟中,我们报告三个结果。第一,一个单一的物理标量——延迟集的离散度——将群体从事件检测转变为顺序选择性序列检测。这种转变在随机延迟和连接下是涌现的:在窄离散度下,序列检测器不存在,而它们超越事件检测器的离散度,追踪事件间间隔,其斜率在统计上与一不可区分。这将计算上的区别映射到有髓鞘和无髓鞘投射之间的解剖区别,使髓鞘化成为神经元计算内容的开关,而不仅仅是速度的调节器。第二,相同的离散度设定了编码的极限:它限制了最长可编码间隔,并固定了约一毫秒的绝对时间容差,其中减速比加速更易容忍。第三,这一毫秒窗口和水平传导速度共同预测皮层柱直径,而两个有直接测量的区域恰好落在该关系所预测的位置。因此,一个解剖学上可测量的参数,决定了神经元检测的内容及其可表征范围的极限。 |