| GPT-6 Astra 科学人工智能:二维 CFET 的热设计与电热分析 |
Min-Hui Kim |
2026-09-15 |
PDF |
二维CFET反相器的热优化需要针对其电学代价测试结构方案。我们在所提供的电热模型内,使用AI智能体工作流考察这些研究任务。在12 nm节点,Astra选择了一种重新分布的源极互连几何结构,而一个协调智能体则提出了一条指向衬底的散热路径。该组合设计在固定金属体积和20 μW下将峰值温升降低了1.67 K。随后的金属电阻敏感性分析给出了约0.6 K的反相器冷却,同时伴随2%的nFET开态电流损失。有效接触长度缩放进一步表明,当电流下降时,较低的温度可以伴随较高的热阻。复现识别出一致的实现,并保留了一个104.95 K的失败用于诊断。这些结果表明,AI科学家工作流能够提出热结构,在共同约束下对其进行测试,并量化其电学代价。 |
| 大语言模型中反事实自我解释的实证研究 |
Giannis Kalyvas |
2026-09-15 |
PDF |
大型语言模型可以轻松地为其自身输出生成解释,但这类自我解释未必忠实于模型的行为。我们通过反事实自我解释来研究这一问题,即模型对输入进行最小编辑,使其自身的预测发生变化。在情感分析和自然语言推理任务中,我们评估了来自LLaMA-3和Qwen-2.5系列的十个指令微调模型,测量其忠实性、最小性以及与人工标注理由的一致性。我们的结果表明,模型规模是解释质量的最强决定因素:更大的模型显著更有可能生成能够翻转其自身预测并针对决策相关证据的反事实。相比之下,理由引导条件生成的是编辑最小化的反事实,同时也更符合人类判断。然而,它并未持续提升忠实性。总体而言,反事实自我解释可以提供关于模型决策的有用行为证据,但其可靠性在很大程度上取决于模型能力,应当通过实证验证而非默认假设。 |
| 通过个性化示例检索增强程序性写作:以烹饪食谱为例的研究 |
Paola Mejia-Domenzain |
2026-09-15 |
PDF |
撰写高质量的过程性文本对许多学习者而言是一项具有挑战性的任务。尽管基于示例的学习作为一种反馈方法已展现出潜力,但当所有学习者都接收相同内容而不考虑其个人输入或先前知识时,便会出现局限。因此,一些学习者难以理解或关联这些反馈,觉得其冗余且无用。为解决这一问题,我们提出了RELEX,一个自适应学习系统,旨在通过个性化的基于示例的学习来提升过程性写作。我们系统的核心是一个多步骤示例检索流程,根据每位学习者的独特输入,为其选择更高质量且与情境相关的示例。我们在烹饪食谱领域实例化了我们的系统。具体而言,我们利用一个经过微调的大型语言模型来预测学习者烹饪食谱的质量分数。利用该分数,我们从包含超过18万份食谱的庞大数据库中检索更高质量的食谱。接下来,我们应用BM25实时选择语义上最相似的食谱。最后,我们利用领域知识和正则表达式,为所选示例食谱添加个性化的教学解释。我们通过一项2×2对照研究(个性化与非个性化示例、反思性提示与无提示)对RELEX进行了评估,共有200名参与者。我们的结果表明,提供量身定制的示例有助于提升写作表现和用户体验。 |
| 内在机器人奖励:复用VLA表征实现自主评估与策略改进 |
Tobias Schaffer |
2026-09-15 |
PDF |
视觉-语言-动作(VLA)系统已经汇集了机器人学习的两种宝贵资源:丰富的视觉表征和成功任务执行的演示。内在机器人奖励(IRR)提出将这些资源用于第二个互补目的:评估机器人自身的结果并为策略改进提供反馈。成功的演示终点定义了任务特定的参考,而策略的冻结视觉编码器提供了评估新结果的特征空间。核心奖励机制在现有流程中添加了一个参考库和一个评分操作,而不需要单独的学习评估器或额外的感知主干。我们的立场是,这种复用为降低集成工作量、高效计算奖励以及减少反复的人工结果评分提供了一条有前景的路径。基于视觉奖励和从经验中学习的既有研究,IRR将这些思想引入机器人现有的感知和演示流程中。一个可运行的COMAU Racer 3演示器已达到技术就绪水平4(TRL 4)。这一实验室基础支持下一步研究:将内部结果评估与物理策略改进相连接。我们提出了奖励公式、核心研究问题,以及一种将奖励可靠性与任务成功和监督工作量相关联的评估方法。预期贡献是一种可复用的方法,用于从工业机器人系统中已有的数据和经验中学习和改进。 |
| 不只是又一个文本基准:让“视觉”回归大型视频模型的视觉问答 |
Rwiddhi Chakraborty |
2026-09-15 |
PDF |
大型视频模型在广泛的视觉问答任务上展现出令人瞩目的性能,这得益于强大的预训练文本和视觉编码器的兴起。此类模型的实用性也已在大量基准测试中得到验证,但有一个重要的前提——这些基准测试中的主流方法是通过文本选项来评估多项选择推理。这是测试这些模型中基于文本推理的一种自然方式,并在社区中就模型行为产生了重要见解。在这项工作中,我们提出了一个不同的问题——当评估模态是视觉而非文本时会发生什么?我们引入了三个新的以视觉为中心的评估基准,分别涉及时间帧检索、视频未来预测和因果记忆扭曲,所有这些都旨在评估大型视频模型中的视觉理解能力。我们的方法补充了前沿模型中评估视频理解的现有方法。我们表明,当前沿模型试图通过视觉查询而非文本进行推理时,表现出显著的弱点。我们最后提供了一个扩展分析部分,为大型视频模型视觉理解的未来改进提供了指引。 |
| 使用LLM发现数学形式化建模中的常见错误 |
Lilian Killich |
2026-09-15 |
PDF |
使用逻辑公式、数学方程或正则表达式等数学形式体系进行建模,对计算机科学及其他STEM学科的学生而言是一项重要却充满挑战的任务。识别此过程中出现的常见错误,是朝着通过提供有针对性的高质量反馈(例如在交互式学习系统中)来帮助困难学生迈出的重要一步。我们提出了一种工具支持的工作流程,能够:(1) 识别出可解释大型教育数据集中众多学生错误的常见错误候选;(2) 根据相似性对候选进行聚类;(3) 为教师和计算机科学教育研究者可视化所得的聚类结果。该可视化旨在帮助研究者识别常见的建模错误。常见错误的候选由错误修复变换表示,这些变换将错误的形式化转换为正确的形式化;它们由LLM生成,并通过算法进行验证。我们通过以下方式表明该方法效果良好:重现了文献中手工识别的命题逻辑建模中的常见错误;表明与其他算法方法不同,基于LLM的方法适用于非常大规模的数据集;并将其应用于多种其他形式体系,以展示其可推广至命题逻辑之外。 |
| 智能体RDZ:利用AI智能体实现自主区域管理及FR3共存用例 |
Minh Dat Nguyen |
2026-09-15 |
PDF |
无线电动态区(RDZ)允许无线实验在传统频谱监管之外运行,同时持续保证对现有用户的保护。现有的RDZ原型通过手工编写的规则和预定义的工作流程,以程序化方式自动完成这一任务,当实验遇到设计时未预料到的硬件损伤、用户工作流程和设备或干扰机制时,就会变得脆弱。本文介绍了智能体RDZ(A-RDZ),据我们所知,这是首个由智能体使用大型语言模型(LLM)执行频谱管理、实验管理、政策解读和区域编排的RDZ实现。该架构建立在GENESIS智能体框架之上,将自主推理与确定性策略门控和近实时(near-RT)反射机制相结合,使智能体能够改善结果,但绝不会削弱区域的保护保证。我们在硬件在环的Frequency Range 3(FR3)(7.125-24.25 GHz)开放无线接入网(O-RAN)测试平台上验证了A-RDZ,其中5G新空口(NR)实验与仿真的固定卫星服务(FSS)地球站现有用户共存。在一个端到端用例中,监测智能体从实时频谱证据中检测到发射违规,编排器选择一种缓解措施,在恢复干扰预算的同时保持实验继续运行,该操作通过O-RAN控制平面应用并验证。我们报告了从检测到缓解的延迟分解,并讨论了智能体运行的实际限制,包括非确定性推理和决策到行动的转换。 |
| 跨标准LoRA适配器的共享前缀KV复用:质量与服务权衡 |
Dushyant Rajput |
2026-09-15 |
PDF |
一个常见的小模型部署方案是运行一个共享主干网络,并配备多个LoRA专家模型,它们在同一上下文上作答。朴素地服务这些专家模型会导致每个专家模型都对共享上下文重新做一次预填充。我们研究一个狭窄而实际的问题:对于已经训练好的标准LoRA适配器——而非为缓存兼容性重新训练的适配器——如果主干网络的预填充KV缓存只计算一次并在各专家模型间复用,能保留多少任务质量,以及在服务成本上能带来什么收益?在一个Qwen3-1.7B主干网络上配备两个适配器(HotpotQA上的抽取式问答、GSM8K上的算术推理),我们扫描专家模型从复用的基础缓存接管的边界,并测量配对质量差异和服务成本。全前缀复用具有最低的预填充成本,并在留出的GSM8K上有较小的质量差异(在160 token预算下Delta = -4.6 EM;320 token下为-3.0;在第二个训练种子下为-0.8——全部偏向原生,仅第一个排除零,且幅度不一致)。部分重计算未显示出任何优势。质量等价性和通用边界选择规则均未得到确立。我们还报告了一个闭式岭KV转换器,它未能胜过直接复用,以及专家依赖对比,其区间均包含零。测得的服务收益是热缓存下的首token时间,它随上下文增长(8K时约16倍);双分支峰值内存仅低12%,而且经检查,前缀从未在各分支间物理共享——该实现复用了KV值但复制了其存储,因此共享缓存的内存节省并未实现。 |
| 符号分离:将深度智能体扎根于知识图谱以实现可信的操作数据分析 |
Baibek Davletiyarov |
2026-09-15 |
PDF |
生成式人工智能承诺为数据中心和工业4.0设施中海量的数值遥测数据提供自然语言访问,然而文本到查询以及使用工具的智能体仍然不可靠:即便是前沿模型也只能回答略多于一半的真实世界数据库问题,对于多步骤的操作性问题回答率更低,因为大语言模型必须组织异构数据源之间的关联方式,并且会臆造这些关联,而不仅仅是字段。我们提出符号分离:一个深度智能体可以自由推理,但只能通过一个受本体约束的虚拟知识图谱对数据采取行动,并带有确定性的执行前验证。与工具API的接口契约不同,这种领域语义契约将复杂问题转化为一次经过验证的图遍历,而非由大语言模型推断的连接。将其实例化为神经符号深度分析师,并在49.9 TB的超级计算机遥测数据上针对一个刚性工作流和一个非符号消融进行评测,它将端到端任务成功率从43%提升至86%,防止了任何句法检查都无法捕获的静默数据完整性错误,并将token成本降低2.4倍,使一个较小的本地部署模型能够超越一个较大的模型。 |
| 通过随机动态模式分解和深度学习的高保真数字孪生数据模型及其在流体动力学中的应用 |
Diana A. Bistrian |
2026-09-15 |
PDF |
本文的目的是通过非侵入式技术(即不需要将控制方程进行伽辽金投影到降阶模态基上)从数值代码输出中识别高保真数字孪生数据模型。在本文中,作者将数字孪生数据模型(DTM)的概念定义为一个降阶复杂度的模型,其主要特征是镜像原始过程行为。DTM的显著优势在于能够以高精度和降低的CPU时间与硬件成本再现动力学,适用于由于动力学随时间变化的复杂性而难以探索的设置。本文引入了一个新框架,通过结合两种最先进的工具来创建高效的数字孪生数据模型:随机动态模态分解和深度学习人工智能。结果表明,输出与原始源数据一致,并具有降低复杂度的优势。DTM在三个复杂度递增的激波现象数值模拟中进行了研究。作者从数值精度和计算效率方面对新数字孪生数据模型的性能进行了全面评估。 |