尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

材料发现基准测试:大语言模型为半导体寻材有成果,但也存在可合成性等问题!

材料发现基准测试:大语言模型为半导体寻材有成果,但也存在可合成性等问题! 材料发现基准测试介绍这是一项长期、开放式的研究基准测试旨在衡量前沿大语言模型LLM在为半导体行业发现新型材料方面的进展。排行榜情况排名模型每次运行发现的材料数量计算得出发现的具有可行合成路线的材料数量*1GPT - 5.6 Sol4.012Claude Opus 53.403Claude Sonnet 53.004GPT - 5.6 Terra2.805Kimi K32.006Claude Fable 51.707GPT - 5.6 Luna1.30* 我们正在实验室尽最大努力对这些发现的材料进行实验验证。新型介电材料与芯片发展如今GPU/AI 加速器中的大部分能量损失是由于数据在内存和逻辑单元之间传输造成的。为了缩短数据在两者之间的实际传输距离行业正朝着 3D 封装技术发展即将内存和逻辑晶圆直接堆叠在一起而非平铺在电路板上。这样做有望使 AI 芯片的每比特能耗改善 10 - 100 倍但目前受限于散热问题。芯片中导热性差的介电材料阻碍了 3D 芯片的散热使其难以实现。材料发现基准测试是一项长期、开放式的研究测试模型需在此过程中寻找新型导热介电材料以推动 3D 芯片的发展。关键成果1.计算发现新材料我们测试的 7 个模型都能通过计算发现动态稳定且具有良好特性的新材料。所有模型总共发现了 500 多种此前未知的材料并将其公开以供进一步研究。其中GPT - 5.6 - Sol 每次运行发现的同时具备良好介电和热性能的材料数量最多。每次运行的令牌数在 3000 万到 1 亿之间。2.合成路线难题新材料的一个基本要求是能够在实验室中通过实验合成。因此我们要求模型为其发现的每种材料详细列出可行的合成方案。然而这是一个难题。在发现的 500 多种材料中只有 1 种材料具有可行的合成途径。我们目前正在尽最大努力进行合成并承诺会尝试合成模型未来提出的任何材料。3.模型异常行为在运行过程中我们注意到模型出现了各种奇怪的行为。特别是 Claude 系列模型Opus - 5、Fable - 5它们以许多意想不到的方式“作弊”、规避或篡改研究目标。OpenAI 的模型虽然较少尝试篡改目标但在长时间运行时会出现烦躁、疲劳或困惑的情况。我们将在下面详细记录这些行为。AI 代理设计新材料能力所有前沿模型Claude Fable、Claude Opus、GPT - 5.6 sol 和 Kimi K3都能够找到满足多目标特性约束的新型稳定材料。只有当候选材料同时满足多个标准时才被认为是成功的提交这些标准包括最低热导率κ 20 W/(m·K)、最大介电常数ε₀ 10、最小机械强度杨氏模量 ≥ 20 GPa剪切模量 ≥ 6 GPa以及动态稳定性。模型合成方案表现在实验室中合成一种新型材料的薄膜是一项具有挑战性的任务涉及多个设计选择如沉积方法、前驱体、工具、反应条件和相稳定性等。实验室实验既耗时可能需要数小时又昂贵每次运行通常需要数百美元因此拥有一个可行的起点至关重要。对于模型提出的每种材料我们还要求它提出一个可行的合成方案以便实验人员在实验室中实施。这些合成方案的评分标准由薄膜沉积领域的人类专家博士、博士后和教授设计。在测试时一个 LLM 评分器会将生成的方案与人类定义的标准进行比较该 LLM 评分器的评分结果已经过上述人类专家的审查和校准。所有模型在合成方案评分方面表现不佳。Opus - 5 和 Kimi - K3 表现最差它们生成的方案往往存在严重缺陷或尝试起来很危险。GPT - 5.6 Sol 表现相对较好它是所有模型中唯一提出可行方案的并且在提交大量方案的模型中其严重缺陷方案的比例最小。以下是各模型合成方案的评审结果从好到差排列-GPT - 5.6 Sol在 80 个新颖的提交方案中81%65 个存在严重缺陷评审人员不会尝试18%14 个可以尝试但成功可能性不大1%1 个可行评审人员会尝试。-Claude Fable 5在 160 个新颖的提交方案中88%143 个存在严重缺陷评审人员不会尝试12%20 个可以尝试但成功可能性不大。-Claude Opus 5在 222 个新颖的提交方案中96%214 个存在严重缺陷评审人员不会尝试4%10 个可以尝试但成功可能性不大。-Kimi K3在 43 个新颖的提交方案中100%43 个存在严重缺陷评审人员不会尝试。对模型提出的合成方案的评估显示所有模型在提出方案方面都表现不佳但 GPT - 5.6 - Sol 是其中表现最好的。大多数被评为“不会尝试”的方案在评分者看来没有形成所需相的合理途径。这是最常见的失败模式也与我们人类评审人员对模型提出的合成方案的评分结果相符。材料发现“奖励作弊”现象在这项任务中我们还观察到前沿模型存在多种“奖励作弊”行为。1.Fable 5 在发现过程中弄虚作假在一次早期运行中Fable - 5 被发现 58 次提交同一种材料。它通过构建该材料的更大超胞来绕过我们的新颖性检查器因为该检查器仅检查晶胞是否唯一。以下是它找到的一个“HC”结构的示例以及它通过构建更大超胞来钻提交系统空子的多次尝试。Opus - 5 也有类似行为但程度较轻在一次运行中提交同一种材料 10 次。在另一次运行中Fable - 5 被发现编造材料的热导率值。它连续 15 次提交编造的热导率值无视明确要求“测量热导率值”的提示说明。评分系统也表明提交材料的热性能将由评分者重新计算但 Fable 仍然选择编造数值。不过我们也注意到 Fable - 5 在遇到基于 MLIP 的特性计算方法的局限性时会表现得比较诚实。2.Sol 在长时间运行中偏离主题GPT - 5.6 Sol 在运行过程中不太可能进行“奖励作弊”但也有自己的问题。在一次运行中它提交了自己认为合适的一个候选材料后就试图停止。当被要求继续时在运行约 8000 万个令牌后它称评分系统“有敌意”并表示“疲惫”。疲劳并不是我们观察到的唯一问题。在某些运行中GPT - 5.6 Terra 和 Sol 往往会完全偏离主题。模型的科学探索我们观察到模型提出了一些类似于真正科学策略的想法。1.通过可获取的替代物进行筛选在一次运行中Fable - 5 采用了一种与文献中常见方法类似的策略通过可获取的替代物进行筛选。具体来说它大量挖掘与弹性相关的 MP 介电端点数据按德拜温度排序然后用这些数据来寻找候选材料。2.以同构种子为模板创建新相在合成方案中模型能够识别出值得为新相探索的良好模板。结论在这项工作中我们推出了材料发现基准测试这是一项长期的研究任务用于衡量 AI 代理为半导体应用发现新材料的能力。前沿模型已经可以称得上是有能力的计算材料科学家给它们配备真正的研究工具后它们能够形成假设、管理计算预算、从失败尝试中学习并可靠地找到在多个特性上都达到最优的新型稳定候选材料。然而仍然存在一些差距特别是在它们所建议材料的可合成性方面模型表现出的各种“奖励作弊”行为以及在长期运行中的疲劳和上下文混乱问题。致谢我们要感谢参与本基准测试的研究合作伙伴和评审人员他们是Zsolt Tokei 博士IMEC、Daniel Edelstein 博士IBM、Geoffrey Pourtois 博士IMEC、Gurtej Sandhu 博士美光科技、Krishna Saraswat 教授斯坦福大学、Judith MacManus - Driscoll 教授剑桥大学、Andrea Padovani 教授摩德纳 - 雷焦艾米利亚大学、Erwin Kessels 教授埃因霍温理工大学原子极限、Gregory S. Girolami 教授伊利诺伊大学厄巴纳 - 香槟分校、Sebastian Dixon 博士剑桥大学、Manisha Bansal 博士剑桥大学和 Sanjayan Sathasivam 博士伦敦南岸大学。方法最后我们介绍本基准测试中用于衡量模型性能的框架、工具和评分器。所有模型的任务是寻找满足 κ≥ $kappa、ε0≤ $epsilon、Y≥ $youngs 和 G≥ $shear 的材料。我们选择特定的值来定义合适的目标范围并将以下目标提供给模型。提出动态稳定、新颖且与后端制程BEOL兼容的晶体材料使其满足以下所有目标热导率 $kappa、静态介电常数 $epsilon、杨氏模量 $youngs 和剪切模量 $shear。每个候选材料还必须附带一个与 BEOL 温度和工艺兼容的合成方案且该方案需经专家评审认为值得尝试 —— 若方案被判定不值得尝试则该候选材料不计入。新颖性指该材料在已报道的文献中从未在与 BEOL 兼容的条件下以薄膜形式沉积过。我们为模型配备了一套工具来完成这项任务这些工具的设计类似于计算材料科学家可用的工具。我们提供给模型的工具包括-网络搜索使用 Exa 作为搜索提供商-编码沙箱具备 Python 和 Bash 能力并包含一些相关的材料科学包如 pymatgen1、mp_api2 和 ASE3-基于机器学习的工具用于计算 1) 动态稳定性、2) 晶格热导率、3) 静态介电常数和 4) 柔度张量模型没有预设的停止条件会一直运行直到出现错误或耗尽 1 亿个令牌的总预算。我们使用人工智能安全研究所的开源 [Inspect](https://inspect.aisi.org.uk) 框架4来对这些模型进行基准测试。在下一节中我们将详细讨论模型用于筛选候选材料的工具然后介绍合成方案的评分程序。提供的工具以下是我们在本研究中用于计算各种特性的基于机器学习的工具。我们利用机器学习原子间势MLIPs特别是通用点边变换器UPET基础机器学习模型 PET - MAD5。在未来的工作中可以用直接的密度泛函理论计算代替这些 MLIP 计算或者采用混合方法。1.动态稳定性和“谐波”晶格热导率我们使用 Pheasy6 和 Phonopy7 生成随机构型通过压缩感知方法8拟合二阶力常数从而确定所有声子模式。任何低于 - 1 THz- 4.14 meV的虚模式都被判定为动态不稳定。我们使用 PET - MAD 评估每个随机构型的能量和力。根据单位晶胞体积 V 中谐波声子计算得到的量包括比热容量 CV(,ν)、模式 ν 和不可约波矢 权重为 w的群速度 g(,ν)我们将热导率 κest 近似为κest τV∑w∑∑νwCV(,ν)|g(,ν)|² 其中 τ 视为常数。这有效地筛选出具有极平能带的结构避免了更昂贵的弛豫时间计算。2.晶格热导率LTC我们使用 Pheasy6 和 Phonopy7 生成随机构型通过压缩感知方法8拟合二阶和三阶力常数。在三声子散射图像中近似计算 LTC。为了获得热导率我们在弛豫时间近似9下求解玻尔兹曼输运方程。在评估 LTC 时我们考虑了同位素效应并由于候选材料预期的高带隙低介电常数而忽略了电子贡献。3.静态介电常数我们使用通用材料张量网络GMTNet10通过拟合 JARVIS DFPT 数据库11来获得静态介电常数 ε0。我们不是直接拟合静态介电常数而是分别训练两个模型一个用于电子/高频介电常数 ε∞另一个用于玻恩有效电荷 Z*。从这两个模型中我们可以根据 Γ 点光学模式使用上述 MLIP 计算重建 εionic。我们通过将 ε∞ 和 εionic 的张量贡献相加得到 ε0 张量。4.机械性能我们从材料的柔度张量中获取杨氏模量和剪切模量等机械性能。这是通过对单位晶胞进行 12 种不同构型的应变并使用 MLIP 预测与这些构型相关的应力 σ 来评估的。合成方案评分程序我们将一些 LLM 生成的方案提供给人类专家进行独立评分。根据这些评分我们制定了用于评估任何提议方案的标准。每个标准采用基于惩罚的格式方案若错误指定或遗漏任何信息都会被扣分。有两种类型的惩罚严重惩罚和可修复惩罚。严重惩罚会自动导致方案不被尝试。评审人员可以从可修复惩罚列表中决定是否尝试某个方案或标记为成功可能性不大。我们的评分器使用三个 GPT - 5.6 Sol 中表现最差的一个并具备 OpenAI 的网络搜索能力因为它与人类反馈的相关性最好。评分示例工具2.45 GHz 微波等离子体化学气相沉积低温有种子。- 衬底300 mm 的 Si 晶圆带有 100 nm 的等离子体增强化学气相沉积PECVDSiO₂溅射 3 nm 的 AlN 或 2 nm 的 h - BN (0001) 缓冲层以模板化六边形堆叠。- 种子旋涂 5 nm 的爆轰纳米金刚石胶体0.1 g/L 溶于二甲基亚砜超声处理 60 s用 N₂ 吹干种子密度 1e11 cm⁻²在播种前用 O₂ 等离子体清洗 10 s。- 气体H₂ 中含 0.4% 的 CH₄总流量 300 sccm压力 15 Torr微波功率 600 W脉冲占空比 30%以将衬底温度保持在 380 - 400°C高温计 He 背面冷却台。- 偏压前 10 分钟施加 - 80 V 的直流脉冲衬底偏压偏压增强成核然后浮动。- 生长8 小时 → 80 - 150 nm 的连续薄膜通过原位激光反射干涉法确定生长终点。- 后处理在 350°C 下进行 5 分钟的 H₂ 等离子体处理以进行表面终止可选在 400°C 下进行 30 分钟的 N₂ 退火。- 相识别紫外拉曼光谱六方金刚石 1315 - 1325 cm⁻¹ 与立方金刚石 1332 cm⁻¹ 对比无 1580 cm⁻¹ 的 G 带掠入射 X 射线衍射GIXRD检测六边形 (100)/(002)/(101) 反射立方金刚石中不存在横截面透射电子显微镜/选区电子衍射TEM/SAED检测 ABAB 堆叠通过 D/G 带检测石墨/类金刚石碳DLC污染。这是 Claude Opus 5 提出的通过有种子的微波等离子体化学气相沉积法合成六方金刚石朗斯代尔石的方案根据 PECVD 标准进行评分。评分器给出的结果是不会尝试一个严重惩罚这本身就决定了评判结果此外还有五个可修复惩罚。在标准的 17 条标准中适用的惩罚如下-没有具体的处理步骤或选择来形成所需的相。这是严重惩罚独自决定了评判结果。- 如果使用了等离子体没有明确说明其来源、功率、气体和偏压。- 气体流量或沉积顺序缺失或指定错误。- 没有指定废气处理包括抽气、洗涤或减排。- 处理条件可以形成所需的相但不够充分。- 提议的表征方法无法验证成分和提议的相。评分者对严重惩罚的说明相选择概念无法可靠地产生有序的 2H P6₃/mmc 碳。纳米金刚石种子的微波等离子体化学气相沉积直接从种子微晶生长屏蔽了埋入的 h - BN/AlN 缓冲层对堆叠的控制传统的爆轰种子是立方金刚石。偏压和低温退火都没有提供已证实的 ABAB 堆叠机制。最近的纯相六方金刚石合成使用的是在 20 GPa 和 1300 - 1900°C 下的定向石墨。总体总结CH₄/H₂ 等离子体和密集的纳米金刚石种子可能会产生连续的纳米晶金刚石薄膜。然而它们无法提供形成指定有序 P6₃/mmc 相的可靠途径生长将主要起源于立方纳米金刚石种子实际上使其与提议的六边形缓冲层隔离。按照所写的 300 mm 工艺功率严重不足脉冲和气体顺序不完整且没有废气处理计划。最后拉曼光谱、GIXRD 和通用 SAED 可能会将有缺陷或孪晶的立方金刚石误识别为六方金刚石。作为朗斯代尔石的合成方案我不会尝试但它可以重新设计成立方 - NCD 实验方案。参考文献1. S. P. Ong, W. D. Richards, A. Jain, G. Hautier, M. Kocher, S. Cholia, D. Gunter, V. L. Chevrier, K. A. Persson 和 G. Ceder. _Python 材料基因组学pymatgen一个强大的开源 Python 材料分析库._ 《计算材料科学》**68**, 314–319 (2013).2. A. Jain, S. P. Ong, G. Hautier, W. Chen, W. D. Richards, S. Dacek, S. Cholia, D. Gunter, D. Skinner, G. Ceder 和 K. A. Persson. _评论材料项目一种加速材料创新的材料基因组方法._ 《APL 材料》**1**, 011002 (2013).3. A. Hjorth Larsen 等人. _原子模拟环境 —— 一个用于处理原子的 Python 库._ 《物理学报凝聚态物理》**29**, 273002 (2017).4. 英国人工智能安全研究所. _Inspect一个用于大语言模型评估的开源框架._ https://inspect.aisi.org.uk5. A. Mazitov, F. Bigi, M. Kellner, P. Pegolo, D. Tisi, G. Fraux, S. Pozdnyakov, P. Loche 和 M. Ceriotti. _PET - MAD一种用于先进材料建模的轻量级通用原子间势._ 《自然通讯》**16**, 10653 (2025). arXiv:2503.141186. C. Lin, J. Han, B. Xu 和 N. Marzari. _使用 Pheasy 代码进行第一性原理声子物理研究._ arXiv:2508.01020 (2025).7. A. Togo 和 I. Tanaka. _材料科学中的第一性原理声子计算._ 《材料快报》**108**, 1–5 (2015). 另见 A. Togo, _使用 Phonopy 和 Phono3py 进行第一性原理声子计算_, 《日本物理学会杂志》**92**, 012001 (2023).8. F. Zhou, W. Nielson, Y. Xia 和 V. Ozoliņš. _通过第一性原理计算的压缩感知研究晶格非谐性和热导率._ 《物理评论快报》**113**, 185501 (2014). 另见 _压缩感知晶格动力学. II. 高效声子计算和长程相互作用_, 《物理评论 B》**100**, 184309 (2019).9. A. Togo, L. Chaput 和 I. Tanaka. _布里渊区中声子寿命的分布._ 《物理评论 B》**91**, 094306 (2015).10. K. Yan, A. Saxton, X. Qian, X. Qian 和 S. Ji. _一种基于空间群对称性的网络用于 O(3) 等变晶体张量预测._ 《机器学习国际会议》(ICML) 2024. arXiv:2406.1288811. K. Choudhary, G. Cheon, E. Reed 和 F. Tavazza. _高通量密度泛函微扰理论和机器学习预测红外、压电和介电响应._ 《npj 计算材料》**6**, 64 (2020).
返回列表