尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

OpenAI自研3nm芯片挑战英伟达,CUDA生态与AI芯片路线之争

OpenAI自研3nm芯片挑战英伟达,CUDA生态与AI芯片路线之争 OpenAI 用约 9 个月时间推进首款 3nm 自研 AI 芯片的消息传出后黄仁勋的回应非常直接英伟达提供的是“截然不同”的服务。这八个字不是公关辞令而是一个技术判断。对大多数开发者来说真正值得关心的不是“谁的芯片更强”而是“未来我写的代码要跑在哪套硬件和软件栈上”。这篇文章想聊清楚三层问题OpenAI 为什么执意自研芯片英伟达的“截然不同”到底建立在什么技术基础之上以及这场 AI 芯片竞争会对普通开发者产生什么影响。先说我的判断OpenAI 自研芯片是 AI 算力供应链从“单一依赖”走向“分化竞争”的标志性节点但短期内不会改变“训练靠 N 卡、生态看 CUDA”的现实。它真正值得关注的地方不在芯片本身而在“定制化 AI 算力”的开始。对开发者这意味着未来写代码时硬件可移植性和多后端适配会成为基本功。如果你正在做 AI 应用、模型部署、训练调优或者只是想判断自己该不该学 CUDA、要不要关注自研芯片这篇文章会给你一个相对完整的分析框架。1. 这件事到底在争什么OpenAI 造芯片表面上是把“算力供应链”握在自己手里本质上是在争两个东西议价权和模型架构的定制权。过去几年AI 行业有一个非常清晰的成本公式模型越大训练和推理所需的算力越多算力越依赖单一供应商成本就越不可控。当一个公司每天都在烧大量 GPU 跑训练和推理时自研芯片在经济学上就变得合理虽然前期研发投入巨大但一旦规模摊薄单次推理成本有机会大幅下降。这就是 OpenAI 为什么要做芯片的最直接原因。黄仁勋说英伟达提供“截然不同”的服务这句话的立足点是英伟达卖的不只是一块 GPU而是一整套从芯片、互联、驱动、库到框架适配的“算力服务”。你用英伟达的方案不是买一块硬件而是买一个已经被 PyTorch、TensorFlow、DeepSpeed、vLLM 等工具链反复打磨过的软件生态。所以这不是“OpenAI 造芯片”和“英伟达卖芯片”的简单对决而是“垂直整合的定制派”和“横向通用的生态派”之间的路线之争。2. OpenAI 首款自研芯片事件梳理从目前公开信息看OpenAI 首款自研芯片选择的是 3nm 工艺开发周期大约 9 个月。这里要注意一点9 个月放在 3nm 芯片的语境下通常指设计验证、流片和点亮阶段而不是从零到量产的全流程。芯片行业里3nm 这样的先进工艺从设计到大规模量产往往要以年为单位计算。所以更稳妥的理解是OpenAI 用很短的时间完成了第一版自研芯片的里程碑验证真正的大规模部署还有距离。为什么 OpenAI 要在这时候做这件事可以从三个层面看。第一个层面是成本。OpenAI 的 API 服务和 ChatGPT 产品每天要处理海量推理请求推理成本是运营大头。使用自研芯片可以把推理链路中的矩阵运算、注意力机制、内存调度都做成专用电路减少不必要的计算和带宽浪费。第二个层面是供应安全。AI 算力需求增长太快依赖外部供应意味着扩产的节奏不由自己控制。自研芯片可以把规划权拿回到自己手里。第三个层面是模型硬件协同设计。这是最容易被忽视但技术含量最高的一点。如果芯片的设计方和模型的设计方是同一个团队就可以在很多层面做联合优化比如针对特定算子的电路、显存的带宽分配、数据流调度。这是通用 GPU 很难做到的因为 GPU 必须兼顾成千上万种模型而自研芯片只需要服务自己的主力模型。黄仁勋的回应之所以有底气是因为英伟达看到了这条路线的一个关键难点芯片做出来只是开始软件栈才是真正的护城河。OpenAI 要的不只是一块能跑矩阵乘法的芯片还需要编译器、算子库、分布式通信库、推理引擎全部跟上并且把 PyTorch、TensorFlow 等主流框架适配好。这条路不是一年两年能走完的。3. 看懂 AI 芯片之争CPU、GPU、TPU、NPU、ASIC 到底谁在干什么想理解 OpenAI 自研芯片的定位得先把 AI 芯片领域的几个名词理清楚。很多开发者对 GPU 的认知停留在“打游戏用的显卡”对 TPU、NPU、ASIC 更是一头雾水。先从“为什么 AI 需要专用芯片”说起。AI 模型的核心计算是大量矩阵乘法和卷积运算这类运算的特点是简单、重复、并行度高。CPU 的设计目标是处理复杂的控制逻辑和任务切换它的强项是“什么都能做”但单个任务并行度远不如专用芯片。GPU 则把大量晶体管用在计算单元上用几千个核心同时做简单运算刚好契合 AI 训练和推理的特点。不同类型芯片的分工差异如下表芯片类型全称设计定位典型应用场景代表方案CPUCentral Processing Unit通用控制计算操作系统、业务逻辑、数据预处理Intel、AMD、鲲鹏GPUGraphics Processing Unit大规模并行数值计算AI 训练、AI 推理、图形渲染NVIDIA、AMD、摩尔线程TPUTensor Processing Unit张量专用计算谷歌内部 AI 训练与推理Google TPUNPUNeural Processing Unit神经网络加速手机端、边缘设备 AI 推理高通、苹果、华为昇腾 NPUASICApplication-Specific Integrated Circuit针对特定任务的定制芯片特定算法、特定业务场景OpenAI 自研芯片可归入此类从这个表能看出OpenAI 自研芯片最接近 ASIC 类别但它不是“通用 AI 芯片”而是“为自家模型和推理场景定制的专用加速器”。3nm 工艺在这条路线里的意义又是什么芯片制造工艺越先进单位面积能集成的晶体管越多同样功耗下性能更强。3nm 带来的直接好处是能效比提升这对推理场景很关键因为大规模推理集群的电费是长期运营成本。对 OpenAI 来说用 3nm 芯片做推理即使峰值算力不比其他方案强太多只要能效比优势明显就能在长期运营成本上拉开差距。这里要提醒一个常见误区AI 芯片不等于 GPU。很多文章把“AI 芯片”和“英伟达 GPU”划等号实际上 AI 芯片是一个宽泛概念GPU 只是目前最主流的一种实现方式。TPU、NPU、各种 ASIC 加速器也都是 AI 芯片只是适用场景和生态成熟度不同。4. 英伟达“截然不同”的底气CUDA 生态为什么是护城河黄仁勋说的“截然不同”值得从开发者视角仔细拆解。对普通 AI 开发者来说英伟达真正厉害的地方不是某一张显卡的浮点算力而是你从“想跑一个模型”到“模型真正跑起来”这段路径有多平坦。先看一个最小示例用 PyTorch 检查当前环境是否有可用的 NVIDIA GPU# 文件路径check_gpu.py import torch print(PyTorch 版本:, torch.__version__) print(CUDA 是否可用:, torch.cuda.is_available()) if torch.cuda.is_available(): print(CUDA 版本:, torch.version.cuda) print(当前 GPU 索引:, torch.cuda.current_device()) print(GPU 名称:, torch.cuda.get_device_name(0)) total_memory torch.cuda.get_device_properties(0).total_memory / 1024 ** 3 print(GPU 显存总计: {:.2f} GB.format(total_memory)) else: print(当前环境没有可用的 NVIDIA GPU或尚未安装正确的 CUDA 驱动。)运行方式python check_gpu.py如果输出“CUDA 是否可用: True”说明 PyTorch 已经通过 CUDA 接入了 NVIDIA GPU。这段代码背后是一整套软件栈在支撑英伟达驱动、CUDA 运行时、cuDNN 算子库、PyTorch 的 CUDA 后端。每一步都有无数工程师做了兼容性测试和性能优化。再来看一个更直观的命令。NVIDIA 显卡驱动装好后命令行输入nvidia-smi这个命令会输出 GPU 型号、驱动版本、显存占用、当前运行进程等信息。它是排查 GPU 问题时的第一工具也是理解英伟达生态的一个入口。很多老开发者判断一台新机器能不能做深度学习第一件事就是跑 nvidia-smi。CUDA 生态之所以成为护城河核心原因是“迁移成本”。写 AI 应用时你现在用的 PyTorch、TensorFlow、ONNX Runtime、vLLM、DeepSpeed每一个工具的 GPU 加速都绕不开 CUDA。即使出现一款新的高性能 AI 芯片要让这些框架在上面跑起来需要重新编译算子、适配显存管理、调优通信库这不是几个月能完成的事。所以黄仁勋说“截然不同”技术含义是英伟达提供的不是“一块芯片”而是“一套让所有 AI 软件都能顺畅运行的底座”。OpenAI 造出芯片后接下来的真正难题是怎么让 PyTorch 的官方后端、主流推理引擎、分布式训练框架都支持它的新芯片。5. 自研芯片的真正挑战不只是“造出来”而是“用起来”很多人听到“OpenAI 造出 3nm 芯片”第一反应是“要颠覆英伟达了”。但芯片行业有一条铁律造出芯片只是第一步让开发者真正用起来才是珠穆朗玛峰。一块芯片要投入实际 AI 场景必须补齐以下环节第一编译器。深度学习框架生成的中间表示需要被编译器翻译成能在新芯片上高效运行的机器码。LLVM、TVM、MLIR 都是这个链条上的关键工具。自研芯片如果没有一套成熟的编译栈框架就没法高效调用它。第二算子库。矩阵乘法、卷积、归一化、注意力机制这些基础算子必须针对芯片的硬件结构做手写优化。通用 GPU 的算子库是几十年积累的结果新芯片想追平需要有大量会写底层优化的工程师。第三框架适配。PyTorch 要跑在新芯片上最简单的方式是走 PyTorch 的后端扩展机制或者通过 ONNX Runtime 等中间层。无论哪种方式都需要逐算子验证正确性和性能。第四分布式通信。现代大模型训练需要多卡并行NVIDIA 有 NCCL 提供高效的多卡通信。新芯片要进入训练场景必须有对应的通信库否则只能放到推理场景里用。说到这里就不难理解为什么目前更稳妥的路线是“推理优先”。OpenAI 自研芯片如果先用于自家服务的推理链路场景足够大路径也短得多。它不需要覆盖所有模型、所有算子只需要把自己主力模型的推理链路优化好就能产生实际价值。训练场景涉及数十万种模型结构和算子组合生态要求远高于推理。这次事件值得关注的真正技术信号是AI 芯片开始从“通用生态”走向“场景定制”。过去 AI 芯片几乎只有一种主流选择英伟达 GPU。未来可能出现多种形态有人做训练特化芯片有人做推理特化芯片有人做端侧 NPU。对开发者这既是挑战也是机会。6. 竞争变化对普通开发者的实际影响芯片层面的竞争传导到普通开发者这里会体现在三个层面API 成本、工具链多样性、推荐的部署方式。先看 API 层。OpenAI 提供 API 服务同时也在布局自己的算力底座英伟达则通过 NGC、NIM、免费 token 等方式让开发者快速体验 GPU 加速服务。对使用 API 的开发者来说这场竞争可能在某种程度上降低算力使用成本因为供给方变多了。再看工具链。OpenAI 在开源开发工具上动作相当频繁比如 Codex CLI、Codex Harness 等工具已经可以在 GitHub 上找到。这些工具的核心是让开发者用自然语言驱动编程任务同时保留工程化的执行流程。英伟达也提供了自己的开发者入口和模型服务。无论哪一方都在努力往“更适合开发者的工作流”方向走。最后是部署方式。未来你在做模型推理部署时可能会面对更多选择通用 GPU、云厂商自研芯片、OpenAI 这类模型公司的定制芯片、端侧 NPU。这时候就需要你的模型具备良好的可移植性。一个直接的做法是在模型代码中避免绑定单一硬件特性而是通过 PyTorch 的设备抽象层来管理设备。下面是一段典型的设备无关训练代码展示如何让代码在 CPU 和 NVIDIA GPU 之间自动切换# 文件路径train_cifar.py简化示例 import torch import torch.nn as nn from torch.utils.data import DataLoader from torchvision import datasets, transforms device torch.device(cuda if torch.cuda.is_available() else cpu) class SimpleNet(nn.Module): def __init__(self): super().__init__() self.fc nn.Sequential( nn.Linear(32 * 32 * 3, 512), nn.ReLU(), nn.Linear(512, 10) ) def forward(self, x): return self.fc(x.view(x.size(0), -1)) model SimpleNet().to(device) criterion nn.CrossEntropyLoss() optimizer torch.optim.Adam(model.parameters(), lr0.001) transform transforms.Compose([transforms.ToTensor()]) train_dataset datasets.CIFAR10(root./data, trainTrue, downloadTrue, transformtransform) train_loader DataLoader(train_dataset, batch_size64, shuffleTrue) for epoch in range(3): for images, labels in train_loader: images, labels images.to(device), labels.to(device) optimizer.zero_grad() outputs model(images) loss criterion(outputs, labels) loss.backward() optimizer.step() print(fEpoch {epoch 1} 完成loss: {loss.item():.4f})这段代码的核心思路是先通过torch.device(cuda if torch.cuda.is_available() else cpu)屏蔽设备差异再把模型和数据都放到同一个设备上。以后出现新的硬件后端只要能通过 PyTorch 的设备抽象层接入你的代码迁移成本就会小很多。7. 开发者在 AI 芯片时代应该建立的关键能力不管芯片格局怎么变有几项能力是长期有价值的。第一项能力读懂硬件指标。AI 开发不能只停留在调用库的水平。你要能看懂算力、显存带宽、内存容量、互联方式对模型训练和推理的影响。比如推理场景中带宽往往比峰值算力更关键因为很多模型是访存密集型的。这些知识不依赖具体厂商换一个平台依然适用。第二项能力掌握可移植的部署方案。除了 PyTorch 的设备抽象ONNX 是一个值得关注的中间格式。模型可以先导出成 ONNX再通过不同后端的 ONNX Runtime 运行这意味着同一个模型可以跨多种硬件部署。虽然不同硬件上的性能可能差异很大但至少不会被锁死在单一架构上。下面是一个 ONNX 导出的示例帮你理解可移植性的价值# 文件路径export_onnx.py import torch import torchvision.models as models # 以 ResNet18 为例 model models.resnet18(pretrainedTrue) model.eval() dummy_input torch.randn(1, 3, 224, 224) torch.onnx.export( model, dummy_input, resnet18.onnx, export_paramsTrue, opset_version17, input_names[input], output_names[output], dynamic_axes{input: {0: batch_size}, output: {0: batch_size}} ) print(ONNX 模型导出完成保存为 resnet18.onnx)第三项能力熟练使用容器化环境。AI 开发环境非常依赖特定版本的 CUDA、Python、PyTorch容器是隔离这些依赖的最好方式。以 Docker 为例配置 GPU 环境的关键是安装 NVIDIA Container Toolkit然后运行docker run --gpus all --rm 镜像名称 nvidia-smi这种方式保证了代码在本机和云环境、不同显卡之间保持一致的运行行为是 AI 工程化的基础技能。第四项能力关注生态变化而不是只看跑分。芯片评测不能只看“峰值算力”更要看生态完整度。一个跑分很高但没有框架支持的芯片在工程上的价值可能不如一个跑分一般但工具链完善的芯片。OpenAI 自研芯片是否成功最终要看它的软件栈和生态能吸引多少开发者用它做实际业务。8. 常见误区与理性判断这次事件在网络上传播很快也带来了不少误解。汇总几个常见误区帮你建立理性判断。误区事实OpenAI 自研芯片马上会取代英伟达芯片从验证到大规模部署周期很长短期内训练生态仍高度依赖英伟达 CUDAAI 芯片只有 GPU 一种形态TPU、NPU、ASIC 都是 AI 芯片不同场景选不同架构造出芯片就能赢得市场软件栈、编译器、算子库、框架适配比芯片本身更关键芯片自研只对大公司有意义中小团队可以关注云厂商自研芯片和国产芯片它们同样会降低算力成本开发者不需要关心硬件模型并行、显存优化、推理延迟优化都依赖对硬件的理解第一个误区最需要展开。从材料看OpenAI 确实用约 9 个月时间推进了首款 3nm 自研芯片的设计验证这是相当快的进展但“设计验证通过”和“大规模部署上线”之间还有不短的距离。英伟达的 CUDA 生态积累已经很多年PyTorch、TensorFlow 等主流框架的后端深度适配、分布式训练通信库、推理引擎优化都不是短时间能复制的。所以更理性的判断是OpenAI 自研芯片会在它自己的推理场景里率先发挥作用但不会快速撼动英伟达在训练和高性能通用计算领域的地位。另一个容易误解的点是“自研芯片一定比通用芯片强”。通用 GPU 的设计目标是覆盖尽可能多的计算任务自研芯片的设计目标是针对特定任务做到极致。在 OpenAI 的具体模型和推理负载上自研芯片确实可能比通用 GPU 更高效但在其他模型、其他场景上它的适用性还有待验证。9. 总结与后续学习方向OpenAI 首款自研 AI 芯片和黄仁勋的回应本质上是 AI 算力行业从“单极生态”进入“多路线竞争”的一个信号。芯片本身只是起点真正决定胜负的是软件生态、工程能力、部署规模。英伟达有 CUDA 和成熟工具链的优势OpenAI 有模型定制和垂直整合的优势各有各的牌可以打。对普通开发者的建议非常明确不要把自己的技术栈死死绑在某一款芯片或某一个框架上。平时写训练和推理代码时尽量遵循设备无关的写法多了解 ONNX、MLIR、多种推理引擎这些“中间层技术”它们会在多芯片竞争的时代降低你的迁移成本。同时保持对 nvidia-smi、CUDA 版本、PyTorch 硬件后端这些基础工具的熟悉因为无论芯片格局如何变化这些底层的工程能力始终有用。如果你想继续深入建议关注几个方向CUDA 编程基础哪怕只是了解线程层级和显存模型也有助于理解为什么 GPU 适合 AIONNX Runtime 的多后端部署这是真正让你摆脱单一硬件绑定的一条路径还有 GPU 性能分析工具比如 nsys、ncu它们能帮你找到模型在硬件上的瓶颈。AI 芯片的格局远没有到终局比芯片本身更值得关心的是你的代码如何在这个多架构时代保持适应力这恰恰是技术研发中最有价值的长期储蓄。
返回列表