尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

神经网络从零手写全流程指南:用 7 个 Jupyter 笔记本跑通 micrograd 反向传播与语言模型训练

神经网络从零手写全流程指南:用 7 个 Jupyter 笔记本跑通 micrograd 反向传播与语言模型训练 神经网络从零手写全流程指南用 7 个 Jupyter 笔记本跑通 micrograd 反向传播与语言模型训练【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-heroNeural Networks: Zero to Hero 是一套从零手写神经网络的课程笔记本合集micrograd 讲透标量自动求导与反向传播makemore 系列把字符级语言模型从 bigram 一路堆到类 WaveNet 的 CNN。仓库极简核心价值就一句话——你跟着敲而不是跟着看。先摸清家底仓库目录结构与两条学习主线 整个仓库只有三层东西5 分钟能看完README.md课程目录按 Lecture 1 到 8 列清了每讲的主题、前置要求比如 micrograd 只需会 Python 高中学过微积分的模糊记忆和配套文件位置。lectures/micrograd/2 个笔记本对应第一讲的前后半场——micrograd_lecture_first_half_roughly.ipynb 从求f(x) 3x² - 4x 5的导数写起手搓class Value标量引擎micrograd_lecture_second_half_roughly.ipynb 拿这个引擎搭小网络、做梯度下降。lectures/makemore/5 个笔记本按 part1→part5 排列每个只在上一个基础上加一层复杂度makemore_part1_bigrams.ipynb字符 bigram 语言模型同时引入torch.Tensor和训练—采样—算 loss的完整框架makemore_part2_mlp.ipynb两层 MLP顺带覆盖学习率、train/dev/test 划分、过拟合这些 ML 基本功makemore_part3_bn.ipynb检查前向激活与反向梯度的统计量讲清为什么深网训练脆弱再引入 BatchNormmakemore_part4_backprop.ipynb不调loss.backward()从交叉熵 loss 一路手推到 embedding 层——这是全套课程最硬核的一节makemore_part5_cnn1.ipynb把 MLP 改造成树状深层结构得到一个类似 WaveNet 的卷积网络顺带熟悉torch.nn的工程用法。两条线的关系是micrograd 负责原理标量级 autogradmakemore 负责工程张量级 autograd 语言模型。先走 microgradpart4 的手推才不会变成天书。什么人该学、什么场景别硬上适合想搞清楚反向传播到底在算什么的初学者天天写 PyTorch 但从没手写过 autograd 的开发者准备往 GPT/LLM 方向深入、想理解语言模型框架自回归、采样、nll 损失的人。不适合只想快速调 API 出效果的场景——这套课节奏偏慢直接看框架官方教程更快以及数学底子较薄的朋友建议先复习一遍导数和链式法则否则第一讲会看得很吃力。一个明确的边界README 里列到第 8 讲从零搭 GPT、GPT 分词器但仓库里没有这两讲的笔记本目前只有视频内容别在目录里找文件找半天。实操路线从 clone 到 part5 的五步走法 ✅克隆仓库git clone https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero装好 Python 环境后pip install numpy matplotlib jupyter就能开跑 micrograd 两个笔记本。顺序跑 lectures/micrograd/ 的两个 notebook。验证点你能自己写出(f(xh)-f(x))/h的数值求导并能解释class Value里为什么每个值要记录grad和backward()。补一点 PyTorch Tensor 基础后从 makemore_part1_bigrams.ipynb 开始。注意part1 起每个 notebook 第一行就是words open(names.txt, r).read().splitlines()而仓库里并不带这个数据文件——你需要自己准备一个人名列表names.txt放到笔记本运行目录否则第一个 cell 就会报文件不存在。按 part2→part3→part4→part5 的顺序推进每节只加一层复杂度MLP → BatchNorm → 手推反向传播 → CNN。每节结束用 README 里对应讲的主题当验收清单比如 part2 要能说清学习率怎么调、train/dev/test 怎么分part3 要能解释 BatchNorm 改变了激活的什么统计量。part4 建议配视频用边做边卡住的方式先自己推梯度卡住再回看对应讲解。这一节做完后面读任何loss.backward()相关代码都是透明的。最容易翻车的五个地方 ⚠️跳过 micrograd 直接进 makemore后续所有 autograd 都变黑盒part4 基本没法独立做。微积分没跟上的人同样建议先补基础再开第一讲。part4 只看不写作者原话是这讲不是设计成纯看的纯看视频收获会打对折自己先把每层梯度推一遍。找不到 names.txt 就以为仓库坏了数据文件本就不在仓库里准备一个纯文本人名列表即可别去改 notebook。part5 张量形状靠猜那一节torch.nn用法密度高遇到nn.Parameter、卷积输出维度对不上的情况多print几行 shape、多翻文档比硬试快得多。以为仓库里有 GPT 讲的代码第 7、8 讲只有视频仓库内没有对应 notebook想要代码得另找资源别在本仓库里耗时间。今晚就能开始 clone 下来打开 lectures/micrograd/ 第一个 notebook 把前 5 个 cell 跑完——等你哪天能自己把 part4 的梯度从 loss 推到 embedding再回头看 GPT 那讲感受会完全不一样。【免费下载链接】nn-zero-to-heroNeural Networks: Zero to Hero项目地址: https://gitcode.com/GitHub_Trending/nn/nn-zero-to-hero创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表