
10周MLOps完整路径从训练到生产模型部署【免费下载链接】MLOps-Basics项目地址: https://gitcode.com/GitHub_Trending/ml/MLOps-Basics模型在笔记本上跑得好好的loss一路往下掉。一推到生产环境报错扑面而来。依赖缺失模型文件找不到配置文件散了一地。MLOps-Basics 是个教程仓库。它用 10 周走完模型部署的全路径从一条训练脚本走到生产级在线服务每周都有可运行的代码目录。它帮你省掉哪些坑 模型文件几百 MBgit 塞不下想回看上一版又没处找。项目把大文件交给 DVC代码走 git模型进远程存储每次训练都有版本号。调了参数重训三天后想不起哪组配置出过那个好结果。WB 记录参数、指标和图表Hydra 把配置拆成 yaml复现实验一条命令的事。自己机器上能跑换个人拉仓库就跑不动你开始远程修环境。交给 Docker 就行模型和依赖打进一个镜像CI 自动构建不用手工修环境。10周怎么走完10 周拆成 3 个阶段搭地基、跑通管线、交付上线。搭地基让模型能训、能复现第 0-2 周week_0_project_setup用 PyTorch Lightning 搭好数据、模型、训练和推理得到能训能推的基线项目。week_1_wandb_logging把参数、loss 曲线、混淆矩阵记进 WB拿到任意一次运行的复现能力。week_2_hydra_config参数拆进 yaml 文件改超参不再碰代码。训练能跑能复现之后下一个麻烦是资产模型、数据、配置都在变没版本管理回滚一天都够呛。跑通管线管住资产、包装模型第 3-4 周week_3_dvc模型和数据纳入 DVC 跟踪每次训练产物可追溯。week_4_onnx训练好的模型转成 ONNX推理不再被 PyTorch 运行时绑死。模型包装好、版本化之后最后一跃是上线放进云端给真实用户用还不能挂。交付上线从容器化到线上监控第 5-9 周week_5_dockerFastAPI 推理接口加 Dockerfile得到能直接跑的服务镜像。week_6_github_actions搭一条 CI/CD 流水线推送代码自动构建测试。week_7_ecr镜像进 ECR模型进 S3云端资产就位。week_8_serverless部署到 Lambda 加 API Gateway推理接口随请求弹性伸缩。week_9_monitoring搭 Kibana 仪表盘线上预测实时可查。工具链怎么串起来的 数据端HuggingFace Datasets 拉取分类数据集DVC 管数据和模型版本大文件落在 S3。git 只留代码和小配置仓库保持轻。训练端PyTorch Lightning 跑训练循环WB 记参数和指标Hydra 让你换一套配置就能跑一组新参数。每次运行都能复现。部署端ONNX 先把模型从训练框架里解放出来Docker 把模型加依赖打成镜像GitHub Actions 推送即自动构建ECR 负责存储Lambda 加 API Gateway 把它变成一个可访问的接口。监控端Lambda 的日志写进 CloudWatch再流到 ElasticsearchKibana 之上拼出实时仪表盘。预测异常和数据漂移能先被人看见。动手前先看这 3 条先把 week_0 跑起来。建个 Python 3.8 环境装依赖python train.py直到出 checkpoint。后面每周都叠在这个目录上基线不稳后面全是空中楼阁。仓库先 clone 下来git clone https://gitcode.com/GitHub_Trending/ml/MLOps-Basics账号提前注册。WB、云账号、AWS 访问密钥第 1 周之前就备齐。放到课程中段再补卡住的地方很难续上节奏。按目录顺序走别跳步。每周代码就是上一周加一个新模块改动不大但依赖真实存在跳了你就找不到问题出在哪。学完你能独立交付什么10 周走完你能交出一套完整的线上机器学习服务而不是一堆脚本。上游是一条可复现的训练管线配置在 yaml实验参数在 WB模型版本在 DVC。下游是全自动的交付链路推送代码触发构建镜像进 ECR生产里的 Lambda 服务自动更新。你解决的问题都是实打实的环境不一致、版本对不上、上线靠人肉、线上出事没预警。每个问题在这个仓库里都有对应的解法最后这套东西可以真的交给用户使用。打开 week_0 目录先让模型跑起来再说剩下的事交给后面 9 周。【免费下载链接】MLOps-Basics项目地址: https://gitcode.com/GitHub_Trending/ml/MLOps-Basics创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考