尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

194、Docker容器化机器人应用:镜像构建GPU直通与版本管理

194、Docker容器化机器人应用:镜像构建GPU直通与版本管理 194、Docker容器化机器人应用:镜像构建GPU直通与版本管理昨晚在调试一台UR5e的抓取管线时,又双叒叕遇到了那个经典问题——宿主机上跑得好好的PyTorch模型,一进容器就报CUDA out of memory。更诡异的是nvidia-smi在容器里显示显存占用为0,但程序就是分配不到显存。这种问题在机器人实验室里太常见了,今天就把Docker容器化机器人应用这件事彻底讲透。从一次真实的容器翻车现场说起先说说上周的教训。我们团队在部署一个基于VLA的机械臂抓取系统时,Dockerfile里写了FROM nvidia/cuda:11.8.0-devel-ubuntu20.04,然后pip install torch==2.0.0。结果容器一启动,加载模型直接报libcudnn.so.8: cannot open shared object file。查了半天发现是CUDA 11.8自带的cuDNN版本和PyTorch 2.0要求的cuDNN版本不匹配——PyTorch 2.0需要cuDNN 8.6,而CUDA 11.8.0镜像里默认带的是8.4。这种版本地狱在机器人项目里简直是家常便饭。更坑的是,我们有个同事图省事,直接在nvidia/cuda镜像上apt-get install python3-pip,然后pip install一堆东西。结果镜像体积飙到8GB,每次拉取都要等十分钟。后来才发现,nvidia/
返回列表