尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

CLIP 图文匹配与零样本图像分类教程:从安装到实战的完整指南

CLIP 图文匹配与零样本图像分类教程:从安装到实战的完整指南 CLIP 图文匹配与零样本图像分类教程从安装到实战的完整指南【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIPCLIPContrastive Language-Image Pretraining对比语言-图像预训练是一个在数亿图像文本配对上训练过的模型它把图片和文字都编码进同一个向量空间这样给定一张图就能在一组候选描述里挑出语义最贴切的那条甚至直接完成零样本zero-shot无需针对目标任务训练图像分类。本文按环境准备 → 首次验证 → 原理拆解 → 实战 → 模型选型 → 排错的顺序覆盖 CLIP 的安装、最小可运行示例、CIFAR-100 零样本分类和常见报错。适合第一次使用 CLIP 做图文匹配、图片打标签的工程师。3 步装好 Python 3.8 PyTorch 运行环境环境要求不高Python 3.6 以上建议 3.8、PyTorch 1.7.1 以上低于 1.7.1 会触发版本警告。核心流程三步走建独立环境避免依赖污染conda create -n clip-env python3.8 -y conda activate clip-env装 PyTorch按机器类型二选一# 带 CUDA GPU 的机器 conda install -y -c pytorch pytorch torchvision cudatoolkit11.3 # 纯 CPU 机器含 macOS pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu装 CLIP 自身依赖并安装为包。先克隆仓库git clone https://gitcode.com/GitHub_Trending/cl/CLIP cd CLIP pip install ftfy regex tqdm packaging # 与 requirements.txt 保持一致 pip install .环境类型安装差异CUDA GPUconda装 PyTorch cudatoolkit版本与本机驱动对齐纯 CPU / macOSpip装cpu版 wheel无 cudatoolkit离线机器先把权重文件手动放进~/.cache/clip/再pip install .装完可以用python -c import clip; print(clip.available_models())快速验证应打印 9 个模型名。5 分钟验证 CLIP 图文匹配是否可用保存为verify.py放在仓库根目录那里正好有一张CLIP.png原理图import torch import clip from PIL import Image device cuda if torch.cuda.is_available() else cpu model, preprocess clip.load(ViT-B/32, devicedevice) image preprocess(Image.open(CLIP.png)).unsqueeze(0).to(device) text clip.tokenize([a diagram, a dog, a cat]).to(device) with torch.no_grad(): logits_per_image, _ model(image, text) # 返回余弦相似度 x 100 的 logits probs logits_per_image.softmax(dim-1).cpu().numpy() print(probs) # [0.9928 0.0042 0.003]注意两点首次运行会自动下载ViT-B/32权重数百 MB下载逻辑和 SHA256 校验在 clip/clip.py 的_download函数里缓存目录是~/.cache/clip/。clip.load同时返回preprocess变换它做 224×224 缩放、中心裁剪和归一化图片必须先过它再喂给模型。预期输出第一项对应 a diagram接近 1。如果三条概率接近均分多半是模型没加载对如果报错先看下一节理解输入要求。图文匹配分数是怎么算出来的 一句话版CLIP 是一对翻译器图像编码器和文本编码器分别把各自输入压成 512 维特征向量打分就是比这两个向量的夹角夹角越小越匹配——类似在人脸库里找最像的那张脸只是脸换成了图文共享的语义空间。推理路径拆开只有四步预处理图像preprocess把 PIL 图变成[3, 224, 224]张量定义在 clip/clip.py 的_transform。分词文本clip.tokenize用 BPEByte-Pair Encoding字节对编码分词固定输出 77 个 token 位置分词器实现在 clip/simple_tokenizer.py。各自编码model.encode_image走 ResNet 或 ViT 图像分支model.encode_text走 Transformer 文本分支结构都在 clip/model.py。算相似度两个向量做 L2 归一化后点积即余弦相似度model(image, text)直接返回相似度 × 100 的 logitssoftmax将数值压缩为概率分布后就是各候选的匹配概率。CLIP 的对比预训练过程与零样本预测原理如下用 CIFAR-100 跑一个零样本分类把上面三条候选扩展到 100 个类名就是一个完整的零样本分类器——全程不需要一张标注数据。代码基于 README.md 中的官方示例精简而来import os import clip, torch from torchvision.datasets import CIFAR100 device cuda if torch.cuda.is_available() else cpu model, preprocess clip.load(ViT-B/32, devicedevice) cifar100 CIFAR100(rootos.path.expanduser(~/.cache), downloadTrue, trainFalse) image, _ cifar100[3637] # 第 3637 张验证集样本 image_input preprocess(image).unsqueeze(0).to(device) # 关键给每个类名套上自然语言提示模板 text_inputs torch.cat( [clip.tokenize(fa photo of a {c}) for c in cifar100.classes] ).to(device) with torch.no_grad(): img_f model.encode_image(image_input) txt_f model.encode_text(text_inputs) # L2 归一化 - 余弦相似度 x 100 - softmax img_f / img_f.norm(dim-1, keepdimTrue) txt_f / txt_f.norm(dim-1, keepdimTrue) sim (100.0 * img_f txt_f.T).softmax(dim-1) values, indices sim[0].topk(3) for v, i in zip(values, indices): print(f{cifar100.classes[i.item()]:12s}: {100 * v.item():.2f}%)输出大致是snake: 65.31% turtle: 12.29% sweet_pepper: 3.83%蛇排在第一概率占 65%这就是零样本100 个类全部来自文本提示没有任何针对 CIFAR 的训练。提示模板对结果影响很大a photo of a {c}与{c}能拉开几个点准确率可以对照 notebooks/Prompt_Engineering_for_ImageNet.ipynb 里的系统对比实验。RN50 与 ViT-B/32 怎么选 9 个模型里最常用的是下面四个按精度换资源的思路挑模型名图像编码器输入分辨率参数量级定位RN50ResNet-50224×224~1 亿最轻纯 CPU 批量打标签首选ViT-B/32ViTpatch 32224×224~1.5 亿默认选择精度/速度平衡ViT-B/16ViTpatch 16224×224~1.5 亿精度更高推理更慢ViT-L/14ViTpatch 14224×224另有 336 版~3 亿精度最高显存需求大选择建议显存小于 8 GB 或想在 CPU 上跑批RN50单张推理毫秒级。常规开发验证ViT-B/32与 README 示例一致社区基线最好对齐。追求上限且显存够ViT-L/14注意 336px 版本权重和显存占用都明显更大。另外clip.load(name, jitTrue)会加载 TorchScript 加速版本tests/test_consistency.py 用CLIP.png验证两种加载方式输出一致容差atol0.01, rtol0.1可以放心在生产里用jitTrue提速。常见报错与修复速查表 错误现象原因解决ModuleNotFoundError: No module named clip包没装进当前激活的 conda 环境在仓库根目录重新pip install .确认conda activate成功RuntimeError: Input ... is too long for context length 77文本分词后超过 77 个 token精简提示词或改用clip.tokenize(texts, truncateTrue)截断首次clip.load长时间无响应正在远程下载数百 MB 权重检查网络离线场景手动把.pt文件放入~/.cache/clip/RuntimeError: ... exists and is not a regular file缓存目录里同名项是个目录SHA256 校验无法进行移走该目录项后重新运行触发下载CUDA out of memory显存不足换RN50、减小 batch size或改 CPU 跑特征提取警告PyTorch version 1.7.1 or higher is recommendedtorch 版本低于 1.7.1升级 PyTorch低版本下tokenize返回 dtype 也会不同下一步与资源导航建议路线先把上面的 CIFAR-100 例子跑通再把自己的业务标签替换cifar100.classes观察排序是否符合直觉之后可以试线性探针linear-probe评估——冻结encode_image输出在上面只训一个逻辑回归README.md 的 Linear-probe evaluation 一节有完整代码。关键文件索引README.md — 完整 API 说明与零样本预测、线性探针两个官方示例clip/clip.py —load/tokenize/available_models入口含权重下载与校验clip/model.py — ResNet/ViT 图像分支与 Transformer 文本分支的结构定义clip/simple_tokenizer.py — BPE 分词器与 77 长度上下文处理notebooks/Interacting_with_CLIP.ipynb — 交互式图文打分演示 Notebooknotebooks/Prompt_Engineering_for_ImageNet.ipynb — ImageNet 上的提示词工程对比实验tests/test_consistency.py — JIT 与 Python 加载方式一致性测试model-card.md — 训练数据构成与模型局限性说明data/prompts.md — 论文附录中的常用提示模板清单【免费下载链接】CLIPCLIP (Contrastive Language-Image Pretraining), Predict the most relevant text snippet given an image项目地址: https://gitcode.com/GitHub_Trending/cl/CLIP创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表