
Qwen3.5-35B-A3B-AWQ-4bit保姆级部署指南vLLMcompressed-tensors一键启动1. 模型介绍Qwen3.5-35B-A3B-AWQ-4bit是一款面向视觉多模态理解的量化模型特别适合需要图片分析和图文对话的应用场景。这个模型经过4bit量化处理后在保持较高精度的同时大幅降低了显存需求。1.1 核心能力能力类型具体功能图片理解识别图片中的物体、场景、文字等内容图文问答针对图片内容进行多轮提问和回答视觉描述自动生成图片的详细文字描述中文支持全程中文输入输出适合国内用户1.2 技术特点高效量化采用AWQ(Activation-aware Weight Quantization)4bit量化技术多模态支持同时处理图像和文本输入双卡优化针对24GB显存显卡进行特别优化稳定部署基于vLLM和compressed-tensors的稳定推理方案2. 环境准备2.1 硬件要求GPU至少2张24GB显存的NVIDIA显卡如RTX 3090×2内存建议64GB以上存储至少50GB可用空间2.2 软件依赖# 基础环境检查 nvidia-smi # 确认显卡驱动正常 docker --version # 确认Docker已安装 nvidia-docker --version # 确认NVIDIA Docker已安装3. 一键部署指南3.1 获取镜像docker pull csdn-mirror/qwen35-awq:latest3.2 启动容器docker run -itd --gpus all \ -p 7860:7860 \ -p 8000:8000 \ --name qwen35-awq \ csdn-mirror/qwen35-awq:latest3.3 服务验证# 检查后端服务状态 docker exec -it qwen35-awq supervisorctl status # 预期输出示例 qwen35awq-backend RUNNING qwen35awq-web RUNNING4. 使用教程4.1 访问Web界面本地浏览器访问http://服务器IP:7860或通过SSH隧道访问ssh -L 7860:localhost:7860 用户名服务器IP4.2 基础使用流程上传图片点击上传按钮选择本地图片输入问题在对话框输入关于图片的问题获取回答点击发送按钮等待模型响应4.3 使用示例测试图片上传一张包含猫和狗的图片问题示例图片中有哪些动物猫是什么颜色的它们在做什么5. 高级配置5.1 参数调整参数文件路径关键参数建议值/root/workspace/config.jsontensor_parallel_size2/root/workspace/config.jsonmax_model_len4096/root/workspace/config.jsonenforce_eagertrue5.2 性能优化建议对于大图片(5MB)建议先压缩再上传复杂问题可以拆分为多个简单问题逐步提问同一会话中保持图片不变可获得更好连续性6. 运维管理6.1 服务监控# 查看实时日志 docker exec -it qwen35-awq tail -f /root/workspace/qwen35awq-backend.log # 资源监控 docker stats qwen35-awq6.2 常见维护操作# 重启服务 docker exec -it qwen35-awq supervisorctl restart all # 更新镜像 docker stop qwen35-awq docker rm qwen35-awq docker pull csdn-mirror/qwen35-awq:latest # 然后重新运行启动命令7. 总结本指南详细介绍了Qwen3.5-35B-A3B-AWQ-4bit模型的部署和使用方法。通过vLLMcompressed-tensors的技术方案即使是量化后的多模态大模型也能稳定运行。这种部署方式特别适合需要图片理解和图文对话能力的应用场景。实际使用中建议从简单图片和问题开始测试逐步尝试更复杂的多轮对话关注GPU显存使用情况定期检查服务日志获取更多AI镜像想探索更多AI镜像和应用场景访问 CSDN星图镜像广场提供丰富的预置镜像覆盖大模型推理、图像生成、视频生成、模型微调等多个领域支持一键部署。