尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

数字识别检测系统实战:YOLO多版本选型、训练部署与大模型集成

数字识别检测系统实战:YOLO多版本选型、训练部署与大模型集成 数字识别检测听起来是一个已经被“做烂”的方向MNIST 手写数字准确率早就 99% 以上了OpenCV 模板匹配也可以处理印刷体数字还有什么好研究的但如果你真正接过一个实际项目就会发现电表读数识别、仪器仪表数字读取、票据金额检测、仓储货架编号识别、二维码旁边的数字定位……这些场景和 MNIST 完全不是一回事。光照变化、遮挡、倾斜、模糊、字体差异、单个数字和连续数字区域并存每一项都能让传统方案直接失效。更复杂的是当你准备用 YOLO 系列模型来落地时还会面临一个绕不开的问题YOLOv8、v10、v11、v12、v26 这么多版本到底该选哪一个是盲目追新还是按场景老老实实选型这篇文章不是单纯讲 YOLOv8 怎么训练也不是大模型 API 的调包教程而是围绕“数字识别检测系统”这个完整场景把三件事讲透YOLO 系列多版本演进到底改了什么数字识别场景下该如何对比和选型从数据集标注、模型训练、推理验证到部署上线的全栈实践路径千问Qwen、DeepSeek 这类大语言模型在数字识别系统里到底能扮演什么角色怎么接入才不是“为了 AI 而 AI”。如果你正准备做一个检测类项目或者已经在用 YOLO 系列但纠结版本迁移又或者想给自己的 CV 项目接上大语言模型能力这篇文章值得你读完并收藏。1. 数字识别检测系统真正难在哪很多初学者会把“数字识别”等同于 MNIST 分类任务输入一张标准化的 28×28 图片输出一个 0 到 9 的类别。但实际上真实场景中的数字识别几乎都是检测任务而不是纯分类任务。一个完整的数字识别检测系统需要在自然图像中先定位数字出现的位置再判断每个位置的数字内容。常见的业务场景包括场景数字形态核心难点电表/水表读数识别多位连续数字可能带小数点和单位表盘反光、视角倾斜、数字区域小票据金额识别印刷体数字票据背景复杂印章遮挡、背景纹理干扰、多种字体仓储货架编号大号喷涂数字或贴纸编号透视畸变、距离远导致目标小设备序列号蚀刻或喷码数字低对比度、字符间距不均匀车牌中的数字多行小字分辨率低、光照不均匀这些场景的共同特点是检测框必须准漏检代价高且模型需要在边缘设备或现有服务器上稳定运行。而 YOLO 系列作为端到端的目标检测模型把定位和分类在一个网络里完成天然适合这类任务。不过真正让新手头疼的不是算法本身而是工程选择同一张图片里应该把“123.4”当作一个整体框还是把每个数字单独框出来标注的时候贴着数字边界框还是稍微留点边缘训练时用 COCO 预训练权重还是从零开始不同 YOLO 版本导出的 ONNX、TensorRT 模型部署方式又不一样。这篇文章的实践路线会围绕这些问题逐一展开。2. YOLO 系列演进从 v8 到 v26每一代改了什么YOLOYou Only Look Once系列从 2015 年诞生到今天已经经历了多轮架构迭代。对于做工程落地的人来说不需要背下每个模块的论文公式但要理解每一代改动的核心方向因为这决定了选型时的判断依据。2.1 YOLOv8统一框架时代的起点YOLOv8 由 Ultralytics 团队推出是当前社区生态最成熟、教程最丰富、部署案例最多的版本。它的核心贡献不只是模型结构而是一套统一的工程框架提供了ultralyticsPython 包训练、验证、导出、推理全部一体化支持分类、检测、分割、姿态估计多种任务提供了yolov8n/s/m/l/x多个尺寸方便按算力选择内置数据增强策略小规模数据集也能训练出可用模型。在结构上YOLOv8 把 C3 模块替换为 C2f 模块检测头改为 anchor-free 设计解码逻辑也简洁了很多。对数字识别这类小目标检测任务YOLOv8 的默认策略已经足够用而且社区里针对小目标的改进方案非常多。简单判断如果你第一次接触 YOLO或者需要一个最稳妥的基线方案YOLOv8 是最不容易出错的选择。2.2 YOLOv10端到端无 NMS 检测YOLOv10 由清华大学团队提出最重要的变化是去掉了传统检测模型中的 NMS非极大值抑制后处理步骤。这个设计带来了两个工程价值推理管线更简单省去了 NMS 的阈值调参延迟更低在高并发场景下有优势。但要注意YOLOv10 的部署生态不如 YOLOv8 统一。如果你需要做 TensorRT 加速、端侧部署需要自己确认各环节对 v10 的支持情况。2.3 YOLOv11梯度流与结构优化YOLOv11 由 Ultralytics 继续迭代主要改进了 C3k2 模块、SPPF 结构和检测头设计整体在同等计算量下比 v8 有轻微精度提升。但它最重要的意义在于延续了 Ultralytics 的工程生态ultralytics包可以直接用yolo命令行完成训练和导出几乎无缝从 v8 切换到 v11。如果你的项目已经在用 v8升级到 v11 的训练脚本改动量通常很小这是一个值得考虑的因素。2.4 YOLOv12注意力机制的引入YOLOv12 发布于 2025 年初核心思路是把注意力机制引入 YOLO 框架在保持实时性的同时提升长距离依赖建模能力。对数字识别这类任务来说如果图片中存在密集排列的数字、字符间距不均匀或者在复杂背景中需要关注上下文v12 的注意力结构可能会带来更好的效果。但注意力机制也会增加计算量在低端 GPU 或嵌入式设备上不一定划算。选型时还是要结合自己的推理硬件。2.5 v26 以及更远的版本从项目标题看版本序列已经走到了 v26。坦率说对绝大多数数字识别业务来说v26 带来的增量收益通常不会是“质变”。新版本在结构、训练策略、部署格式上会持续优化但真实项目的精度瓶颈往往在数据质量和标注规范上而不是模型结构那 0.5 个点的 mAP 提升。所以我的判断是多版本对比的更高价值不是帮你找到“最强”模型而是帮你建立一套按场景、数据量、硬件条件做选型的工程方法论。2.6 版本选择总结版本核心变化适合场景工程注意点YOLOv8Anchor-free、C2f、统一生态通用检测基线、新手入门、快速落地生态成熟参考案例多YOLOv10无 NMS、端到端低延迟高并发服务部署链路需自行验证YOLOv11梯度流优化需要小幅提升且不想大改工程脚本可沿用 v8 习惯YOLOv12引入注意力机制密集/小目标场景、关注上下文计算量增加注意硬件v26 等新版本持续优化追求最新能力、长期维护先做基线对比再迁移3. 数字识别数据集标注质量比模型版本更关键在实际项目中数据准备阶段的工作量往往占整个项目的 60% 以上。模型结构可以换但数据质量不上来换什么版本都白搭。3.1 数据来源数字识别数据集通常来自三个渠道公开数据集例如 SVHN街景门牌号、MNIST、ICDAR 系列中的数字场景。可以通过这些数据做预训练或补充训练但要注意公开数据的场景分布与你的真实业务是否一致。自采数据用真实设备拍摄目标场景这是最可靠的数据来源。哪怕只有几百张也要优先用真实业务数据做微调。合成数据通过程序生成数字图片叠加字体、背景、噪声、模糊等变化。适合作为补充但必须配合人工抽检避免模型学习到合成数据的特有分布。3.2 标注规范数字识别标注的核心问题是“标注单位”每个数字单独一框适合需要精确读取每一位数字的场景比如识别仪器仪表读数后续可以结合顺序关系解析成数字串。连续数字区域一框适合只需要检测“这一区域有数字”并交给 OCR 或后处理识别的场景比如票据金额区域。数字小数点负号单独类别如果图像中可能出现小数点或负号建议单独设置类别而不是混在一起。对于每个数字单独标注的情况标注时建议遵循以下规则框要贴合数字边缘但避免切到背景纹理遮挡过多的数字可以跳过不强行标注模糊到人眼都无法判断的数字建议直接从训练集中删除同一张图中的数字如果属于不同逻辑单元比如表盘上的“123”和单位“456”要根据业务需求决定是否都标注。推荐使用 LabelImg、X-AnyLabeling 或 Roboflow 工具完成标注。小规模数据集用 LabelImg 足够X-AnyLabeling 支持更丰富的辅助标注功能。3.3 数据组织与配置建议把数据集按下面的目录结构组织digit_dataset/ ├── images/ │ ├── train/ │ ├── val/ │ └── test/ ├── labels/ │ ├── train/ │ ├── val/ │ └── test/ └── digit_dataset.yaml对应的 YAML 配置文件如下# 文件路径digit_dataset/digit_dataset.yaml path: ./digit_dataset train: images/train val: images/val test: images/test names: 0: digit如果每个数字 0-9 是独立类别# 文件路径digit_dataset/digit_dataset_10cls.yaml path: ./digit_dataset train: images/train val: images/val test: images/test names: 0: 0 1: 1 2: 2 3: 3 4: 4 5: 5 6: 6 7: 7 8: 8 9: 9注意类别名称不要带中文标注文件中的 class id 从 0 开始计数标注格式为class_id x_center y_center width height坐标使用归一化后的值。4. 环境准备用最小代价跑通训练数字识别检测系统的环境配置并不复杂关键在于选择一个适合自己硬件的组合。4.1 基础环境推荐使用 Anaconda 或 Miniconda 管理 Python 环境。以下配置适用于绝大多数 YOLO 实践conda create -n yolo_digit python3.10 -y conda activate yolo_digit # 安装 PyTorch根据 CUDA 版本调整命令 # CPU 版本 pip install torch torchvision --index-url https://download.pytorch.org/whl/cpu # GPU 版本示例CUDA 11.8 pip install torch torchvision --index-url https://download.pytorch.org/whl/cu118 # 安装 ultralytics pip install ultralytics4.2 硬件说明从网络上的讨论热度来看不少同学关心 GTX 1660 Ti 这类入门级显卡能不能跑 YOLO。答案是能跑但需要做取舍。GTX 1660 Ti 显存约 6GB可以训练yolov8n、yolov8s等小模型训练时要调小batch-size例如batch8或batch16输入分辨率不要盲目开大imgsz640是平衡速度和精度的默认选择如果显存仍然溢出可以启用amp混合精度训练Ultralytics 默认开启。如果没有 GPU也可以先在 CPU 上用小规模数据跑通流程但完整训练不现实建议直接在云 GPU 或本地 GPU 上进行。5. 核心流程用 YOLOv8 训练一个数字检测模型下面我们用一个最小示例跑通整个流程。这里以单类别“数字区域检测”为例实际工程中可以根据标注方案调整类别数。5.1 训练命令在项目根目录执行yolo detect train \ datadigit_dataset/digit_dataset.yaml \ modelyolov8n.pt \ epochs100 \ imgsz640 \ batch16 \ device0 \ projectruns/train \ namedigit_yolov8n参数说明modelyolov8n.pt使用 COCO 预训练权重作为起点这比从零开始训练收敛更快、精度更高epochs100数字识别数据集通常不大100 轮足够但要看验证集 loss 是否收敛imgsz640输入分辨率目标数字较小时可以考虑 960但训练时间会明显增加batch16根据显存调整显存不足时降到 8 或 4device0指定 GPU 序号CPU 训练可改为devicecpu但不推荐。5.2 训练输出关键文件训练完成后在runs/train/digit_yolov8n/目录下可以看到weights/best.pt验证集上最优权重weights/last.pt最后一个 epoch 的权重results.csv每一轮的 loss、精度、召回率等指标confusion_matrix.png混淆矩阵val_batch*.jpg验证集预测可视化。5.3 推理验证训练完成后使用如下命令对单张图片做推理yolo detect predict \ modelruns/train/digit_yolov8n/weights/best.pt \ sourcetest_images/001.jpg \ conf0.25也可以写 Python 脚本进行批量推理# 文件路径infer_yolo.py from ultralytics import YOLO model YOLO(runs/train/digit_yolov8n/weights/best.pt) results model.predict(test_images/001.jpg, conf0.25, saveTrue) for result in results: boxes result.boxes for box in boxes: cls_id int(box.cls[0]) conf float(box.conf[0]) xyxy box.xyxy[0].tolist() print(f类别: {model.names[cls_id]}, 置信度: {conf:.4f}, 坐标: {xyxy})运行后能直接看到图片中每个数字区域的位置、类别和置信度。这一步就跑通了最基本的数字检测链路。6. 多版本模型深度对比怎么比才不踩坑很多同学喜欢直接搜索“YOLOv8 和 YOLOv11 哪个更强”然后照着别人的结论选型。这是最容易踩坑的地方。目标检测模型的精度和硬件、数据集分布、图像分辨率高度相关别人榜单上的结论不一定适合你的数字识别场景。正确的做法是在自己的数据集上固定训练和推理条件用同一套脚本做对比。6.1 对比维度建议至少对比以下四个维度维度说明对数字识别的影响mAP50IoU 阈值 0.5 时的平均精度衡量框位置和类别是否基本正确mAP50-95多阈值平均精度对框的位置精度更敏感小目标数字差异大推理延迟单张图片从输入到输出的耗时决定能否实时处理模型体积权重文件大小影响部署和边缘设备运行6.2 统一评测脚本可以用下面的脚本对训练好的不同版本模型做统一评测# 文件路径eval_models.py from ultralytics import YOLO import time models { yolov8n: runs/train/digit_yolov8n/weights/best.pt, yolov11n: runs/train/digit_yolov11n/weights/best.pt, yolov12n: runs/train/digit_yolov12n/weights/best.pt, } data_yaml digit_dataset/digit_dataset.yaml for name, weight in models.items(): model YOLO(weight) # 验证集指标 metrics model.val(datadata_yaml, imgsz640, batch16) print(f{name} mAP50: {metrics.box.map50:.4f}) print(f{name} mAP50-95: {metrics.box.map:.4f}) # 推理延迟预热后取均值 import cv2 img cv2.imread(test_images/001.jpg) for _ in range(10): model.predict(img, imgsz640, conf0.25) start time.time() runs 50 for _ in range(runs): model.predict(img, imgsz640, conf0.25) avg_ms (time.time() - start) * 1000 / runs print(f{name} avg infer: {avg_ms:.2f} ms)在实际项目中不建议只跑一次评测就做决定。重复三到五次观察均值与波动再结合部署需求选型。6.3 数字识别场景的选型建议从工程落地角度给出这样的建议算力有限、需要边缘部署优先考虑n或s尺寸模型。YOLOv8n 是稳妥的基线部署资料最丰富。精度优先、服务器算力充足可以直接试用 v12 或较新版本的大尺寸模型但必须先在验证集上确认增量收益。高并发实时服务YOLOv10 的无 NMS 设计有延迟优势但要确认部署链路对 v10 的支持程度。长期维护项目建议选择 Ultralytics 生态内的 v8/v11因为官方升级路径清晰、文档和社区案例多。一个容易被忽略的细节是版本迁移的收益往往在数据增强和训练策略更新而不只是模型结构。新版本自带的训练策略改进有时候比结构的改动更能提升小数据集的表现。7. 集成大语言模型千问与 DeepSeek 的合理位置很多开发者在 CV 项目里接入大语言模型第一反应是“让大模型直接看图识数字”。这个方向不是不行但目前视觉语言模型的成本、延迟和稳定性在工业场景下通常不如专门的检测模型。更合理的架构是用 YOLO 做纯视觉检测用大语言模型做数字检测结果的解析、理解、结构化输出和自然语言交互。7.1 大模型在数字识别系统中的典型作用作用一结果结构化YOLO 输出的是一堆检测框坐标和类别业务系统往往需要的是“表盘读数123.4”“货架号A-07”。大模型可以把多个检测框按空间位置关系组织成结构化 JSON。作用二异常判断与提示当检测到数字区域但置信度低或数字顺序不明确时可以把检测结果和置信度交给大模型让它输出“低置信度提示”或“建议人工复核”。作用三自然语言查询用户不需要了解检测框直接问“上一块表的读数是多少”“今天识别结果和昨天差多少”大模型负责把自然语言转换为结构化查询再和检测结果存储系统交互。作用四自动生成报告把识别结果整理成文本摘要、日报、周报减少人工整理成本。7.2 本地部署千问模型Qwen如果要处理的数据涉及内部系统、隐私或生产环境数据建议优先考虑本地部署。通过 Ollama 部署千问系列小模型如 qwen2.5:7b是入门成本很低的方式# 安装 Ollama 后拉取模型 ollama pull qwen2.5:7b # 运行模型 ollama run qwen2.5:7b本地调用示例# 文件路径llm_local_qwen.py import ollama response ollama.chat( modelqwen2.5:7b, messages[ { role: system, content: 你是一个数字识别结果解析助手把检测结果整理为JSON。, }, { role: user, content: 检测结果数字0置信度0.95 位置[10,20,30,40]数字1置信度0.88 位置[40,20,60,40]。请按从左到右顺序合并为数字串。, }, ], ) print(response[message][content])本地部署的优点是数据不出内网、无按次计费缺点是对显存有要求。7B 量化模型至少需要 6GB 以上显存14B 则建议 12GB 以上。如果使用的是 LM Studio 等工具也可以直接在桌面端完成模型加载和本地 API 服务。7.3 调用 DeepSeek API如果对数据隐私要求不高或者需要更强推理能力可以通过 API 方式集成 DeepSeek# 文件路径llm_api_deepseek.py from openai import OpenAI client OpenAI( api_key你的DeepSeek API Key, base_urlhttps://api.deepseek.com ) resp client.chat.completions.create( modeldeepseek-chat, messages[ { role: system, content: 你是数字识别后的结构化解析助手只输出JSON。, }, { role: user, content: ( 检测框信息\n 1. 类别1置信度0.96x_center0.12\n 2. 类别2置信度0.93x_center0.25\n 3. 类别3置信度0.90x_center0.38\n 请按x_center从左到右输出识别数字串。 ), }, ], temperature0.1, ) print(resp.choices[0].message.content)这里使用了 OpenAI 兼容的接口协议base_url指向 DeepSeek 的 API 地址。实际项目中API Key 务必放在环境变量或密钥管理系统中不要硬编码在代码仓库里。7.4 大模型接入的安全边界在大模型接入这个环节有两个提醒不要把原始生产数据无差别发送给外部 API。如果识别结果涉及客户信息、内部设备编号可以在发送前做脱敏或者直接使用本地部署模型。大模型的输出不一定稳定在生产链路中使用时要加输出校验逻辑。比如要求模型输出 JSON 后用程序解析并校验字段解析失败时走降级逻辑不要让模型的错误输出直接影响业务系统。8. 全栈架构检测、解析、交互的串联实践数字识别检测系统不只是训练一个模型最终要形成一个能用的服务。下面给出一套轻量级全栈方案。8.1 系统架构分层层级职责技术选型采集层接收图片、视频帧摄像头、HTTP 上传、消息队列检测层YOLO 模型推理Ultralytics、ONNX Runtime、TensorRT解析层检测结果排序、数字串拼接、LLM 结构化Python、千问/DeepSeek交互层对外提供 API、前端展示FastAPI、Flask、Vue/React存储层保存识别记录、结果、日志MySQL、SQLite、MinIO8.2 FastAPI 服务示例下面这个示例用一个 FastAPI 接口把图片上传、YOLO 推理和 LLM 结构化拼接起来# 文件路径app.py from fastapi import FastAPI, UploadFile, File from ultralytics import YOLO import ollama import io import cv2 import numpy as np app FastAPI() model YOLO(runs/train/digit_yolov8n/weights/best.pt) def detect_digits(image: np.ndarray): results model.predict(image, conf0.25, imgsz640) detections [] for box in results[0].boxes: cls_id int(box.cls[0]) conf float(box.conf[0]) xyxy box.xyxy[0].tolist() detections.append({class: cls_id, conf: conf, box: xyxy}) return detections def build_digit_string(detections): if not detections: return 未检测到数字 detections.sort(keylambda d: d[box][0]) prompt ( 检测框信息\n \n.join( f类别{d[class]},置信度{d[conf]:.2f},x_center{ (d[box][0]d[box][2])/2:.4f} for d in detections ) \n请按x_center从左到右输出数字串。 ) response ollama.chat( modelqwen2.5:7b, messages[{role: user, content: prompt}], ) return response[message][content] app.post(/recognize) async def recognize(file: UploadFile File(...)): data await file.read() img cv2.imdecode(np.frombuffer(data, np.uint8), cv2.IMREAD_COLOR) detections detect_digits(img) digit_string build_digit_string(detections) return { detections: detections, digit_string: digit_string, }启动服务uvicorn app:app --host 0.0.0.0 --port 8000测试接口curl -X POST -F filetest_images/001.jpg http://127.0.0.1:8000/recognize如果返回结果中包含detections数组和digit_string字段说明全链路已经打通。8.3 前端交互方案如果只是内部演示或工具型应用可以写一个简单的 HTML 页面用input typefile上传图片通过 JavaScript 调用 FastAPI 接口并展示结果。如果要做成正式的 Web 系统前端可以采用 Vue 或 React配合 WebSocket 实现实时识别结果推送。9. 常见问题与排查思路在实际训练和部署中下面这些问题出现频率最高问题现象可能原因排查方式解决方案训练 loss 不下降学习率过高、标注错误查看训练日志中 loss 曲线、抽查标注文件降低学习率、清洗标注数据小目标数字漏检输入分辨率低、数据中目标过小检查验证集预测图、统计目标尺寸分布提高 imgsz、使用 SAHI 等切图策略训练效果好但推理差训练验证和推理链路不一致对比两次预处理逻辑统一图像缩放方式使用相同 imgsz 和增强策略显存不足OOMbatch 太大或输入分辨率太高观察错误日志中的显存占用降低 batch、降低 imgsz、启用 AMP大模型调用超时本地模型加载慢、API 网络波动测试模型加载时间和 API 连通性预热模型实例、设置超时和重试机制本地千问模型推理很慢模型参数量大、未量化、算力不足观察显存占用和 token 生成速度换用量化版模型、降参数量、升级显卡标注文件读取出错类别 id 不连续、文本格式异常用脚本校验标签文件重写标注文件确保 id 从 0 开始连续10. 最佳实践与工程建议基于数字识别检测系统的常见坑点这里给出几条值得长期遵守的工程建议。10.1 把数据版本管理当成代码版本管理数据集每个版本都要有名称、修改时间、变更描述。可以使用 DVC 或 Git LFS 管理数据集和模型权重。记住模型效果如果回退第一件事不是调模型而是确认数据版本是否有变化。10.2 标注质量要抽检标注完成后建议随机抽取 10% 到 20% 的数据人工复核。重点检查检测框是否贴合目标、类别是否标错、模糊样本有没有被误标。一个低质量标注样本对模型的负面影响往往大于十个高质量样本的正面贡献。10.3 固定随机种子训练时固定seed参数yolo detect train ... seed42这样才能保证多次训练结果可复现也是做多版本对比的前提条件。10.4 不要盲目追新版本新版本可以关注但迁移前先在同样数据集上做 A/B 测试。用验证集指标和实际推理性能说话而不是看宣传稿里的指标。记住一个原则模型升级是工程行为不是追星行为。10.5 部署层面对齐推理引擎训练用的是 PyTorch生产部署往往需要导出成 ONNX 或 TensorRT 格式。导出示例yolo export modelruns/train/digit_yolov8n/weights/best.pt formatonnx imgsz640 yolo export modelruns/train/digit_yolov8n/weights/best.pt formatengine imgsz640导出后务必用 ONNX Runtime 或 TensorRT 对同一批图片做推理对比 Python 推理结果确认前后处理逻辑一致。10.6 大模型接入要用降级策略在大语言模型出现超时、输出格式错误、或服务不可用时系统应该能自动降级为纯规则拼接数字串。否则大模型一旦抖动整个识别服务也随之中断这在生产环境不可接受。11. 总结与后续学习方向数字识别检测系统表面上是一个 CV 目标检测任务但真正把它做成可用的全栈系统需要同时掌握 YOLO 系列选型、数据标注规范、训练调参、部署推理、大模型集成和接口设计。本文从 YOLOv8 出发延伸到 v10/v11/v12/v26 的对比方法给出了从数据集组织到 FastAPI 服务的完整实践路径也明确了千问、DeepSeek 在系统中最合理的位置负责检测结果的理解、结构化与自然语言交互而不是替代检测模型。如果你正准备做类似项目建议按这样的顺序推进先用 YOLOv8n 跑通最小数据集建立基线积累一定高质量标注数据后再做多版本对比选定生产模型导成 ONNX 或 TensorRT 部署到目标环境最后接入千问或 DeepSeek完善结果展示和交互能力。下一步可以继续深入的方向包括小目标检测优化、数据自动标注与主动学习、ONNX/TensorRT 部署调优、视觉语言模型与检测模型的融合方案。数字识别只是一个具体载体这套“检测 大模型”的工程方法可以直接复用到车牌识别、工业缺陷检测、票据 OCR 等多种场景中。
返回列表