尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AutoGluon 0.6.2 版本发布详解:安全修复与多模态、表格、时序三大模块关键更新

AutoGluon 0.6.2 版本发布详解:安全修复与多模态、表格、时序三大模块关键更新 AutoGluon 0.6.2 版本发布详解安全修复与多模态、表格、时序三大模块关键更新【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluonv0.6.2 是 AutoGluon 在 0.6.x 系列中定位为安全与缺陷修复security and bug fix release的版本在维持 API 稳定性的前提下为多模态multimodal、表格tabular与时序timeseries三大核心模块带来了若干功能性增强与性能优化。本文将基于官方发布说明结合当前仓库源码逐项剖析这些变更的实现细节帮助你在升级后准确理解新能力如 NER 命名实体识别、图像 bytearray 输入、ONNX 导出、时序预测加速的使用前提与底层原理。版本总览与兼容性要点发布性质安全与缺陷修复版本不引入破坏性 API 变更。Python 支持范围0.6.2 支持 Python 3.7 至 3.9且0.6.x 是最后支持 Python 3.7 的发布系列此后版本将要求更高 Python 版本。模型加载兼容性提醒官方强调只应使用与训练时完全相同的 AutoGluon 版本加载模型——跨版本加载训练产物不受支持。这是 AutoGluon 各版本发布说明中的一贯约定升级前请务必保留原训练环境或重新训练。安全修复本版本更新了 PyTorchmultimodal/setup.py 中声明了多模态模块的 torch 依赖用于修复已知安全漏洞。多模态multimodal更新从 NER 到图像输入的四大能力0.6.2 对多模态模块进行了大规模重构与修复涉及 #2554、#2541、#2477 等十余个 PR并新增了多项实用能力。1. 命名实体识别NER支持本版本正式支持命名实体识别任务代码层面由 ner_text.py 中的HFAutoModelForNER类实现该类继承自文本预测基类HFAutoModelForTextPrediction默认使用microsoft/deberta-v3-base作为骨干模型同时支持 BERT、RoBERTa、GPT-2 等主流 Hugging Face 文本骨干针对 gpt2/roberta 这类子词分词器会自动设置add_prefix_spaceTrue以保证 token 与原始单词的偏移对齐模型前向输入包含token_word_mappingtoken→word 映射与word_offsets词在原文中的字符偏移用于将 token 级预测还原到 word 级实体标注。数据侧在 data 目录中实现了NerProcessor与列类型推断逻辑infer_ner_column_type。标注格式使用标准 BIO 体系如B-ORG、I-PER测试用例 test_ner.py 展示了训练数据的组织方式一个文本片段列text_snippet加一个 JSON 字符串实体标注列entity_annotations内含entity_group、start、end字段并提供了merge_bio_format、visualize_ner等工具函数。完整的实战入口可参考 ner.ipynb 与中文场景的 chinese_ner.ipynb。2. 图像模态支持 bytearray 输入此前图像列仅支持文件路径字符串本版本新增了对bytearray二进制字节流的输入支持PR #2549 中定义了两种新列类型IMAGE_BYTEARRAY image_bytearray IMAGE_BASE64_STR image_base64_str处理逻辑位于 process_image.py 的process_one_sample当列的子类型为IMAGE_BYTEARRAY或IMAGE_BASE64_STR时会先将原始字节包装为BytesIO再交给PIL.Image.open解码并统一转换到目标色彩模式如 RGB解码失败时可回退到missing_value_strategy如填充零图像。这意味着你可以直接把从数据库、对象存储或网络请求中获取的图像字节喂给MultiModalPredictor省去落盘环节。对应测试 test_image_formats.py 验证了 bytearray 与 base64 字符串两种格式训练出的模型与基于文件路径训练的模型在evaluate、predict、predict_proba上结果完全一致也支持训练用路径、预测用字节的混合场景。3. Matcher匹配器支持超参搜索HPO多模态语义匹配模型用于文本-图像、图像-图像、文本-文本匹配在本版本开始支持超参数优化。相关能力可结合 semantic_matching 教程目录下的多个 notebook如image2image_matching.ipynb、image_text_matching.ipynb、text2text_matching.ipynb理解其使用方式HPO 部分则由 core 模块的 Ray Tune 调度器见 core/src/autogluon/core/ray 与 searcher统一驱动。4. timm 图像模型支持 ONNX 导出本版本为基于 timm 的图像分类模型增加了 ONNX 导出支持PR #2564 可以看出完整的推理加速链路OnnxModule作为torch.nn.Module的替代品将 ONNX 模型交由 onnxruntime 执行默认优先配置TensorrtExecutionProvider自动启用 FP16 与 2GB workspace实现 TensorRT 加速推理onnx_get_dynamic_axes为文本 token/segment 输入声明batch_size与seq_length动态轴为图像、数值特征声明batch_size动态轴。部署测试见 test_deployment_onnx.py端到端教程见 tensorrt.ipynb。表格tabular更新集成稳定性与 ONNX 路径完善表格预测模块在本版本同样经历了一轮重构与修复涉及 #2387、#2595、#2642 等 PR值得关注的变更包括修复集成折叠ensemble folding#2582 与 core/tests/unittests/models/test_bagged_ensemble_model.py。表格 NN 的 ColumnTransformer 由 sklearn 转 ONNX#2503将表格神经网络中的特征预处理ColumnTransformer转换为 ONNX 算子使整条表格 NN 推理链路可以端到端导出到 ONNX/ONNX Runtime避免依赖 sklearn 原始对象。标签列含非有限值时抛出明确错误PR #2509训练时若标签列出现 NaN、Inf 等非有限数值不再静默处理而是直接报错帮助用户尽早定位数据质量问题。表格预测的常规使用方式仍以 tabular-quick-start.ipynb 与 tabular-essentials.ipynb 为准。时序timeseries更新四处性能加速时序预测模块的变更集中于性能优化全部由同一位维护者shchur完成本地模型数据准备加速#2587训练前的数据整理。GluonTS 模型预测加速#2593针对基于 GluonTS 的深度学习时序模型优化预测阶段。训练/验证集切分器加速#2586。TimeSeriesEnsembleSelection.fit加速#2602 目录。这些加速对大规模时序数据的迭代实验收益明显。入门使用见 forecasting-quick-start.ipynb。文档与教程改进0.6.2 还包含一批文档更新改善了新老用户的上手体验新增 Ray 使用 FAQ用于分布式训练与超参搜索排障修复缺失的 Predictor API 文档MultiModalPredictor/TabularPredictor等核心类的 API 文档更新 2023 年路线图更新图像分类教程以覆盖 bytearray 输入见 beginner_image_cls.ipynb修复教程目录的失效索引链接改进时序快速入门教程见 forecasting-quick-start.ipynb。升级建议与总结升级到 0.6.2 时请注意安全性优先0.6.2 升级了 PyTorch 依赖以修复安全漏洞建议尽快升级若在 GPU 环境使用请同步检查 CUDA 版本与 torch 的匹配关系。Python 版本规划如果仍停留在 Python 3.7应规划向 Python 3.8/3.9 迁移因为 0.6.x 之后将不再支持 3.7。模型兼容性严格遵守同版本训练、同版本加载原则跨版本加载训练产物不受支持升级后如需保留旧模型请先在同一版本环境中重新导出。新能力试用多模态用户可重点体验 NER、图像 bytearray 输入、matcher HPO 与 ONNX/TensorRT 加速时序用户可直接受益于数据准备、预测、切分与集成选择的性能提升无需修改现有代码。总体而言v0.6.2 是一个典型的稳中有进版本以安全修复为底线为多模态补齐了 NER、字节图像输入与部署导出能力并为时序模块带来系统性加速适合在验证兼容性后平稳升级。【免费下载链接】autogluonFast and Accurate ML in 3 Lines of Code项目地址: https://gitcode.com/GitHub_Trending/au/autogluon创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表