尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Jev-Omni API完整参考:predict接口参数、返回值与4种模态详解

Jev-Omni API完整参考:predict接口参数、返回值与4种模态详解 Jev-Omni API完整参考predict接口参数、返回值与4种模态详解【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-OmniJev-Omni 是一个面向文本、图像、音频、视频四种模态的开源决策分类器给它一个上下文、一个问题和一组选项它会直接返回每个选项的概率而不是生成一段解释性回答。本文完整解析其唯一的公开 API——predict接口的全部参数、返回值结构与 4 种模态的传参方式帮你快速接入这个 12B 多模态分类器。1 分钟了解 Jev-Omni 特性说明底座模型Gemma 4 12B IT经 3 万道决策题微调输出形式每个选项一个概率2–256 个选项支持模态text / image / audio / video代表成绩DecisionBench Medium87.57%JevBench86.15%运行要求CUDA GPUFP32 权重约 50 GB推理使用 BF16与传统对话模型不同Jev-Omni 不产生输出 token只输出校准过的概率——这正是它速度快的关键原因。核心实现见 jev_omni.py。predict 接口参数全解6 个参数逐个说明predict定义于 jev_omni.py所有参数均为关键字参数一个都不能靠位置传入classifier.predict( *, state, question, options, mediaNone, modalitytext, video_frames16 )参数必填类型默认值说明state✅str—背景上下文如会议 10 点开始现在 9 点question✅str—要回答的问题options✅list[str]—选项列表长度必须在 2–256 之间media视模态而定strNone本地图片/音频/视频文件路径纯文本时省略modality❌strtext只能取text、image、audio、video之一video_frames❌int16视频抽帧数量仅modalityvideo时生效⚠️三类常见报错源码见 jev_omni.pyoptions少于 2 项或多于 256 项 →ValueErrormodality不在四种取值内 →ValueError模态非text却没传media→ValueError例如只写modalityimage而忘了文件路径predict 返回值结构4 个字段一次看懂调用后返回一个普通字典源码 jev_omni.py以二选一问题为例{ prediction: No, # 概率最高的选项字符串 prediction_index: 1, # 该选项在 options 中的下标从 0 起 confidence: 0.93, # 最高选项的概率0~1 probabilities: { # 每个选项的完整概率分布 Yes: 0.07, No: 0.93 } } 四个字段各有所用prediction直接拿答案prediction_index适合对接表格/数据库confidence可做低置信度转人工阈值probabilities支持你自定义排序或计算多类得分。4 种模态详解text、image、audio、video 怎么传① 文本text最省事的入口statequestionoptions三件套即可不需要media也无需写modality默认就是text。完整示例见 example.pyresult classifier.predict( stateThe meeting starts at 10 AM. It is now 9 AM., questionHas the meeting started?, options[Yes, No], )② 图像image传本地路径只需追加media与modalityimage。模型内部用 PIL 打开图片并转成 RGBjev_omni.py所以任意常见图片格式都可以。result classifier.predict( state, question图中交通灯是什么颜色, options[红, 黄, 绿], media/path/to/light.jpg, modalityimage, )③ 音频audio自动转 WAV最长 30 秒音频路径会被ffmpeg转成 16 kHz 单声道 WAV只取前 30 秒jev_omni.py因此环境必须安装ffmpeg更长的录音请自行截取接口不会报错但只会用到前 30 秒。result classifier.predict( state, question这段话的情绪是, options[积极, 中性, 消极], media/path/to/clip.mp3, modalityaudio, )④ 视频video抽 16 帧处理视频按均匀分布抽video_frames帧默认 16 帧可用 OpenCV 读取jev_omni.py每帧按图像送入模型。视频较长时可调大帧数但耗时也随帧数线性上升。result classifier.predict( state, question视频里发生了什么, options[做饭, 开车, 运动, 办公], media/path/to/clip.mp4, modalityvideo, video_frames16, )四模态参数速查模态media预处理行为H200 参考耗时text省略无约 83 ms~2k tokenimage本地图片路径转 RGB约 26 msaudio本地音频路径ffmpeg 转 WAV截前 30 s约 31 msvideo本地视频路径均匀抽 16 帧约 504 ms快速上手三步跑通1️⃣ 安装依赖依赖清单 requirements.txt音频推理另需系统安装ffmpegpip install -r requirements.txt2️⃣ 加载模型一次性下载约 24 GB 合并权重含决策头无需合并底座源码 jev_jev_omni 加载逻辑from jev_omni import load_jev_omni classifier load_jev_omni() # 仅支持 CUDA 设备3️⃣ 调用predict参考 example.py 或上文任意模态示例。使用限制与最佳实践 ✅选项数量接口上限 256 个但官方明确最佳支持 ≤20 个选项超过 20 个的质量未经验证详见 README.md 的 Limits 一节。设备参考加载器要求 CUDA GPU纯 CPU 会直接抛错jev_omni.py。决策头结构模型把最后隐藏状态3840 维见 decision_config.json归一化后映射到 256 个选项槽位多余槽位用 -1e30 屏蔽jev_omni.py。温度输出是分类概率而非采样文本generation_config.json中的采样参数对它无意义。关键文件导航 文件作用jev_omni.pypredict接口、模态预处理与加载器全部源码example.py最小可运行示例config.json多模态模型结构文本 3840 维、音频、视觉配置decision_config.json决策头配置与训练配方requirements.txtPython 依赖清单README.md基准成绩、速度数据与完整文档掌握predict的 6 个参数和 4 个返回字段加上非 text 模态必传media这一条规则你就可以把 Jev-Omni 接入自己的多模态决策场景了。【免费下载链接】Jev-Omni项目地址: https://ai.gitcode.com/hf_mirrors/akhilaaa3/Jev-Omni创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表