尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GenieX CLI 本地推理实战手册:从安装到模型服务化

GenieX CLI 本地推理实战手册:从安装到模型服务化 GenieX CLI 本地推理实战手册从安装到模型服务化【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieXGenieX 解决的是一个问题在 Qualcomm 芯片的设备上本地运行前沿 LLM 和 VLMNPU、GPU、CPU 三条推理路径都支持。对命令行用户来说它把下载模型、跑推理、对外提供 API压缩成了几条短命令下面按装好、跑通、管好三步过一遍。第一幕GenieX CLI 5 分钟跑起来 安装对应平台的 CLIWindows ARM64Snapdragon X 系列用官方安装包直接装Linux ARM64 用安装脚本也可放进 Docker 跑# Linux ARM64 curl -fsSL https://qaihub-public-assets.s3.us-west-2.amazonaws.com/qai-hub-geniex/install.sh | sh装完如果提示PATH问题按脚本末尾打印的export行追加到~/.bashrc即可。验证安装生效先确认命令能跑起来再看三个版本号CLI、QAIRT 运行时、llama.cpp 运行时geniex --help geniex version第一次成功输出geniex infer会自动拉取没缓存的模型选完精度GGUF 选Q4_0对 Hexagon NPU 最友好后直接进入交互会话geniex infer unsloth/Qwen3.5-0.8B-GGUF不想进交互模式带-p传提示词就能拿到一次性输出-i则从文件读提示词geniex infer unsloth/Qwen3.5-0.8B-GGUF -p 用一句话介绍 GenieX。第二幕覆盖文本生成、图像理解与 API 服务 用一条命令跑 LLM 文本生成infer支持两种 runtimeQualcomm AI Hub 模型走qairt固定跑在 NPU任意 GGUF 走llama_cpp可用--compute指定 npu / gpu / cpugeniex infer ai-hub-models/Qwen3-4B让 VLM 看图说话拉一个视觉语言模型交互会话里直接把图片拖进终端或带-p把图片绝对路径写进提示词一次性跑详见 docs/en/run/cli/reference.mdxgeniex pull Qwen/Qwen3-VL-2B-Instruct-GGUF geniex infer Qwen/Qwen3-VL-2B-Instruct-GGUF -p 描述这张图: /full/path/to/cat.jpgGenieX 的多硬件推理路径音频转写与多模态音频输入只有带 conformer 编码器的模型支持且仅限llama_cppruntimeQAIRT 模型喂音频会直接报错geniex pull google/gemma-4-E2B-it-qat-q4_0-gguf geniex infer google/gemma-4-E2B-it-qat-q4_0-gguf -p 描述图片并转写音频。Image: /path/landmark.jpg Audio: /path/jfk.wav起一个 OpenAI 兼容的 API 服务geniex serve默认把推理服务挂在127.0.0.1:18181自带 Swagger UI打开http://127.0.0.1:18181就能在线试任何讲 OpenAI 协议的客户端——包括官方openaiPython SDK——把base_url指过来即可。留一个终端跑服务另开一个终端发非流式聊天请求geniex pull ai-hub-models/Qwen3-4B-Instruct-2507 geniex servecurl http://127.0.0.1:18181/v1/chat/completions \ -H Content-Type: application/json \ -d {model:ai-hub-models/Qwen3-4B-Instruct-2507,messages:[{role:user,content:Hello! Briefly introduce yourself.}],max_tokens:256}Swagger UI 调试界面第三幕版本、模型与排障速查 查版本与更新 CLIgeniex version geniex updateversion同时打印 QAIRT 与 llama.cpp 两个运行时的版本update在有新版时给出升级入口Linux 下会提示重跑安装脚本管理本地模型缓存里有什么、占多少空间一条list看清不想要了remove单个、clean全清geniex listgeniex pull model未缓存的模型在infer时也会自动拉取geniex model list --all列出 AI Hub 上当前设备可跑的全部模型用 REPL 交互式开发infer不带-p时就是 REPL直接输入即聊/reset清空上下文重开会话音频模型里还可以用/mic录音、Ctrl-C停录并转写录音依赖 SoX缺它会提前警告。日志与排障日志级别由全局--log或GENIEX_LOG环境变量控制取值none到trace默认none详见 docs/README 之外的 cli/README.mdgeniex --log debug infer unsloth/Qwen3.5-0.8B-GGUF上下文超限llama_cpp 用--nctx 8192扩窗qairt 用--sliding-window滚动淘汰旧上下文模型缓存在数据目录models/子目录下临时录音写在系统 temp 目录出问题时先翻这两处到这儿安装、多模态推理、服务化、日常运维这条主线就完整了剩下的采样参数和高级开关都可以用geniex infer -h现查。仓库入口git clone https://gitcode.com/GitHub_Trending/ne/nexa-sdk【免费下载链接】GenieXRun frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code项目地址: https://gitcode.com/GitHub_Trending/ne/GenieX创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表