尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

MLX Examples 上手指南:在 Mac 上如何快速跑起文生图、大模型对话与语音转写

MLX Examples 上手指南:在 Mac 上如何快速跑起文生图、大模型对话与语音转写 MLX Examples 上手指南在 Mac 上如何快速跑起文生图、大模型对话与语音转写【免费下载链接】mlx-examplesExamples in the MLX framework项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-examples想在 MacBook 上跑模型到底需要什么没有 NVIDIA 显卡、不用折腾 CUDA、甚至不用买云 GPU——只要一台 Apple Silicon 芯片的 Mac再配合pip install mlx就够了。mlx-examples 是 MLX 框架官方的示例仓库把图像生成、大模型推理、语音转写、多模态理解这些热门任务都做成了独立目录每个目录装好各自的依赖就能直接运行是最适合动手上手的 MLX 示例集合。环境准备克隆仓库和安装 MLX 框架整个仓库按一个任务一个目录组织目录之间互不依赖。你不需要一次性安装所有东西跑到哪、装到哪即可。克隆仓库并安装依赖把仓库克隆到本地装上 MLX 本体git clone https://gitcode.com/GitHub_Trending/ml/mlx-examples pip install mlx每个示例目录比如 mnist/、clip/里都有一份requirements.txt进入对应目录执行pip install -r requirements.txt再运行主脚本就行。官方在总 README 里建议的新手起点是 MNIST它代码量最小能把加载数据、定义模型、训练、验证的完整流程一遍看完。选示例前先看硬件多数示例默认跑在 GPU即 Apple 芯片的统一内存上个别支持--cpu开关如 mnist/main.py。但涉及 7B 以上大模型、14B 视频模型时建议至少 16GB 内存起步1.3B 级别的视频模型实测在 M 系列芯片上单步约 90 秒14B 模型需要 36GB 以上内存跑之前心里先有个数。跑通文生图的最快方式Stable Diffusion 与 FLUX这是仓库里演示效果最直接的场景输入一句英文描述输出几张图。运行 Stable Diffusion 文生图模型权重由脚本直接从 Hugging Face Hub 下载不用你手动管理文件。进入stable_diffusion目录装完依赖后python txt2image.py A big red sign saying MLX --n_images 2入口脚本是 stable_diffusion/txt2image.py--model sd可切换 SD 1.x/2.x 架构--seed固定随机种子复现结果。仓库里放了一张用它生成的样例想从一张已有图片出发做风格化改写可以运行 stable_diffusion/image2image.py效果类似下面这张静物重绘换成 FLUX 模型flux目录是另一套更新的生成模型实现flux/txt2image.py 用法相近flux/dreambooth.py 则演示了用少量图片微调模型记住特定主体的做法适合想让模型认识我家狗这类需求。再进一步Wan2.1 文生视频video/wan2.1目录把同样的思路推到了视频python txt2video.py A cat playing piano --output out.mp41.3B 模型约 10GB 内存即可跑动保存视频需要系统里装有 ffmpeg。下面这只打拳的猫就是 video/wan2.1/txt2video.py 的默认输出让大语言模型在本地对话大模型部分集中在llms目录覆盖 Llama、Mistral、Mixtral 等多个系列还有 llms/speculative_decoding/ 这种用小模型打草稿、大模型校对来提速推理的实验。Mistral转换权重加一次生成这类脚本普遍是两步走先用 llms/mistral/convert.py 把 PyTorch 权重转成 MLX 格式加-q可输出 4-bit 量化版显著省内存再用 llms/mistral/mistral.py 生成文本python convert.py --torch-path ./mistral-7B-v0.1 python mistral.py --prompt It is a truth universally acknowledged--help能看到温度、采样 token 数等全部参数。Llama 与其他模型llms/llama/llama.py 对应 Llama 系列原版 Llama 权重需要先向 Meta 申请权限嫌麻烦的话可以直接用许可宽松的 TinyLlama1.1B或社区已转换好的检查点。llms/mixtral/mixtral.py 演示了混合专家MoE结构的推理平时只激活部分参数速度比同尺寸密集模型快。把录音转成文字mlx-whisper 转写路径仓库自带的 Whisper 实现封装成了一个独立的mlx-whisper包支持 OpenAI 全系列语音识别模型39M 到 1.5B 参数中英文都能识别输出可选纯文本、SRT 字幕等格式。一条命令出转录结果装好 ffmpeg 和包之后命令行用法就一行pip install mlx-whisper mlx_whisper audio.mp3运行完会在同目录生成audio.txt。加-f srt可以输出带时间轴的字幕文件想换大模型就加--model large。在自己的代码里调用写进自己的程序时直接导入即可核心逻辑在 whisper/mlx_whisper/transcribe.pyimport mlx_whisper text mlx_whisper.transcribe(audio.mp3)[text]仓库里还附了 whisper/benchmark.py可以在不同模型规模之间对比转写速度和内存占用帮你选一个又快又准的档位。让 AI 看懂照片CLIP 匹配与 LLaVA 问答多模态场景在仓库里分三块CLIP 负责图文对得上LLaVA 负责对着图说话SAM 负责把物体框出来。用 CLIP 判断图文相关性先运行 clip/clip.py 同目录的 convert.py 下载并转换 CLIP 权重之后图片与文字会被编码到同一个向量空间——算个相似度就能回答这张图里是什么、哪个标题配这张图这类问题。仓库自带的两张测试图就是典型用例clip/linear_probe.py 还演示了在冻结的 CLIP 特征上只训练一个线性分类层几行数据就能把识别精度提上来是低成本复用的标准做法。用 LLaVA 直接问图里的问题想要自然语言回答而不是相似度分数就用 LLaVA。装完依赖后一条命令完成看图 提问python generate.py --model llava-hf/llava-1.5-7b-hf \ --image ./some_photo.jpg --prompt What is in this image?入口是 llava/generate.py。如果需求是把图中某个物体精确抠出来可以看 segment_anything/main.py点一个点或画个框模型就能返回对应区域的分割掩码segment_anything/notebooks/ 里还有交互式演示的 notebook。用自己的数据训练一个小模型前面几章都在推理这一章演示训练长什么样。十分钟读完的训练循环mnist/main.py 一共百来行流程是教科书式的定义一个两层 MLP、写交叉熵损失、用nn.value_and_grad拿到梯度、optim.SGD更新参数再用mx.compile把训练步缓存成编译好的函数。跑起来python main.py # 默认 CPU python main.py --gpu # 切到芯片加速器想要训练完还能采样出新图的体验可以看 cvae/main.py卷积变分自编码器下面是它训练后的采样结果可以看到网络确实学到了手写数字的分布换到 CIFAR-10 和 ResNet图片稍微复杂一点cifar/main.py 用 ResNet 在 CIFAR-10 上训练顺带演示了官方 mlx-data 库加载数据集的方式python main.py --cpu可切换设备。如果你的目标不是从头训而是拿着现成大模型、用少量标注数据让它学新任务直接跳到 lora/lora.pyLoRA/QLoRA 只训练低秩旁路矩阵数据就放在 lora/data/train.jsonl训完还能用 lora/fuse.py 把增量合并回原模型省得推理时多跑一层。把整个仓库当成MLX 速查手册来用是最高效的姿势想确认某个模型在 Mac 上怎么加载先翻对应目录的 README想改参数看主脚本顶部的 argparse 定义想写自己的代码就照着最接近的那个示例抄结构。每个目录都独立可跑跑通一个再进下一个比读长篇文档快得多。【免费下载链接】mlx-examplesExamples in the MLX framework项目地址: https://gitcode.com/GitHub_Trending/ml/mlx-examples创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表