尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

mcp-mlx-launcher MCP 服务说明文档

mcp-mlx-launcher MCP 服务说明文档 1. 服务概述一句话简介允许搜索Hugging Face上可用的MLX模型并在启动前将其下载到本地缓存服务名称mcp-mlx-launcher版本号最新版本开发者/提供方globalpocket协议类型MCP (Model Context Protocol)2. 核心功能列出该MCP服务提供的主要功能点系统环境检查验证系统内存和架构Apple Silicon以确保就绪状态模型搜索与下载搜索Hugging Face上可用的MLX模型并在启动前将其下载到本地缓存启动和管理本地LLM在后台启动、停止和重启mlx-lm服务器支持任何支持的模型状态检查验证特定端口是否当前处于活动状态并正在监听Apple Silicon优化专为管理基于MLX的本地模型而构建充分利用Apple Silicon的性能优势自动清理当MCP服务器断开连接或关闭时自动清理并关闭所有管理的LLM进程防止资源泄漏3. 使用场景描述该服务适合在什么情况下使用本地LLM服务器管理为AI代理如Cline、Claude Desktop等提供按需启动本地LLM服务器的能力模型搜索和下载在Hugging Face上搜索MLX格式的模型并预先下载到本地缓存资源管理和优化在不需要时优雅地关闭LLM服务器节省系统资源开发和测试环境为开发人员提供便捷的本地LLM环境管理工具Apple Silicon环境优化充分利用Apple Silicon的统一内存架构高效运行本地模型自动化工作流集成到AI代理工作流中实现自动化的模型管理和部署4. 接入方式4.1 服务端点mcp-mlx-launcher作为MCP服务器运行通过stdio传输与MCP客户端通信传输协议stdio标准输入/输出运行环境本地Python环境目标平台macOSApple Silicon M1/M2/M3/M44.2 认证与权限该服务不需要特殊的认证机制本地运行在本地环境中运行无需API密钥或认证Hugging Face访问通过公开API访问Hugging Face模型库系统权限需要访问本地文件系统和网络用于下载模型4.3 数据格式服务支持以下数据格式模型格式MLX格式的模型专为Apple Silicon优化模型来源Hugging Face模型库响应格式结构化的JSON数据包含模型信息、服务器状态等4.4 服务器配置在MCP客户端配置中添加服务{ mcpServers: { mcp-mlx-launcher: { command: python, args: [ -m, mcp_mlx_launcher.server ] } } }5. 接口定义mcp-mlx-launcher提供以下工具接口工具名称功能描述主要参数check_system_environment诊断当前系统环境返回可用统一内存GB和架构详情无参数check_llm_status检查指定端口上是否有服务器正在运行port: 端口号list_running_servers检索当前在后台运行的所有本地LLM服务器列表端口和模型无参数search_mlx_models在Hugging Face上搜索可用的MLX格式模型列出详细信息如下载次数和模型IDsearch_query: 搜索关键词, limit: 返回数量限制download_model预先下载指定的MLX模型从Hugging Face并缓存到本地适合在启动前准备大型模型model_name: 模型名称launch_llm_server在后台启动mlx_lm.server实例包含可选的内存需求检查以防止内存不足错误model_name: 模型名称, port: 端口号, memory_requirement_gb: 内存需求GBrestart_llm_server优雅地停止给定端口上运行的服务器并重新启动如果省略model_name则使用当前加载的模型port: 端口号, model_name: 模型名称可选, memory_requirement_gb: 内存需求GBshutdown_llm_server优雅地终止给定端口上运行的LLM服务器port: 端口号6. 快速开始6.1 环境要求操作系统macOSApple Silicon M1/M2/M3/M4Python版本 3.10 或更高mlx-lm已安装在您的环境中pip install mlx-lm6.2 示例代码安装步骤# 克隆仓库 git clone https://github.com/YOUR_USERNAME/mcp-mlx-launcher.git cd mcp-mlx-launcher # 安装依赖 pip install -e .使用示例# 1. 检查系统环境 result check_system_environment() # 返回可用内存GB和架构信息 # 2. 搜索MLX模型 models search_mlx_models(search_queryllama, limit10) # 返回模型列表包含下载次数和模型ID # 3. 下载模型可选提前准备 download_model(mlx-community/Llama-2-7b-chat-mlx) # 将模型下载到本地缓存 # 4. 启动LLM服务器 launch_llm_server( model_namemlx-community/Llama-2-7b-chat-mlx, port8080, memory_requirement_gb8.0 ) # 在端口8080上启动服务器 # 5. 检查服务器状态 is_running check_llm_status(port8080) # 返回True/False # 6. 列出所有运行的服务器 servers list_running_servers() # 返回所有运行中的服务器列表 # 7. 重启服务器 restart_llm_server(port8080) # 重启指定端口的服务器 # 8. 关闭服务器 shutdown_llm_server(port8080) # 优雅地关闭服务器与Claude Desktop集成{ mcpServers: { mcp-mlx-launcher: { command: python, args: [-m, mcp_mlx_launcher.server] } } }7. 注意事项重要提示平台限制仅支持macOSApple Silicon M1/M2/M3/M4不支持Intel Mac或其他操作系统内存管理启动大型模型前建议检查系统可用内存避免内存不足错误端口冲突确保指定的端口未被其他服务占用模型缓存下载的模型会缓存在本地首次下载可能需要较长时间自动清理MCP服务器断开时会自动关闭所有管理的LLM进程无需手动清理网络连接搜索和下载模型需要网络连接到Hugging FacePython版本确保使用Python 3.10或更高版本mlx-lm依赖必须先安装mlx-lm包才能使用此服务性能优化建议为获得最佳性能建议使用具有足够统一内存的Mac设备建议16GB或更多在启动大型模型前使用download_model预先下载定期检查系统内存使用情况在不使用时及时关闭LLM服务器以释放资源
返回列表