专为Apple Silicon优化的原生LLM推理服务器,支持OpenAI和Anthropic兼容API,无需Python,支持MLX和GGUF模型,附带macOS菜单栏应用。
- v26.9.6
- 发布于
- 3 天前
- 1,644
- 星标
- 20,548
- 下载
- 同步于
- 1 天前
最新版本
v26.9.62026年9月26日 13:24下载慢?可在上方随时切换镜像源
项目说明
项目概述
mlx-serve 是一个为Apple Silicon优化的原生LLM推理服务器,支持OpenAI和Anthropic兼容API。它运行任何MLX格式模型和HuggingFace上的GGUF模型(Qwen、Llama、Mistral、Gemma、DeepSeek等),支持图像、视频、音乐、语音(含语音克隆)和3D模型生成。
主要功能
- OpenAI和Anthropic兼容HTTP API
- 支持MLX和GGUF模型
- 支持图像、视频、音乐、语音(含语音克隆)和3D模型生成
- MLX Core macOS菜单栏应用:聊天、代理模式、MCP工具调用、模型管理
- Ollama API兼容(
/api/chat、/api/generate等)
适用人群
- Apple Silicon Mac用户
- 需要本地LLM推理的开发者
- 希望替代LM Studio的用户
快速上手
- 推荐:下载MLX Core.app(签名公证的macOS菜单栏应用)
- Homebrew安装:
brew tap ddalcu/mlx-serve https://github.com/ddalcu/mlx-serve && brew install --cask mlx-core - CLI使用:
mlx-serve run gemma4 - 服务器地址:
http://localhost:11234
核心优势
- 专为Apple Silicon优化,比LM Studio更快
- 无需Python,无需云端,无Electron
- 支持OpenAI、Anthropic和Ollama三种API兼容
- 开源免费
历史版本
排序