一个专为Apple Silicon优化的LLM推理服务器,支持连续批处理和SSD缓存,通过菜单栏进行管理。
- v0.7.0rc1
- 发布于
- 4 天前
- 22,330
- 星标
- 121,454
- 下载
- 同步于
- 1 天前
最新版本
v0.7.0rc12026年9月25日 04:17下载慢?可在上方随时切换镜像源
项目说明
项目概述
oMLX 是一个专为 Mac 优化的 LLM 推理服务器,支持连续批处理和分层 KV 缓存,可直接从菜单栏进行管理。它将 KV 缓存在热内存层和冷 SSD 层之间持久化,即使对话中途上下文发生变化,所有过去的上下文仍保持缓存,可在请求间复用。
主要功能
- 连续批处理:提高推理吞吐量
- 分层 KV 缓存:热内存层 + 冷 SSD 层,跨请求复用
- 菜单栏管理:可直接从 macOS 菜单栏控制
- MCP 支持:支持 Model Context Protocol
- 原生自定义内核:为 GLM-5.2 / MiniMax M3 / Qwen3.5 提供加速,性能提升显著
适用人群
- Apple Silicon Mac 用户
- 需要在本地高效运行 LLM 的开发者
- 使用 Claude Code 等工具进行 AI 编码的开发者
快速上手
- macOS App:从 Releases 下载
.dmg,拖入 Applications 即可 - Homebrew:
brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx - 后台运行:
omlx start - 需要 macOS 15.0+ (Sequoia)、Python 3.11–3.13 和 Apple Silicon (M1/M2/M3/M4/M5)
核心优势
- 专为 Apple Silicon 优化
- 持久化 KV 缓存,跨请求复用
- 菜单栏管理,方便易用
- 支持 MCP 协议
系统要求
- 操作系统:macOS 15.0+ (Sequoia)
- 硬件:Apple Silicon (M1/M2/M3/M4/M5)
- 额外依赖:Python 3.11–3.13
历史版本
排序