jundot

omlx

jundot

一个专为Apple Silicon优化的LLM推理服务器,支持连续批处理和SSD缓存,通过菜单栏进行管理。

v0.7.0rc1
发布于
4 天前
22,330
星标
121,454
下载
同步于
1 天前

最新版本

v0.7.0rc12026年9月25日 04:17
下载慢?可在上方随时切换镜像源

项目说明

项目概述

oMLX 是一个专为 Mac 优化的 LLM 推理服务器,支持连续批处理和分层 KV 缓存,可直接从菜单栏进行管理。它将 KV 缓存在热内存层和冷 SSD 层之间持久化,即使对话中途上下文发生变化,所有过去的上下文仍保持缓存,可在请求间复用。

主要功能

  • 连续批处理:提高推理吞吐量
  • 分层 KV 缓存:热内存层 + 冷 SSD 层,跨请求复用
  • 菜单栏管理:可直接从 macOS 菜单栏控制
  • MCP 支持:支持 Model Context Protocol
  • 原生自定义内核:为 GLM-5.2 / MiniMax M3 / Qwen3.5 提供加速,性能提升显著

适用人群

  • Apple Silicon Mac 用户
  • 需要在本地高效运行 LLM 的开发者
  • 使用 Claude Code 等工具进行 AI 编码的开发者

快速上手

  1. macOS App:从 Releases 下载 .dmg,拖入 Applications 即可
  2. Homebrew:brew tap jundot/omlx https://github.com/jundot/omlx && brew install jundot/omlx/omlx
  3. 后台运行:omlx start
  4. 需要 macOS 15.0+ (Sequoia)、Python 3.11–3.13 和 Apple Silicon (M1/M2/M3/M4/M5)

核心优势

  • 专为 Apple Silicon 优化
  • 持久化 KV 缓存,跨请求复用
  • 菜单栏管理,方便易用
  • 支持 MCP 协议

系统要求

  • 操作系统:macOS 15.0+ (Sequoia)
  • 硬件:Apple Silicon (M1/M2/M3/M4/M5)
  • 额外依赖:Python 3.11–3.13

历史版本

排序