ggml-org

llama.cpp

一个用C/C++实现的大语言模型(LLM)推理引擎,支持多种模型格式,提供CLI、服务器和内置Web UI,可在本地运行LLM和VLM。

b11232
发布于
1 天前
129,776
星标
33,062
下载
同步于
1 天前

最新版本

b112322026年9月28日 22:22测试版
下载慢?可在上方随时切换镜像源

项目说明

项目概述

llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在以最小的设置和最先进的计算性能进行LLM和VLM推理。它支持在本地运行多种LLM模型,并提供CLI、OpenAI兼容服务器和内置Web UI。

主要功能

  • 在本地运行LLM和VLM推理
  • 支持从Hugging Face直接下载和运行模型
  • 提供OpenAI兼容API服务器
  • 内置Web UI
  • 支持多种硬件后端(CPU、GPU)

适用人群

  • 希望在本地运行大语言模型的开发者和研究者
  • 需要自托管LLM服务的团队
  • 对AI推理性能优化感兴趣的用户

快速上手

  1. 访问llama.app并按照说明操作
  2. 或通过Docker运行
  3. 或从Releases页面下载预编译二进制
  4. 或从源码构建
  5. 运行模型:llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF
  6. 启动API服务器:llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF

核心优势

  • 高性能C/C++实现
  • 支持多种模型格式(GGUF等)
  • 提供CLI、API服务器和Web UI
  • 活跃的社区和持续开发

系统要求

  • 操作系统:跨平台(Linux、macOS、Windows)
  • 额外依赖:根据部署方式而定(Docker、CMake等)

历史版本

排序