一个用C/C++实现的大语言模型(LLM)推理引擎,支持多种模型格式,提供CLI、服务器和内置Web UI,可在本地运行LLM和VLM。
- b11232
- 发布于
- 1 天前
- 129,776
- 星标
- 33,062
- 下载
- 同步于
- 1 天前
最新版本
b112322026年9月28日 22:22测试版下载慢?可在上方随时切换镜像源
项目说明
项目概述
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在以最小的设置和最先进的计算性能进行LLM和VLM推理。它支持在本地运行多种LLM模型,并提供CLI、OpenAI兼容服务器和内置Web UI。
主要功能
- 在本地运行LLM和VLM推理
- 支持从Hugging Face直接下载和运行模型
- 提供OpenAI兼容API服务器
- 内置Web UI
- 支持多种硬件后端(CPU、GPU)
适用人群
- 希望在本地运行大语言模型的开发者和研究者
- 需要自托管LLM服务的团队
- 对AI推理性能优化感兴趣的用户
快速上手
- 访问llama.app并按照说明操作
- 或通过Docker运行
- 或从Releases页面下载预编译二进制
- 或从源码构建
- 运行模型:
llama cli -hf ggml-org/Qwen3.5-0.8B-GGUF - 启动API服务器:
llama serve -hf ggml-org/Qwen3.5-0.8B-GGUF
核心优势
- 高性能C/C++实现
- 支持多种模型格式(GGUF等)
- 提供CLI、API服务器和Web UI
- 活跃的社区和持续开发
系统要求
- 操作系统:跨平台(Linux、macOS、Windows)
- 额外依赖:根据部署方式而定(Docker、CMake等)
历史版本
排序