一个用于异构LLM推理的可编程混合模型(MoM)路由器,通过评估请求信号、用户偏好和应用策略,为每个请求选择或组合最优的模型路径,以提升质量、降低成本、延迟和增强隐私与安全。
- v0.4.0
- 发布于
- 2 天前
- 5,959
- 星标
- 107
- 下载
- 同步于
- 1 天前
最新版本
v0.4.02026年9月27日 14:59下载慢?可在上方随时切换镜像源
项目说明
项目概述
vLLM Semantic Router 是一个可编程的路由层,用于在异构 LLM 基础设施上构建混合模型(Mixture-of-Models)系统。它评估请求信号、用户偏好和应用策略,为每个请求选择或组合最优的模型路径,而无需将路由逻辑硬编码到应用中。
主要功能
- 可编程路由层:支持混合模型系统的构建,根据请求信号、用户偏好和应用策略动态路由
- 异构计算支持:在 GPU、加速器、边缘和云端等异构计算环境间进行路由
- 多维度优化:提升质量、降低成本、延迟,并增强隐私与安全性
- 请求路由:基于意图分类的智能请求路由
- Envoy Proxy 集成:支持 Envoy 代理作为路由基础设施的一部分
适用人群
- 需要构建混合模型推理系统的 AI 工程师和开发者
- 希望在异构 LLM 基础设施上优化成本、延迟和质量的团队
- 对多模型路由和智能调度感兴趣的 LLM 应用开发者
快速上手
- 安装 CLI:
curl -fsSL https://vllm-sr.ai/install.sh | bash -s -- --channel dev - 详细的平台配置和故障排查请参考安装指南
- 在线 playground 凭证:用户名
love@vllm-sr.ai,密码vllm-sr-read
核心优势
- 可编程的混合模型路由:无需硬编码路由逻辑即可实现智能模型选择
- 跨异构计算环境:支持 GPU、加速器、边缘和云端等多种计算资源
- 多维度优化:同时优化质量、成本、延迟和隐私
- 信号驱动决策:基于请求信号、用户偏好和应用策略进行智能路由
系统要求
- 操作系统:跨平台(支持 Linux、macOS)
历史版本
排序