vllm-project

semantic-router

一个用于异构LLM推理的可编程混合模型(MoM)路由器,通过评估请求信号、用户偏好和应用策略,为每个请求选择或组合最优的模型路径,以提升质量、降低成本、延迟和增强隐私与安全。

v0.4.0
发布于
2 天前
5,959
星标
107
下载
同步于
1 天前

最新版本

v0.4.02026年9月27日 14:59
下载慢?可在上方随时切换镜像源

项目说明

项目概述

vLLM Semantic Router 是一个可编程的路由层,用于在异构 LLM 基础设施上构建混合模型(Mixture-of-Models)系统。它评估请求信号、用户偏好和应用策略,为每个请求选择或组合最优的模型路径,而无需将路由逻辑硬编码到应用中。

主要功能

  • 可编程路由层:支持混合模型系统的构建,根据请求信号、用户偏好和应用策略动态路由
  • 异构计算支持:在 GPU、加速器、边缘和云端等异构计算环境间进行路由
  • 多维度优化:提升质量、降低成本、延迟,并增强隐私与安全性
  • 请求路由:基于意图分类的智能请求路由
  • Envoy Proxy 集成:支持 Envoy 代理作为路由基础设施的一部分

适用人群

  • 需要构建混合模型推理系统的 AI 工程师和开发者
  • 希望在异构 LLM 基础设施上优化成本、延迟和质量的团队
  • 对多模型路由和智能调度感兴趣的 LLM 应用开发者

快速上手

  1. 安装 CLI:curl -fsSL https://vllm-sr.ai/install.sh | bash -s -- --channel dev
  2. 详细的平台配置和故障排查请参考安装指南
  3. 在线 playground 凭证:用户名 love@vllm-sr.ai,密码 vllm-sr-read

核心优势

  • 可编程的混合模型路由:无需硬编码路由逻辑即可实现智能模型选择
  • 跨异构计算环境:支持 GPU、加速器、边缘和云端等多种计算资源
  • 多维度优化:同时优化质量、成本、延迟和隐私
  • 信号驱动决策:基于请求信号、用户偏好和应用策略进行智能路由

系统要求

  • 操作系统:跨平台(支持 Linux、macOS)

历史版本

排序