GitHub 雷达
首次出现 102 天前

vllm-project/vllm

1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续

近 7 日
+665
累计 Star
92.3k
Fork
22,451
近 30 日
+2,697
Star 趋势 · 58 个采集点
+10%
6 月 23 日9 月 21 日
语言Python
分类AI/机器学习
最近提交9 月 21 日
创建时间2 月 9 日
首次收录6 月 23 日 · 自动扫描
README 摘要
1. 解决什么问题 / 是什么:vLLM 是一个专注高吞吐、低显存占用的大语言模型(LLM)推理与在线服务引擎,旨在让 LLM 部署变得快速、简单且低成本。 2. 主要技术栈或实现方式:基于 PagedAttention 高效管理 KV 缓存,集成连续
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开