GitHub 雷达
首次出现 102 天前

lyogavin/airllm

AirLLM 是一个开源项目,它解决了在显存极低的 GPU(如单张 4GB 显卡)上运行 70B 甚至 671B 等超大参数大语言模型进行推理的问题,无需量化、蒸馏或剪枝。 主要技术栈基于 Python 和 Jupyter Notebook,通过创新的分层模型分解与块级量化压缩技术,将模型按层拆分并动态加载到显存中,从而大幅降低单次推理的内存占用。 其亮点在于能让普通用户或资源受限的环境(如个人电脑、低配云服务器)轻松运行 Llama 3.1 405B、DeepSeek-V3 等顶级大模型,适用于低成本部署、本地实验和隐私敏感场景。

近 7 日
+396
累计 Star
34.6k
Fork
3,644
近 30 日
+3,851
Star 趋势 · 30 个采集点
+64%
6 月 23 日9 月 21 日
语言Jupyter Notebook
分类AI/机器学习
最近提交9 月 20 日
创建时间6 月 13 日
首次收录6 月 23 日 · 自动扫描
README 摘要
AirLLM 是一个开源项目,它解决了在显存极低的 GPU(如单张 4GB 显卡)上运行 70B 甚至 671B 等超大参数大语言模型进行推理的问题,无需量化、蒸馏或剪枝。 主要技术栈基于 Python 和 Jupyter Notebook,通过创新的分层模型分解与块级量化压缩技术,将模型按层拆分并动态加载到显存中,从而大幅降低单次推理的内存占用。 其亮点在于能让普通用户或资源受限的环境(如个人电脑、低配云服务器)轻松运行 Llama 3.1 405B、DeepSeek-V3 等顶级大模型,适用于低成本部署、本地实验和隐私敏感场景。
中文摘要由 AI 生成,仅供参考。
在 GitHub 打开