GitHub 雷达
首次出现 67 天前
ggml-org/llama.cpp
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
近 7 日
+965
累计 Star
129.0k
Fork
23,497
近 30 日
+4,090
Star 趋势 · 50 个采集点
+6%7 月 28 日9 月 21 日
语言C++
分类AI/机器学习
最近提交9 月 21 日
创建时间3 月 11 日
首次收录7 月 28 日 · 自动扫描
README 摘要
llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
中文摘要由 AI 生成,仅供参考。
返回 GitHub 雷达在 GitHub 打开
ggml-org/llama.cpp
67 天前首次出现未被群岛收录llama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
C++创建于 2023 年 3 月最近提交 2026 年 9 月
累计 Star
129.0k
近 7 日新增
+965
近 30 日新增
+4,090
Fork
23,497
Star 趋势
共 50 个采集点 · 近 30 日 +4,0902026-07-272026-09-20
项目介绍
由 AI 摘自仓库 READMEllama.cpp 是一个用C/C++实现的大语言模型推理引擎,旨在让用户无需复杂依赖即可在本地或云端运行LLM。 主要技术栈为纯C/C++,利用ARM NEON、Metal、AVX、CUDA、Vulkan等多种底层硬件加速库和自定义量化技术(1.5至8位)来优化性能。 其亮点是支持从Apple Silicon到NVIDIA GPU的广泛硬件,并能在CPU+GPU混合模式下运行超出显存容量的大模型,适用于本地部署、隐私敏感场景和边缘计算。
仓库信息
Topics
#ggml
来自雷达
该项目由雷达自动扫描 GitHub 发现,含 Star 增速、提交活跃度与分类标签,中文摘要由 AI 生成。