外观
llama.cpp
C/C++ 本地推理实现:少依赖、量化友好,CPU / 消费级 GPU / 边缘设备常见。
它是做什么的
llama.cpp 的目标是:最少搭建成本,在广泛硬件上跑 LLM。纯 C/C++、无重依赖;Apple Silicon(Metal 等)是一等公民;也支持 x86 AVX 系列、CUDA / HIP、Vulkan、SYCL,以及 CPU+GPU 混合推理(模型大于显存时部分卸载)。模型侧以 GGUF 与多种整数量化为主。提供 llama-cli 对话、llama-server(OpenAI 兼容 API,含 WebUI)等入口,是许多桌面工具底层栈的重要参考实现。
如果你要的是「可控的本地推理引擎」而不是「安装包产品」,从这里入手最直接:选后端、选量化、再决定用 CLI 还是 server。许多上层工具最终也会落到相近的 GGUF / ggml 栈。
要点
- 嵌入与移植:适合进自研程序、边缘盒子、无完整 Python 栈的环境。
- 量化与内存:官方强调 1.5bit~8bit 等量化路径,用于降内存与加速(具体格式以仓库为准)。
- 两种常用入口:
llama-cli本机对话;llama-server起 OpenAI 兼容服务;可用-hf直接从 Hugging Face 拉 GGUF。 - 安装方式多:brew / nix / winget / conda、Docker、Release 二进制与源码编译(见 install / build 文档)。
- 和同类比:比 Ollama / LM Studio 更底层、可嵌入;比 vLLM 更偏轻量硬件与 GGUF,而非 HF 高吞吐 Serving。仓库文档与 discussion 更新快,构建参数以当前 README 为准。
适合谁
- CPU / 轻量 GPU / 边缘设备要跑本地模型
- 要把推理嵌进自己的 C/C++ 或跨平台程序
- 需要精细控制量化精度与后端(CUDA / Metal / Vulkan 等)
- 愿意自己选 GGUF、编译选项与内存布局,换取最大可移植性与可控性
官方入口
建议怎么用
先用官方安装包或 Release 二进制跑通 llama-cli -hf <gguf-repo>,确认硬件后端生效;再按 build 文档打开 CUDA / Metal 等加速。要对应用暴露接口时用 llama-server,用 OpenAI 兼容客户端改 base_url 验证。需要图形界面或「装完就能聊」时优先 LM Studio / Ollama;GPU 多用户高吞吐再评估 vLLM。