Skip to content

Ollama

本机一键跑开源模型:安装包 + CLI + 本地 HTTP API,开发联调最常见。

它是做什么的

Ollama 把「安装运行时、拉取模型、本地对话、HTTP 调用」收成一条短路径。官方支持 macOS / Windows / Linux;装好后本机默认起 API,也可选用 Ollama Cloud 跑更大模型。提供官方 Python / JavaScript 库,并兼容部分 OpenAI API,方便现有客户端改 base_url 接入。定位是「先本地跑起来」,不是 GPU 集群高吞吐 Serving。

典型用法是:开发机装好 → ollama pull / run 验证模型 → 再用原生 API 或 /v1 兼容层接到自己的应用、Agent 或编辑器插件。云模型与本地模型命令相近,便于同一套脚本切换。文档与模型库更新快,集成细节以 docs.ollama.com 为准。

要点

  • 本机优先:默认 API 根路径在 http://localhost:11434;官方强调可完全离线跑关键任务,数据默认留在本机。
  • 用法简单:终端 ollama run <model> 即可对话;也可开交互菜单,启动常用编辑器 / Agent 集成。
  • 双 API:原生 /api/*(如 generate);另有 OpenAI 兼容层(/v1/chat/completions 等,示例 base_urlhttp://localhost:11434/v1/api_key 可填占位)。
  • 模型与云:库内覆盖对话、编码、视觉、嵌入、推理等;本地模型与 :cloud 云模型可用相近命令启动。
  • 和同类比:比 vLLM 更偏开发机快速起模;比 LM Studio 更偏 CLI/脚本;比 llama.cpp 少碰编译与量化细节。

适合谁

  • 本机/内网先跑通联调,不想一上来配 Serving 与显存调参
  • 用 OpenAI SDK、Cursor 类工具或自写脚本对接本地模型
  • 需要「本地为主、偶尔上云大模型」的同一套命令与 API 体验
  • 个人开发者或小团队做 Demo、评测、离线原型,而不是一上来就上集群

官方入口

建议怎么用

按 Quickstart 安装后,先 ollama run 确认对话通,再按文档发第一条 API 或用官方 Python / JS 库。若代码已是 OpenAI SDK,只改本机 /v1/base_url 做冒烟。模型体积与显存要自己估,别一上来就拉最大参数量。多人高并发、生产吞吐再迁 vLLM;只要 GUI 管理模型可看 LM Studio;要嵌进无 Python 环境再看 llama.cpp

本站为个人非经营性学习导航。免责声明:信息仅供学习参考,不构成建议或背书;外链与第三方产品归其权利人。详情见 关于本站 · 隐私政策