依托 890万 月活开发者, 服务 85% 财富500强企业, 保持 17.6万 GitHub星标, 带来 零信任 的本地AI运行时。

为什么开发者把它当 桌面基础设施

从个人笔记本到财富500强内网,同一套命令、同一套 API。

一行命令,模型就跑起来了

他的笔记本只有 16GB 内存,过去跑大模型要配三天环境。现在 `ollama run qwen2.5:7b` 回车,30 秒后进对话。自动选最优量化、绑 GPU、开 API,全程不用看文档。

数据 100% 留在本机

她在银行做合规,合同和客资不能出内网。Ollama 全部推理在本地完成,断网可用,日志不外发,符合等保与 GDPR。换云端 API 的方案直接被安全部驳回。

OpenAI 兼容 API

他把 base_url 从 api.openai.com 改成 localhost:11434,800 行代码一行没改。LangChain、LlamaIndex、AutoGen 全部零成本迁移,按 token 计费变成按电费计费。

模型库像 Docker Hub

他用 `ollama pull` 试了 12 个模型,像挑容器镜像一样。Llama 写文案、Qwen 翻中文、DeepSeek 算数学、CodeLlama 补代码,每个场景换一个,互不干扰。

深度 解析

三个真实场景,看它怎么把"难用"变成"顺手"。

场景一 · 拉模型

他第一次跑大模型,从下载到对话只用了 4 分钟

以前配 CUDA、装 PyTorch、下权重要半天。他装好 Ollama 后打开终端,输入一条命令,进度条走完直接进入对话。模型自动量化到 4-bit,8GB 内存的笔记本也能流畅跑 7B。

Terminal — ollama pull
$ ollama pull qwen2.5:7b pulling manifest... ✔ manifest (3.2 KB) pulling layers... qwen2.5-7b-q4_k_m.gguf 3.8 GB / 4.3 GB ⚡ 12.4 MB/s · 预计 38 秒 ✔ done · ready to run
场景二 · 接 API

她把云端 GPT 换成自家笔记本,代码一行没改

她的 RAG 应用原本调 OpenAI,每月烧 200 美元。她把 base_url 指到 localhost:11434,模型换成 Llama 3.1 8B,输出质量没降级,成本归零。代码里只有 import 那一行动了。

app.py — OpenAI compatible
from openai import OpenAI # 只改这一行 ↓ client = OpenAI(base_url="http://localhost:11434/v1") # 其余代码完全不变 resp = client.chat.completions.create( model="llama3.1:8b", messages=[{"role":"user","content":q}] ) ✓ 200 OK · 0.8s · 128 tok/s
场景三 · 自定义模型

他给模型写了份"岗位说明书",输出立刻变专业

他想让模型扮演资深 code reviewer。没碰训练代码,写了一份 Modelfile:系统提示词、温度、Top-P、绑工具,像写 Dockerfile 一样声明。同事 `ollama create` 一下就能复现他的配置。

Modelfile — reviewer
# 像 Dockerfile 一样声明模型 FROM llama3.1:8b PARAMETER temperature 0.2 PARAMETER top_p 0.9 PARAMETER num_ctx 16384 SYSTEM """You are a senior code reviewer. Flag bugs, suggest fixes, cite lines."""

谁在 默默依赖

三类典型用户,各自解决了什么麻烦。

独立开发者

做 side project 不想付 API 月费。他本地跑 7B 模型做原型,产品跑通了再考虑上云。一台 M2 MacBook 同时跑推理、写代码、开会议,风扇都不转。

"从 `curl install` 到第一个 demo 上线,不到一个下午。"

研究人员

她做医疗 NLP,患者数据不能出境。Ollama 跑在内网服务器上,7×24 小时批处理病历摘要,零外发流量。合规审查一次过,不用写数据流转说明。

"等保三级的材料里,这一项最没争议。"

运维工程师

他给公司搭内部 AI 助手,30 人共用一台 GPU 服务器。Ollama 的并发调度 + Open WebUI 做前端,员工以为在用 SaaS,其实是他机柜里那台老 Dell。运维成本约等于电费。

"财务看账单时以为我忘填了云服务商。"

常见问题 FAQ

用朋友聊天的语气解释,不端着。

我电脑能跑多大的模型?

经验值:模型参数量(B) × 量化位数 ÷ 8 ≈ 所需内存(GB)。7B 模型 INT4 约 3.5GB,8GB 内存的笔记本刚好能跑。有 GPU 更好,没 GPU 也能用 CPU 跑,就是慢点。M 系列 Mac 因为统一内存架构,能塞更大的模型。先 `ollama run qwen:0.5b` 试水,能跑再上大的。

和直接调 OpenAI 比,差在哪?

调用方式几乎一样,改个 base_url 就行。差别在:① 数据不出本机,敏感内容放心喂;② 没网也能用,飞机高铁不断档;③ 不按 token 收费,只花电费。代价是 7B 模型的能力天花板比 GPT-4 低,复杂任务上不去。建议开发阶段本地迭代,上线再按场景选云端或本地。

Windows 能用吗?不是只有 Linux 才玩得转?

2024 年起就有官方 Windows 安装包了,双击 .exe 走完向导就行。自动配 PATH、装服务、开 11434 端口。NVIDIA 显卡(CUDA 12+)直接加速,AMD 显卡走 ROCm,Snapdragon X Elite 这种 ARM 本走 DirectML。不用碰 WSL。

模型下载慢 / 卡住怎么办?

v0.32.3 已经修过下载卡顿的 bug。如果还慢,大概率是网络问题——模型文件托管在境外 CDN。可以换网络、挂代理,或者用 `ollama pull` 的 `--insecure` 选项。下载是断点续传的,关了重开不会从头来。模型存到 `~/.ollama/models/`(macOS/Linux)或用户目录下,C 盘不够可以设 `OLLAMA_MODELS` 改路径。

我想做 RAG(知识库问答),怎么搞?

Ollama 提供 embedding 模型(nomic-embed-text、mxbai-embed-large),配合 Chroma、Qdrant、Milvus 这种向量库就能搭 RAG。LangChain 和 LlamaIndex 都有官方 Ollama 集成,十几行代码搞定。把公司文档切片→向量化→存库→检索→喂给 LLM 生成答案,整条链路本地闭环。这是目前最受欢迎的用法之一。

Modelfile 是什么,我必须学吗?

不必须。不写 Modelfile 也能正常 `ollama run`。它更像"高级玩法"——你想固定系统提示词、调温度、绑工具、做 LoRA 微调时,把配置写进文件,版本化管理,可复现、可分享。同事拿到你的 Modelfile 一条 `ollama create my-model -f Modelfile` 就能复刻你的专属模型。当作用 Dockerfile 的思路去理解就对了。

用户怎么说

来自 GitHub、Hacker News、V2EX 的真实声音

★★★★★

"我是做金融数据合规的,客户资料一个字节都不能出内网。试过好几套本地方案,Ollama 是唯一一个让安全部挑不出毛病的——没外发请求、没遥测、日志全在本地。现在我们 30 多人的团队全切到它上面跑内部知识库。"

林工 · 金融IT架构师
★★★★☆

"独立开发者的神器。之前每月 OpenAI 账单 200 多刀,换 Ollama 本地跑 Llama 3.1 8B 之后成本归零。M2 MacBook Air 16GB 上 7B 模型约 10 tok/s,写文案、做摘要够用。代码基本不用改,改个 URL 就行。"

S
Sam · 独立开发者
★★★★★

"教学生用 LLM 不用再申请 API key、担心超额。让每人装 Ollama,作业模板用 Modelfile 分发,保证大家模型配置一致。从 Python 到 Go 到 Rust 调用都很直接,是我们课程的最佳入门路径。"

陈教授 · 计算机系
前往下载页面 →