Ollama 怎么用?本地免费跑大模型完整教程(2026 保姆级实操)
Ollama 是什么、怎么装、怎么跑本地大模型?本文用可复现步骤带你在自己电脑上免费运行 Qwen、Llama 等开源模型,附命令、API 调用与避坑指南。
想在自己电脑上免费跑一个不联网、不花 token 费的 AI 大模型吗?Ollama 就是 2026 年最简单的答案。很多人搜索「Ollama 怎么用」「本地部署大模型教程」,却被一堆命令行吓退。这篇保姆级实操会带你从零安装 Ollama、跑起第一个本地大模型(以中文友好的 Qwen 为例),再用 API 把它接进自己的工作流——全程可复现,照着做就能成。
Ollama 是什么?为什么本地跑大模型值得?
Ollama 是一个开源的本地大语言模型运行框架,把「下载模型 + 运行推理 + 提供 API」这几件麻烦事打包成一条命令。它支持 macOS、Windows、Linux,也能用 Docker,代码托管在 Ollama 的 GitHub 仓库。
本地跑模型的三个理由:数据不出本机(隐私敏感场景刚需)、无 token 账单(跑多少都免费)、离线可用。代价是:效果通常不如 Claude、GPT 这类云端旗舰,且要吃你自己的内存和显卡。
Ollama 怎么安装?(三系统步骤)
Windows / macOS:打开 Ollama 官网 点 Download,下载后双击安装,和装普通软件一样。
Linux(或想用命令行):打开终端,执行官方一键脚本:
curl -fsSL https://ollama.com/install.sh | sh
装完在终端输入 ollama --version,能打印版本号就代表成功。Ollama 会在后台常驻,默认监听 127.0.0.1:11434 这个端口。
怎么跑第一个本地大模型?
一条命令搞定。以对中文更友好的通义千问为例:
ollama run qwen2.5
第一次运行会自动下载模型(几 GB,取决于型号),下载完出现 >>> 提示符就能直接对话。想退出输入 /bye。
常用命令速查:ollama pull <模型名> 只下载不运行;ollama list 看已装模型;ollama rm <模型名> 删除模型释放空间。想换更小的模型省内存,可以试 ollama run qwen2.5:3b。更多可选模型在 Ollama 模型库 里都能搜到。
电脑配置要求高吗?
Ollama 对硬件门槛不算高:CPU 建议 4 核以上,内存至少 8GB,跑较大模型推荐 16GB 或更高;有独立显卡(尤其 NVIDIA)会明显更快。经验法则——模型参数量越大越聪明,但也越吃内存。个人电脑先从 3B–7B 级别起步最稳。
| 模型规模 | 建议内存 | 适合场景 |
|---|---|---|
| 3B | 8GB | 轻量问答、草稿 |
| 7B–8B | 16GB | 日常写作、翻译 |
| 14B+ | 32GB / 独显 | 复杂推理、代码 |
怎么把 Ollama 接进自己的程序?(API 调用)
Ollama 启动后自带一个本地 API,端口 11434。用任意方式发一个 POST 请求即可。用 curl 测试:
curl http://localhost:11434/api/generate -d '{"model":"qwen2.5","prompt":"用一句话介绍杭州"}'
它会流式返回结果。因为接口和 OpenAI 风格接近,很多现成工具(各种聊天前端、n8n 自动化节点)只要把 API 地址改成 http://localhost:11434 就能直接对接。这一步是把「玩具」变成「生产力」的关键。
Marco 观点:本地大模型,谁真正用得上?
我的判断是:本地大模型不是给所有人的,别为了「本地」而本地。 如果你只是偶尔问问 AI、写写文案,云端的 Claude / ChatGPT 体验更好也更省心,没必要折腾。真正值得上 Ollama 的是三类人:一是处理敏感数据、合规上不能把内容传上云的团队;二是要大批量、高频调用、想砍掉 token 账单的开发者;三是想在断网环境或边缘设备上跑 AI 的人。对中文用户,我建议首选 Qwen 系列而不是默认的 Llama——中文表达明显更自然。坑也要说清楚:小模型的「幻觉」比旗舰云模型更严重,别拿它做需要事实准确的关键决策。
常见问题 FAQ
Q:Ollama 免费吗? A:Ollama 本身开源免费,跑模型也不收 token 费,唯一成本是你自己的电脑硬件和电费。
Q:Ollama 支持中文模型吗?
A:支持。推荐 ollama run qwen2.5(通义千问),中文能力比默认 Llama 更好;也有 DeepSeek、GLM 等可选。
Q:没有独立显卡能用吗? A:能。纯 CPU 也能跑,只是速度慢一些。8GB 内存跑 3B 模型体验尚可,想流畅建议 16GB + 独显。
Q:Ollama 和 Claude Code 有什么关系? A:Ollama 提供本地模型,Claude Code 是云端旗舰驱动的编程工具,两者定位不同;追求代码质量选后者,追求隐私和零成本选前者。
延伸阅读
- Claude Sonnet 5 是什么?Anthropic 最强 agentic 模型全解析:价格、跑分与怎么用(2026)
- ChatGPT、Claude、Gemini 怎么选?2026 中小团队 AI 工具选型指南
- 联合国全球 AI 治理对话是什么?日内瓦峰会全解析:影响与我们该做什么(2026)
写在最后
本地跑大模型没你想的那么难——三条命令就能让 Qwen 在你自己的电脑上跑起来。先从小模型试水,跑通 API,再决定要不要接进工作流。如果这篇教程帮你省下了摸索时间,欢迎关注 Marco聊科技,订阅我们的免费 AI 工具操作指南,第一时间拿到更多可复现的 AI 实战干货。