📅 2026年7月7日

Ollama 怎么用?本地免费跑大模型完整教程(2026 保姆级实操)

Ollama 是什么、怎么装、怎么跑本地大模型?本文用可复现步骤带你在自己电脑上免费运行 Qwen、Llama 等开源模型,附命令、API 调用与避坑指南。

Ollama 怎么用?本地免费跑大模型完整教程(2026 保姆级实操)

想在自己电脑上免费跑一个不联网、不花 token 费的 AI 大模型吗?Ollama 就是 2026 年最简单的答案。很多人搜索「Ollama 怎么用」「本地部署大模型教程」,却被一堆命令行吓退。这篇保姆级实操会带你从零安装 Ollama、跑起第一个本地大模型(以中文友好的 Qwen 为例),再用 API 把它接进自己的工作流——全程可复现,照着做就能成。

Ollama 是什么?为什么本地跑大模型值得?

Ollama 是一个开源的本地大语言模型运行框架,把「下载模型 + 运行推理 + 提供 API」这几件麻烦事打包成一条命令。它支持 macOS、Windows、Linux,也能用 Docker,代码托管在 Ollama 的 GitHub 仓库

本地跑模型的三个理由:数据不出本机(隐私敏感场景刚需)、无 token 账单(跑多少都免费)、离线可用。代价是:效果通常不如 Claude、GPT 这类云端旗舰,且要吃你自己的内存和显卡。

Ollama 怎么安装?(三系统步骤)

Windows / macOS:打开 Ollama 官网 点 Download,下载后双击安装,和装普通软件一样。

Linux(或想用命令行):打开终端,执行官方一键脚本:

curl -fsSL https://ollama.com/install.sh | sh

装完在终端输入 ollama --version,能打印版本号就代表成功。Ollama 会在后台常驻,默认监听 127.0.0.1:11434 这个端口。

怎么跑第一个本地大模型?

一条命令搞定。以对中文更友好的通义千问为例:

ollama run qwen2.5

第一次运行会自动下载模型(几 GB,取决于型号),下载完出现 >>> 提示符就能直接对话。想退出输入 /bye

常用命令速查:ollama pull <模型名> 只下载不运行;ollama list 看已装模型;ollama rm <模型名> 删除模型释放空间。想换更小的模型省内存,可以试 ollama run qwen2.5:3b。更多可选模型在 Ollama 模型库 里都能搜到。

电脑配置要求高吗?

Ollama 对硬件门槛不算高:CPU 建议 4 核以上,内存至少 8GB,跑较大模型推荐 16GB 或更高;有独立显卡(尤其 NVIDIA)会明显更快。经验法则——模型参数量越大越聪明,但也越吃内存。个人电脑先从 3B–7B 级别起步最稳。

模型规模 建议内存 适合场景
3B 8GB 轻量问答、草稿
7B–8B 16GB 日常写作、翻译
14B+ 32GB / 独显 复杂推理、代码

怎么把 Ollama 接进自己的程序?(API 调用)

Ollama 启动后自带一个本地 API,端口 11434。用任意方式发一个 POST 请求即可。用 curl 测试:

curl http://localhost:11434/api/generate -d '{"model":"qwen2.5","prompt":"用一句话介绍杭州"}'

它会流式返回结果。因为接口和 OpenAI 风格接近,很多现成工具(各种聊天前端、n8n 自动化节点)只要把 API 地址改成 http://localhost:11434 就能直接对接。这一步是把「玩具」变成「生产力」的关键。

Marco 观点:本地大模型,谁真正用得上?

我的判断是:本地大模型不是给所有人的,别为了「本地」而本地。 如果你只是偶尔问问 AI、写写文案,云端的 Claude / ChatGPT 体验更好也更省心,没必要折腾。真正值得上 Ollama 的是三类人:一是处理敏感数据、合规上不能把内容传上云的团队;二是要大批量、高频调用、想砍掉 token 账单的开发者;三是想在断网环境或边缘设备上跑 AI 的人。对中文用户,我建议首选 Qwen 系列而不是默认的 Llama——中文表达明显更自然。坑也要说清楚:小模型的「幻觉」比旗舰云模型更严重,别拿它做需要事实准确的关键决策。

常见问题 FAQ

Q:Ollama 免费吗? A:Ollama 本身开源免费,跑模型也不收 token 费,唯一成本是你自己的电脑硬件和电费。

Q:Ollama 支持中文模型吗? A:支持。推荐 ollama run qwen2.5(通义千问),中文能力比默认 Llama 更好;也有 DeepSeek、GLM 等可选。

Q:没有独立显卡能用吗? A:能。纯 CPU 也能跑,只是速度慢一些。8GB 内存跑 3B 模型体验尚可,想流畅建议 16GB + 独显。

Q:Ollama 和 Claude Code 有什么关系? A:Ollama 提供本地模型,Claude Code 是云端旗舰驱动的编程工具,两者定位不同;追求代码质量选后者,追求隐私和零成本选前者。

延伸阅读

写在最后

本地跑大模型没你想的那么难——三条命令就能让 Qwen 在你自己的电脑上跑起来。先从小模型试水,跑通 API,再决定要不要接进工作流。如果这篇教程帮你省下了摸索时间,欢迎关注 Marco聊科技,订阅我们的免费 AI 工具操作指南,第一时间拿到更多可复现的 AI 实战干货。

Marco聊科技 — AI 工具 · 教程 · 自动化

Marco 分享最新的 AI 工具评测、Claude / ChatGPT / Gemini 深度教程,以及 AI 自动化与效率提升技巧,帮助你在 AI 时代保持领先。以下是最新发布的文章:

查看全部文章 →