Ollama本地大模型完整教程:免费跑Llama 4、千问Qwen3,数据不出你的电脑
痛点场景
三个让人想用本地大模型的理由: 1. 数据隐私:公司的合同、客户的聊天记录、个人日记——你不想把这些上传到任何云端AI 2. 网络限制:出差时没网、企业内网屏蔽外部AI服务、API偶尔抽风 3. 成本控制:重度用户每月API费用轻松上$100+,跑本地模型基本零成本
Ollama 让这一切变得简单——一条命令安装,一条命令运行模型,不需要懂CUDA、不需要配环境变量。
工具介绍
Ollama 是一个开源的本地大模型运行平台。它的设计哲学:让运行大模型像 docker run 一样简单。
核心特点: - 支持几乎所有主流开源模型:Llama 4、Qwen3、DeepSeek-V3、Mistral、Gemma等 - 自动GPU加速(NVIDIA/AMD/Apple Silicon) - 本地API(兼容OpenAI API格式,无缝替代) - Windows/macOS/Linux全平台 - 模型量化支持,8GB显存跑70亿参数模型没问题
官网:
https://ollama.com
GitHub:https://github.com/ollama/ollama(90k+ Stars)
安装:3分钟搞定
Windows
官网 https://ollama.com/download/windows 下载安装包 → 双击 → 完成。
安装后,右下角任务栏会出现羊驼图标,Ollama已在后台运行。
macOS
brew install ollama
或直接从官网下载 .dmg 安装。
Linux
curl -fsSL https://ollama.com/install.sh | sh
验证安装
ollama --version
# Ollama version 0.9.x
核心操作:5条命令玩转
1. 下载并运行模型
# 推荐首试:Qwen3(通义千问3,8B参数,中文最强开源模型之一)
ollama run qwen3:8b
# 或 Llama 4 Scout(Meta最新8B多模态模型)
ollama run llama4:8b
# DeepSeek-V3(目前综合能力最强的开源模型之一)
ollama run deepseek-v3:8b
首次运行自动下载(几个GB,视网速5-30分钟)。
2. 列出已下载的模型
ollama list
3. 删除模型
ollama rm qwen3:8b
4. 查看模型信息
ollama show qwen3:8b
5. 自定义系统提示词(Modelfile)
创建一个 Modelfile:
FROM qwen3:8b
PARAMETER temperature 0.7
SYSTEM "你是一个专业的技术文档写手,风格简洁、准确、实用。"
创建自定义模型:
ollama create tech-writer -f Modelfile
ollama run tech-writer
硬件要求实测
| 模型 | 参数量 | 最低显存 | 推荐显存 | 流畅度 |
|---|---|---|---|---|
| Qwen3:1.8b | 18亿 | 2GB | 4GB | ⚡⚡⚡ |
| Llama 4 Scout:8b | 80亿 | 6GB | 8GB | ⚡⚡⚡ |
| Qwen3:8b | 80亿 | 6GB | 8GB | ⚡⚡⚡ |
| DeepSeek-V3:8b | 80亿 | 6GB | 8GB | ⚡⚡⚡ |
| Qwen3:14b | 140亿 | 10GB | 16GB | ⚡⚡ |
| Qwen3:32b | 320亿 | 20GB | 24GB | ⚡ |
| Llama 4 Maverick:70b | 700亿 | 40GB | 48GB | ⚡ |
⚡⚡⚡ = 实时流畅 ⚡⚡ = 正常 ⚡ = 可用但稍慢
绝大数人的笔记本(16GB内存+8GB显存)跑8B模型绰绰有余。
MacBook M系列因为有统一内存,M2 Pro(16GB)跑Qwen3:14b也流畅。Windows游戏本更不用说。
接入第三方前端
命令行虽好用,但聊天体验一般。推荐这些前端:
Open WebUI(最推荐)
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
ghcr.io/open-webui/open-webui:main
访问 http://localhost:3000 → 一个完全可用的ChatGPT风格界面,自动连接本地Ollama。
支持:多模型切换、对话历史、文件上传、RAG(可以喂PDF让本地模型基于文档回答)。
官网:
https://openwebui.com
Chatbox(桌面应用,适合新手)
下载地址:https://chatboxai.app
安装后 → 设置 → 模型提供方选「Ollama」→ 自动检测本地模型 → 开始聊天。UI设计像微信,对非技术用户极友好。
嵌入自己的应用
Ollama的API完全兼容OpenAI格式:
from openai import OpenAI
client = OpenAI(
base_url="http://localhost:11434/v1", # Ollama服务地址
api_key="ollama" # 随便写,Ollama不校验
)
response = client.chat.completions.create(
model="qwen3:8b",
messages=[{"role": "user", "content": "用Python写一个快速排序"}]
)
print(response.choices[0].message.content)
所有基于OpenAI SDK的应用,改base_url和api_key就能跑在本地模型上。
进阶技巧
1. 同时运行多个模型
# 终端1
ollama run qwen3:8b
# 终端2
ollama run llama4:8b
两个模型同时可用,互不干扰(只要显存够)。
2. 调整上下文窗口
# 创建自定义模型时指定更长上下文
ollama create my-model --context-size 32768
Qwen3:8b默认32K上下文,对于分析长文档很有用。
3. 联网搜索(最新功能)
Ollama 0.6+支持tool calling。搭配Open WebUI,可以配置搜索引擎插件,让本地模型也能联网搜索,实现类似Perplexity的本地版。
4. 定时更新模型
ollama pull qwen3:8b # 拉取最新版本
开源模型更新频繁,每月拉一次保持最新。
对比:本地模型 vs API
| 维度 | Ollama本地 | API(OpenAI/Claude) |
|---|---|---|
| 成本 | 免费(电费忽略不计) | $20-100+/月 |
| 隐私 | ✅ 数据不出本机 | ⚠️ 数据上传云端 |
| 离线 | ✅ 断网也能用 | ❌ 必须联网 |
| 速度 | 8B模型实时 | 实时 |
| 能力上限 | 顶尖模型的70-80% | 100% |
| 配置难度 | ⭐(一条命令) | ⭐(填个Key) |
| 适合场景 | 日常辅助、隐私敏感 | 高强度推理、复杂编程 |
推荐策略:日常问答用Ollama本地模型,重大问题切换到云端API——两者不冲突,可以同时用。
大模型不应该被锁在硅谷的数据中心里。Ollama证明了:你笔记本里的小羊驼,也能跑出不错的AI体验。