← 返回教程目录
Llama 系列
一句话简介:Meta 开源权重的模型家族,权重可免费下载、本地运行。
主流功能:私有化部署推理、微调底座、端侧运行
可用性:国内可直接使用。
适用人群:想零成本、私密地在自己电脑上跑 AI 的普通用户;想本地调试模型、做 RAG/Agent 开发的开发者
前置条件:
- 系统:Windows 10/11、macOS 12+、Linux(Ubuntu 20.04+ 推荐)
- 硬件:至少 8GB 内存(推荐 16GB+)
- 网络:国内常规网络即可(下载模型建议走镜像加速)
- 费用:全部免费
步骤 1:安装 Ollama
Linux / macOS(一行命令):
curl -fsSL https://ollama.com/install.sh | sh
Windows / macOS 图形安装:
- 打开
https://ollama.com/download,下载对应系统的安装包(Windows 是.exe,macOS 是.dmg)。 - 双击安装,一路下一步。安装后 Ollama 会在后台运行服务(默认端口
11434)。
验证安装:
ollama --version # 显示版本号即成功
步骤 2:配置国内下载加速(重要,否则可能龟速/超时)
Ollama 默认从官方服务器拉模型,国内直连较慢。以下方法三选一(按推荐度排序):
方法 A:走 ModelScope 魔搭社区(国内一键,社区教程验证较多)
# 魔搭社区模型页有"复制 Ollama 命令"按钮,格式如:
ollama run modelscope.cn/Qwen/Qwen3-8B-GGUF
魔搭(https://www.modelscope.cn)上有大量 GGUF 格式模型可直接用 Ollama 拉取,国内速度快。Llama 4 的 GGUF 版本可在魔搭搜索 "Llama-4 GGUF" 找下载量高的。
方法 B:用镜像站手动下载 GGUF + Modelfile 导入(最稳)
- 从 hf-mirror.com(HuggingFace 国内镜像)或魔搭下载 Llama 4 的 GGUF 权重文件(如
Q4_K_M量化版)。 - 在权重文件同目录写一个
Modelfile:
FROM ./llama4-scout-Q4_K_M.gguf
- 导入并运行:
ollama create llama4-local -f Modelfile
ollama run llama4-local
方法 C:终端挂代理后直接拉官方源
export https_proxy=http://127.0.0.1:7890 http_proxy=http://127.0.0.1:7890
ollama pull llama4
(代理地址按你本机实际填写;仅下载时需要,跑起来后可关。)
步骤 3:拉取并运行 Llama 4
# 首次运行会自动下载模型,耐心等待(Scout 体积大,建议用方法 A/B)
ollama run llama4:scout
看到 >>> 提示符即可直接对话,输入中文问题测试。退出输入 /bye。
指定 Maverick:
ollama run llama4:maverick
步骤 4:常用管理命令
ollama list # 查看本地已下载的模型
ollama pull llama4:scout # 只下载不运行
ollama rm llama4:scout # 删除模型(腾空间)
ollama ps # 查看当前加载到内存的模型
步骤 5(可选):换个好用的聊天界面 + API 调用
Open WebUI(推荐的图形界面,带历史记录/知识库):
docker run -d -p 3000:3000 --add-host=host.docker.internal:host-gateway \
-v openwebui:/app/backend/data --name open-webui --restart always \
ghcr.io/open-webui/openwebui:main
浏览器打开 http://localhost:3000 即可可视化聊天。
Python 调用本地模型(Ollama 自带 OpenAI 兼容接口):
pip install ollama -i https://pypi.tuna.tsinghua.edu.cn/simple
import ollama
response = ollama.chat(
model="llama4:scout",
messages=[{"role": "user", "content": "用中文解释什么是 MoE"}],
)
print(response["message"]["content"])
改模型存放位置(C 盘告急时):
# Linux/macOS,提前设置环境变量再启动 ollama
export OLLAMA_MODELS=/data/ollama-models
# Windows:在系统环境变量里新建 OLLAMA_MODELS=D:\ollama\models,重启 Ollama
常见问题
ollama run卡在下载/超时? 先走步骤 2 的国内加速(魔搭/镜像站 GGUF+Modelfile);检查硬盘空间是否足够。- 提示显存/内存不足?
换更小的量化版本(如 Q4_K_M)或更小的模型(如
qwen3:8b);Llama 4 Maverick 需要高配机器,别硬上。 curl ... | sh安装后找不到 ollama 命令? 重开一个终端;或检查/usr/local/bin是否在 PATH 里。- Windows 上 Ollama 服务没启动? 去任务栏托盘找 Ollama 图标右键 Quit 后重开;确认 11434 端口没被占用。
- 模型回答中文很差?
原生 Llama 中文偏弱是已知特点;日常中文对话建议用
qwen3等中文优化模型,Llama 4 适合英文任务、代码与 Agent 场景。