← 返回教程目录

Llama 系列

一句话简介:Meta 开源权重的模型家族,权重可免费下载、本地运行。

主流功能:私有化部署推理、微调底座、端侧运行

可用性:国内可直接使用。

适用人群:想零成本、私密地在自己电脑上跑 AI 的普通用户;想本地调试模型、做 RAG/Agent 开发的开发者

前置条件:

  • 系统:Windows 10/11、macOS 12+、Linux(Ubuntu 20.04+ 推荐)
  • 硬件:至少 8GB 内存(推荐 16GB+)
  • 网络:国内常规网络即可(下载模型建议走镜像加速)
  • 费用:全部免费

步骤 1:安装 Ollama

Linux / macOS(一行命令):

curl -fsSL https://ollama.com/install.sh | sh

Windows / macOS 图形安装:

  1. 打开 https://ollama.com/download,下载对应系统的安装包(Windows 是 .exe,macOS 是 .dmg)。
  2. 双击安装,一路下一步。安装后 Ollama 会在后台运行服务(默认端口 11434)。

验证安装:

ollama --version   # 显示版本号即成功

步骤 2:配置国内下载加速(重要,否则可能龟速/超时)

Ollama 默认从官方服务器拉模型,国内直连较慢。以下方法三选一(按推荐度排序):

方法 A:走 ModelScope 魔搭社区(国内一键,社区教程验证较多)

# 魔搭社区模型页有"复制 Ollama 命令"按钮,格式如:
ollama run modelscope.cn/Qwen/Qwen3-8B-GGUF

魔搭(https://www.modelscope.cn)上有大量 GGUF 格式模型可直接用 Ollama 拉取,国内速度快。Llama 4 的 GGUF 版本可在魔搭搜索 "Llama-4 GGUF" 找下载量高的。

方法 B:用镜像站手动下载 GGUF + Modelfile 导入(最稳)

  1. 从 hf-mirror.com(HuggingFace 国内镜像)或魔搭下载 Llama 4 的 GGUF 权重文件(如 Q4_K_M 量化版)。
  2. 在权重文件同目录写一个 Modelfile:
FROM ./llama4-scout-Q4_K_M.gguf
  1. 导入并运行:
ollama create llama4-local -f Modelfile
ollama run llama4-local

方法 C:终端挂代理后直接拉官方源

export https_proxy=http://127.0.0.1:7890 http_proxy=http://127.0.0.1:7890
ollama pull llama4

(代理地址按你本机实际填写;仅下载时需要,跑起来后可关。)

步骤 3:拉取并运行 Llama 4

# 首次运行会自动下载模型,耐心等待(Scout 体积大,建议用方法 A/B)
ollama run llama4:scout

看到 >>> 提示符即可直接对话,输入中文问题测试。退出输入 /bye。

指定 Maverick:

ollama run llama4:maverick

步骤 4:常用管理命令

ollama list          # 查看本地已下载的模型
ollama pull llama4:scout   # 只下载不运行
ollama rm llama4:scout     # 删除模型(腾空间)
ollama ps            # 查看当前加载到内存的模型

步骤 5(可选):换个好用的聊天界面 + API 调用

Open WebUI(推荐的图形界面,带历史记录/知识库):

docker run -d -p 3000:3000 --add-host=host.docker.internal:host-gateway \
  -v openwebui:/app/backend/data --name open-webui --restart always \
  ghcr.io/open-webui/openwebui:main

浏览器打开 http://localhost:3000 即可可视化聊天。

Python 调用本地模型(Ollama 自带 OpenAI 兼容接口):

pip install ollama -i https://pypi.tuna.tsinghua.edu.cn/simple
import ollama
response = ollama.chat(
    model="llama4:scout",
    messages=[{"role": "user", "content": "用中文解释什么是 MoE"}],
)
print(response["message"]["content"])

改模型存放位置(C 盘告急时):

# Linux/macOS,提前设置环境变量再启动 ollama
export OLLAMA_MODELS=/data/ollama-models
# Windows:在系统环境变量里新建 OLLAMA_MODELS=D:\ollama\models,重启 Ollama

常见问题

  1. ollama run 卡在下载/超时? 先走步骤 2 的国内加速(魔搭/镜像站 GGUF+Modelfile);检查硬盘空间是否足够。
  2. 提示显存/内存不足? 换更小的量化版本(如 Q4_K_M)或更小的模型(如 qwen3:8b);Llama 4 Maverick 需要高配机器,别硬上。
  3. curl ... | sh 安装后找不到 ollama 命令? 重开一个终端;或检查 /usr/local/bin 是否在 PATH 里。
  4. Windows 上 Ollama 服务没启动? 去任务栏托盘找 Ollama 图标右键 Quit 后重开;确认 11434 端口没被占用。
  5. 模型回答中文很差? 原生 Llama 中文偏弱是已知特点;日常中文对话建议用 qwen3 等中文优化模型,Llama 4 适合英文任务、代码与 Agent 场景。