← 返回教程目录

Falcon H1

一句话简介:阿联酋阿布扎比技术创新研究院(TII)发布的混合架构大模型系列。

主流功能:阿拉伯语任务、主权/政务部署

可用性:可用性:国内可直接使用。

适用人群:想体验 Mamba 混合架构、低显存跑长上下文模型的极客与研究者

前置条件:

  • 网络:能访问 hf-mirror.com(或 modelscope.cn)下载权重
  • 账号:无需注册,HuggingFace 公开仓库直接下载
  • 费用:免费(Apache 2.0,可商用)
  • 硬件:3B-Instruct Q4 量化:约 2–4GB 显存/内存

分步骤教程

方式一:Ollama + 官方 GGUF(推荐,国内可直下)

TII 官方发布了 3B-Instruct 的 GGUF 量化版(tiiuae/Falcon-H1-3B-Instruct-GGUF),Ollama 官方库另有上一代 falcon3,H1 建议用 Modelfile 方式接入:

步骤 1:安装 Ollama(同 19 篇:官网装安装包,或 Linux 执行 curl -fsSL https://ollama.com/install.sh | sh)

步骤 2:从镜像站下载 GGUF 文件

  1. 打开 https://hf-mirror.com/tiiuae/Falcon-H1-3B-Instruct-GGUF
  2. 进入 Files 页,下载一个量化文件(新手选 Q4_K_M,文件名类似 falcon-h1-3b-instruct-q4_k_m.gguf,约 2GB)
  3. 放到本地目录,如 ~/models/falcon-h1/

也可在魔搭社区搜索 Falcon-H1 找国内同步的 GGUF 资源,下载更快。

步骤 3:写 Modelfile 并创建模型

在 ~/models/falcon-h1/ 下新建文件 Modelfile,内容:

FROM./falcon-h1-3b-instruct-q4_k_m.gguf
PARAMETER temperature 0.7
SYSTEM "You are a helpful assistant."

执行:

cd ~/models/falcon-h1
ollama create falcon-h1-3b -f Modelfile
ollama run falcon-h1-3b

看到 >>> 即成功。常用管理命令:ollama list(查看已装模型)、ollama rm falcon-h1-3b(删除)。

步骤 4(可选):配 Open WebUI 图形界面

docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data --name open-webui --restart always \
ghcr.io/open-webui/open-webui:main

浏览器打开 http://127.0.0.1:3000,注册本地账号后在模型下拉框选 falcon-h1-3b 即可对话。

方式二:HuggingFace transformers 部署(适合开发与微调)

步骤 1:换源并安装

pip install -i https://pypi.tuna.tsinghua.edu.cn/simple torch transformers accelerate
export HF_ENDPOINT=https://hf-mirror.com

步骤 2:运行 Instruct 版

from transformers import AutoTokenizer, AutoModelForCausalLM
import torch

model_id = "tiiuae/Falcon-H1-3B-Instruct" # 可换 7B / 0.5B 等
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(
model_id, torch_dtype=torch.bfloat16,
device_map="auto", trust_remote_code=True)

messages = [{"role": "user", "content": "用中文解释一下什么是混合架构大模型"}]
inputs = tokenizer.apply_chat_template(messages, add_generation_prompt=True,
return_tensors="pt").to(model.device)
out = model.generate(inputs, max_new_tokens=300, do_sample=True, temperature=0.7)
print(tokenizer.decode(out[0], skip_special_tokens=True))

方式三:高性能推理(vLLM / SGLang / MLX)

  • 推理框架支持情况:SGLang(2025-10 起)、MLX(2025-09 起)已集成 Falcon-H1;NVIDIA Megatron Core 也已支持其并行混合架构训练。
  • 有多卡服务器时,用 vLLM 起服务可获得 OpenAI 兼容接口,再接入各类 Agent 框架。具体命令以各框架官方文档为准,此处不展开。

常见问题

  1. Falcon H1 和 Ollama 库里的 falcon3 是什么关系? falcon3 是上一代纯 Transformer 架构;H1 是 2025 年 5 月发布的新一代 Mamba-Transformer 混合架构,架构不同、仓库不同,不要混用权重。

  2. 0.5B 真的能打 7B 吗? 这是 TII 官方的说法(小尺寸得益于混合架构效率),实际体验因任务而异;中文任务上建议实测对比后再决定。

  3. 中文支持怎么样? 官方称原生支持 18 种语言,但 Falcon 系列传统强项是英文/法文/阿文,中文能力弱于 Qwen 等国产模型,中文主力场景不建议首选。

  4. 下载 GGUF 时版本怎么选? 显存/内存紧张选 Q4_K_M(体积小、质量均衡);追求效果且内存够选 Q8_0。文件名里的 Instruct 版适合直接对话,Base 版是底座、需自己做指令微调。

  5. 商用需要授权吗? 不需要。H1 系列采用基于 Apache 2.0 的宽松许可,可免费商用(具体以各仓库 LICENSE 为准)。