盘古
一句话简介:华为的大模型系列。
主流功能:政企行业模型、端侧小艺 Agent
可用性:国内可直接使用(开源权重、GitCode 国内镜像、华为云 API 均为国内服务;本地部署官方以昇腾/国产 NPU 为原生环境,昇腾适配最佳)。
适用人群:有昇腾/国产算力的团队:在 Atlas 服务器上本地部署 openPangu-2.0-Flash
前置条件:
- 本地部署:昇腾 AI 服务器(如 Atlas 800T A2)或已装 CANN 工具链的 NPU 环境
- 华为云 API:华为云账号并实名认证
- 许可证:openPangu-2.0-Flash 采用 OPENPANGU MODEL LICENSE 2.0,商用前请阅读仓库 LICENSE 全文
- 说明:openPangu 官方部署文档以昇腾 NPU 为原生环境
教程一:开源权重本地部署(openPangu-2.0-Flash)
步骤 1:准备昇腾环境
- 硬件:Atlas 800T A2(64GB)或同等昇腾 NPU 服务器(以官方部署说明为准)。
- 软件:Linux(推荐 openEuler ≥ 24.03)、Python 3.10、CANN 工具链(如 8.1.RC1)、PyTorch +
torch_npu适配器。 - 确认 NPU 可见:
npu-smi info # 能列出昇腾设备即环境正常
python -c "import torch_npu; print(torch_npu.npu.is_available())"
步骤 2:下载权重(国内镜像优先)
# 方式一:GitCode 国内镜像(ascend-tribe 为昇腾生态官方组织)
git clone https://gitcode.com/ascend-tribe/openPangu-2.0-Flash
# 方式二:HuggingFace 官方仓库(国内直连慢,可用 hf-mirror.com 镜像站)
# https://huggingface.co/openpangu/openPangu-2.0-Flash
pip install "huggingface_hub[cli]" -i https://pypi.tuna.tsinghua.edu.cn/simple
huggingface-cli download openpangu/openPangu-2.0-Flash --local-dir ./openPangu-2.0-Flash
步骤 3:用官方 omni-infer 推理框架部署
- 获取推理代码仓(官方模型卡注明部署参考 openPangu-2.0-Infer / omni-infer 框架):
git clone <openPangu-2.0-Infer 仓库地址> # 地址以官方模型卡为准
cd openPangu-2.0-Infer
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
- 按仓库 README 的部署说明启动服务(示例为社区验证过的同系列 7B 模型流程,2.0-Flash 以其仓库 README 为准):
cd inference
python generate.py # 直接推理测试
# 或启动服务化部署(vllm-ascend / omni-infer 二选一,按 README 来)
步骤 4:调用验证
服务启动后,用 OpenAI 兼容格式调用(地址/端口以启动日志为准):
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model": "openPangu-2.0-Flash",
"messages": [{"role": "user", "content": "你好"}]}'
轻量替代:openPangu-Embedded-7B(小设备)
如果只有单张小显存卡/边缘设备,可先用 7B 的 Embedded 版本练手,流程类似:
git clone https://gitcode.com/ascend-tribe/openPangu-Embedded-7B-V1.1
cd openPangu-Embedded-7B-V1.1/inference
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
python generate.py
教程二:华为云盘古 API 接入教程
步骤 1:开通模型服务
- 注册华为云账号并完成实名认证。
- 进入 ModelArts → 模型广场(在线推理模型列表),搜索「盘古」。
- 选择需要的盘古模型,点击「开通服务」。
步骤 2:获取调用信息
- 开通后点击「调用说明」→「标准接口」,记录 API 地址(如
https://api.xxx/v1,只取基础地址部分)与 model 参数(模型 ID)。 - 点击「API Key 管理」,按指引申请 API Key 并妥善保存。
步骤 3:Python 调用(OpenAI 兼容)
from openai import OpenAI
client = OpenAI(
base_url="https://api.xxx/v1", # 替换为步骤2记录的基础地址
api_key="你的API Key",
)
resp = client.chat.completions.create(
model="盘古模型ID", # 替换为步骤2记录的 model 参数
messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)
步骤 4:在第三方平台里用(以 openJiuwen 为例)
模型管理 → 添加模型 → 填写模型名称、模型 ID、API 密钥、基础服务地址 → 点击「测试」,显示成功即可创建智能体。
常见问题
没有昇腾卡,能在 NVIDIA GPU 上跑吗? 官方原生支持昇腾;其他硬件的支持情况请查所选仓库 README 的说明(未验证)。着急用的话优先走华为云 API。
92B 参数要多大显存? 官方为 MoE 架构(推理仅激活 6B),但完整权重仍需大容量存储与多卡/高显存环境;具体配置以官方部署说明为准,Flash 版定位就是"单卡可跑"的轻量旗舰(以官方为准)。
许可证允许商用吗? openPangu-2.0-Flash 采用 OPENPANGU MODEL LICENSE 2.0(非 Apache/MIT),商用前务必阅读仓库根目录 LICENSE 全文。
HuggingFace 下载太慢/连不上? 用 GitCode 的 ascend-tribe 组织镜像,或 hf-mirror.com 镜像站。pip 安装依赖统一加清华源。
/no_think后缀是什么意思? openPangu 系列支持快慢思考切换:在输入末尾加/no_think走快速回答,默认慢思考(深度推理),与混元类似的设计。