← 返回教程目录

盘古

一句话简介:华为的大模型系列。

主流功能:政企行业模型、端侧小艺 Agent

可用性:国内可直接使用(开源权重、GitCode 国内镜像、华为云 API 均为国内服务;本地部署官方以昇腾/国产 NPU 为原生环境,昇腾适配最佳)。

适用人群:有昇腾/国产算力的团队:在 Atlas 服务器上本地部署 openPangu-2.0-Flash

前置条件:

  • 本地部署:昇腾 AI 服务器(如 Atlas 800T A2)或已装 CANN 工具链的 NPU 环境
  • 华为云 API:华为云账号并实名认证
  • 许可证:openPangu-2.0-Flash 采用 OPENPANGU MODEL LICENSE 2.0,商用前请阅读仓库 LICENSE 全文
  • 说明:openPangu 官方部署文档以昇腾 NPU 为原生环境

教程一:开源权重本地部署(openPangu-2.0-Flash)

步骤 1:准备昇腾环境

  1. 硬件:Atlas 800T A2(64GB)或同等昇腾 NPU 服务器(以官方部署说明为准)。
  2. 软件:Linux(推荐 openEuler ≥ 24.03)、Python 3.10、CANN 工具链(如 8.1.RC1)、PyTorch + torch_npu 适配器。
  3. 确认 NPU 可见:
npu-smi info   # 能列出昇腾设备即环境正常
python -c "import torch_npu; print(torch_npu.npu.is_available())"

步骤 2:下载权重(国内镜像优先)

# 方式一:GitCode 国内镜像(ascend-tribe 为昇腾生态官方组织)
git clone https://gitcode.com/ascend-tribe/openPangu-2.0-Flash

# 方式二:HuggingFace 官方仓库(国内直连慢,可用 hf-mirror.com 镜像站)
# https://huggingface.co/openpangu/openPangu-2.0-Flash
pip install "huggingface_hub[cli]" -i https://pypi.tuna.tsinghua.edu.cn/simple
huggingface-cli download openpangu/openPangu-2.0-Flash --local-dir ./openPangu-2.0-Flash

步骤 3:用官方 omni-infer 推理框架部署

  1. 获取推理代码仓(官方模型卡注明部署参考 openPangu-2.0-Infer / omni-infer 框架):
git clone <openPangu-2.0-Infer 仓库地址>   # 地址以官方模型卡为准
cd openPangu-2.0-Infer
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
  1. 按仓库 README 的部署说明启动服务(示例为社区验证过的同系列 7B 模型流程,2.0-Flash 以其仓库 README 为准):
cd inference
python generate.py        # 直接推理测试
# 或启动服务化部署(vllm-ascend / omni-infer 二选一,按 README 来)

步骤 4:调用验证

服务启动后,用 OpenAI 兼容格式调用(地址/端口以启动日志为准):

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model": "openPangu-2.0-Flash",
       "messages": [{"role": "user", "content": "你好"}]}'

轻量替代:openPangu-Embedded-7B(小设备)

如果只有单张小显存卡/边缘设备,可先用 7B 的 Embedded 版本练手,流程类似:

git clone https://gitcode.com/ascend-tribe/openPangu-Embedded-7B-V1.1
cd openPangu-Embedded-7B-V1.1/inference
pip install -r requirements.txt -i https://pypi.tuna.tsinghua.edu.cn/simple
python generate.py

教程二:华为云盘古 API 接入教程

步骤 1:开通模型服务

  1. 注册华为云账号并完成实名认证。
  2. 进入 ModelArts → 模型广场(在线推理模型列表),搜索「盘古」。
  3. 选择需要的盘古模型,点击「开通服务」。

步骤 2:获取调用信息

  1. 开通后点击「调用说明」→「标准接口」,记录 API 地址(如 https://api.xxx/v1,只取基础地址部分)与 model 参数(模型 ID)。
  2. 点击「API Key 管理」,按指引申请 API Key 并妥善保存。

步骤 3:Python 调用(OpenAI 兼容)

from openai import OpenAI

client = OpenAI(
    base_url="https://api.xxx/v1",   # 替换为步骤2记录的基础地址
    api_key="你的API Key",
)

resp = client.chat.completions.create(
    model="盘古模型ID",  # 替换为步骤2记录的 model 参数
    messages=[{"role": "user", "content": "你好"}],
)
print(resp.choices[0].message.content)

步骤 4:在第三方平台里用(以 openJiuwen 为例)

模型管理 → 添加模型 → 填写模型名称、模型 ID、API 密钥、基础服务地址 → 点击「测试」,显示成功即可创建智能体。


常见问题

  1. 没有昇腾卡,能在 NVIDIA GPU 上跑吗? 官方原生支持昇腾;其他硬件的支持情况请查所选仓库 README 的说明(未验证)。着急用的话优先走华为云 API。

  2. 92B 参数要多大显存? 官方为 MoE 架构(推理仅激活 6B),但完整权重仍需大容量存储与多卡/高显存环境;具体配置以官方部署说明为准,Flash 版定位就是"单卡可跑"的轻量旗舰(以官方为准)。

  3. 许可证允许商用吗? openPangu-2.0-Flash 采用 OPENPANGU MODEL LICENSE 2.0(非 Apache/MIT),商用前务必阅读仓库根目录 LICENSE 全文。

  4. HuggingFace 下载太慢/连不上? 用 GitCode 的 ascend-tribe 组织镜像,或 hf-mirror.com 镜像站。pip 安装依赖统一加清华源。

  5. /no_think 后缀是什么意思? openPangu 系列支持快慢思考切换:在输入末尾加 /no_think 走快速回答,默认慢思考(深度推理),与混元类似的设计。