← 返回教程目录

通义千问

一句话简介:阿里巴巴推出的大模型系列,混合开源策略。

主流功能:中文理解(公认最强中文)、代码、Agent 工作负载

可用性:国内可直接使用,无需特殊网络。

适用人群:本地部署用户、企业开发者、需要可商用 Apache 2.0 权重做二次开发的团队

前置条件:

  • 网络:普通国内网络
  • 账号:使用百炼 API 需要阿里云账号(实名认证)
  • 费用:Ollama/ModelScope 本地部署免费
  • 硬件:Ollama 量化版 8B 约需 8GB 内存/显存

教程 A:Ollama 本地部署(走魔搭社区,国内最快)

ModelScope 官方页面直接提供"复制 Ollama 命令"按钮,新版 Ollama 支持 ollama pull/run modelscope.cn/... 直接拉取。

步骤 1:安装 Ollama(同 DeepSeek 文档步骤 1)

# Linux
curl -fsSL https://ollama.com/install.sh | sh
# macOS
brew install ollama
# Windows:官网下载 exe 安装包

确认服务:浏览器打开 http://localhost:11434 显示 "Ollama is running"。

步骤 2:从魔搭社区一键拉取 Qwen GGUF 模型

# Qwen3-8B 量化版(入门推荐,约 4.8GB)
ollama pull modelscope.cn/Qwen/Qwen3-8B-GGUF

# 按内存量力选择其它尺寸(命名规律同上)
ollama pull modelscope.cn/Qwen/Qwen3-32B-GGUF

# 嵌入模型(做本地知识库检索用)
ollama run modelscope.cn/Qwen/Qwen3-Embedding-0.6B-GGUF:Q8_0

也可先去 modelscope.cn 搜 "Qwen3 GGUF",在模型页右侧"模型谱系 → 量化"里选 GGUF 版本,点击复制 Ollama 命令。

步骤 3:运行并对话

ollama run modelscope.cn/Qwen/Qwen3-8B-GGUF
ollama list   # 查看已下载模型

本地 API 调用(OpenAI 兼容,http://localhost:11434/v1),见 DeepSeek 文档"教程 A 步骤 4",把 model 换成 modelscope.cn/Qwen/Qwen3-8B-GGUF。

步骤 4(可选):vLLM 部署(服务器/GPU 用户)

pip install vllm transformers accelerate
# 加速 pip:pip install vllm -i https://mirrors.aliyun.com/pypi/simple/

# 设环境变量让 vLLM 从魔搭下载(部分服务器 HuggingFace 不可用)
VLLM_USE_MODELSCOPE=True vllm serve Qwen/Qwen3-32B \
  --served-model-name Qwen3-32B \
  --enable-auto-tool-choice --tool-call-parser hermes

服务默认监听 http://localhost:8000/v1,OpenAI SDK 把 base_url 指向它即可。

步骤 5(可选):给本地模型配个图形界面

  • Cherry Studio(桌面客户端,cherry-ai.com):设置 → 模型平台选 Ollama → API 地址填 http://localhost:11434,API Key 留空。
  • Open WebUI(Docker 一条命令,带知识库/角色扮演):
docker run -d -p 3000:3000 --add-host=host.docker.internal:host-gateway \
  -v openwebui:/app/backend/data --name open-webui --restart always \
  ghcr.io/open-webui/openwebui:main

浏览器打开 http://localhost:3000 即用。

教程 B:阿里云百炼 API 接入

步骤 1:开通百炼并创建 API Key

  1. 登录阿里云控制台,搜索"百炼"进入产品页,点击「立即开通」。
  2. 完成实名认证(个人/企业),进入百炼控制台。
  3. 左侧菜单「API Key 管理」→ 创建 API Key,复制保存(建议用环境变量存放,不要硬编码进代码)。
  4. 新用户可领取免费 token 额度(以控制台活动页为准)。

步骤 2:OpenAI 兼容方式调用(推荐,代码零迁移)

export DASHSCOPE_API_KEY="sk-你的百炼APIKey"
export BAILIAN_COMPAT_URL="https://dashscope.aliyuncs.com/compatible-mode/v1"
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DASHSCOPE_API_KEY"],
    base_url=os.environ["BAILIAN_COMPAT_URL"],  # https://dashscope.aliyuncs.com/compatible-mode/v1
)
resp = client.chat.completions.create(
    model="qwen3.8-max",   # 旗舰模型;按量版也可用 qwen3.8-plus
    messages=[
        {"role": "system", "content": "你是专业技术助手,回答简洁严谨。"},
        {"role": "user", "content": "用 Python 写一个读取 txt 文件的示例"},
    ],
    temperature=0.6,
)
print(resp.choices[0].message.content)

curl 快速测试:

curl https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
  -H "Authorization: Bearer $DASHSCOPE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"qwen3.8-max","messages":[{"role":"user","content":"介绍通义千问的优势"}]}'

步骤 3(可选):Token Plan 订阅模式

百炼提供 Token Plan(个人版订阅),开通后在"订阅管理"页面生成专属 API Key(以 sk-tp- 开头),Base URL 为:

https://token-plan.cn-beijing.maas.aliyuncs.com/compatible-mode/v1

调用时把 model 设为 qwen3.8-max,其余代码与步骤 2 相同;用量在控制台 Token Plan 用量页查看 Credits 消耗。

步骤 4(可选):百炼 CLI 终端直调

npm install -g bailian-cli
bl --version
bl auth login --console          # 交互式登录(按提示输入 API Key)
bl chat "简单介绍百炼CLI可以完成哪些工作"
bl text chat --model qwen3.8-max --content "写一段 FastAPI 接口规范"

常见问题

  1. ollama pull modelscope.cn/... 报错? 确认 Ollama 版本较新(ollama --version,旧版不支持该语法)。仍失败就改用官网库名 ollama run qwen3:8b,或去魔搭下 GGUF 后用 ollama create -f ModelFile 注册。
  2. 百炼调用报 401? 检查 DASHSCOPE_API_KEY 是否复制完整、前后无多余空格;Token Plan 的 Key(sk-tp- 开头)必须配 Token Plan 的 Base URL,两个体系的 Key 不能混用。
  3. 提示"模型不存在"? 模型名大小写敏感:qwen3.8-max、qwen3.8-plus;qwen-plus 等是旧系列名,不同计费体系。
  4. pip 安装 dashscope/vllm 太慢? 加国内源:pip install dashscope -i https://mirrors.aliyun.com/pypi/simple/(或清华源)。
  5. Qwen3.8-27B 开源版和百炼 API 版什么关系? 开源版是 Apache 2.0 权重,可自己部署商用;API 版是阿里云托管的最强版本(Max),二者都可按需选择。