← 返回教程目录
通义千问
一句话简介:阿里巴巴推出的大模型系列,混合开源策略。
主流功能:中文理解(公认最强中文)、代码、Agent 工作负载
可用性:国内可直接使用,无需特殊网络。
适用人群:本地部署用户、企业开发者、需要可商用 Apache 2.0 权重做二次开发的团队
前置条件:
- 网络:普通国内网络
- 账号:使用百炼 API 需要阿里云账号(实名认证)
- 费用:Ollama/ModelScope 本地部署免费
- 硬件:Ollama 量化版 8B 约需 8GB 内存/显存
教程 A:Ollama 本地部署(走魔搭社区,国内最快)
ModelScope 官方页面直接提供"复制 Ollama 命令"按钮,新版 Ollama 支持 ollama pull/run modelscope.cn/... 直接拉取。
步骤 1:安装 Ollama(同 DeepSeek 文档步骤 1)
# Linux
curl -fsSL https://ollama.com/install.sh | sh
# macOS
brew install ollama
# Windows:官网下载 exe 安装包
确认服务:浏览器打开 http://localhost:11434 显示 "Ollama is running"。
步骤 2:从魔搭社区一键拉取 Qwen GGUF 模型
# Qwen3-8B 量化版(入门推荐,约 4.8GB)
ollama pull modelscope.cn/Qwen/Qwen3-8B-GGUF
# 按内存量力选择其它尺寸(命名规律同上)
ollama pull modelscope.cn/Qwen/Qwen3-32B-GGUF
# 嵌入模型(做本地知识库检索用)
ollama run modelscope.cn/Qwen/Qwen3-Embedding-0.6B-GGUF:Q8_0
也可先去 modelscope.cn 搜 "Qwen3 GGUF",在模型页右侧"模型谱系 → 量化"里选 GGUF 版本,点击复制 Ollama 命令。
步骤 3:运行并对话
ollama run modelscope.cn/Qwen/Qwen3-8B-GGUF
ollama list # 查看已下载模型
本地 API 调用(OpenAI 兼容,http://localhost:11434/v1),见 DeepSeek 文档"教程 A 步骤 4",把 model 换成 modelscope.cn/Qwen/Qwen3-8B-GGUF。
步骤 4(可选):vLLM 部署(服务器/GPU 用户)
pip install vllm transformers accelerate
# 加速 pip:pip install vllm -i https://mirrors.aliyun.com/pypi/simple/
# 设环境变量让 vLLM 从魔搭下载(部分服务器 HuggingFace 不可用)
VLLM_USE_MODELSCOPE=True vllm serve Qwen/Qwen3-32B \
--served-model-name Qwen3-32B \
--enable-auto-tool-choice --tool-call-parser hermes
服务默认监听 http://localhost:8000/v1,OpenAI SDK 把 base_url 指向它即可。
步骤 5(可选):给本地模型配个图形界面
- Cherry Studio(桌面客户端,cherry-ai.com):设置 → 模型平台选 Ollama → API 地址填
http://localhost:11434,API Key 留空。 - Open WebUI(Docker 一条命令,带知识库/角色扮演):
docker run -d -p 3000:3000 --add-host=host.docker.internal:host-gateway \
-v openwebui:/app/backend/data --name open-webui --restart always \
ghcr.io/open-webui/openwebui:main
浏览器打开 http://localhost:3000 即用。
教程 B:阿里云百炼 API 接入
步骤 1:开通百炼并创建 API Key
- 登录阿里云控制台,搜索"百炼"进入产品页,点击「立即开通」。
- 完成实名认证(个人/企业),进入百炼控制台。
- 左侧菜单「API Key 管理」→ 创建 API Key,复制保存(建议用环境变量存放,不要硬编码进代码)。
- 新用户可领取免费 token 额度(以控制台活动页为准)。
步骤 2:OpenAI 兼容方式调用(推荐,代码零迁移)
export DASHSCOPE_API_KEY="sk-你的百炼APIKey"
export BAILIAN_COMPAT_URL="https://dashscope.aliyuncs.com/compatible-mode/v1"
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DASHSCOPE_API_KEY"],
base_url=os.environ["BAILIAN_COMPAT_URL"], # https://dashscope.aliyuncs.com/compatible-mode/v1
)
resp = client.chat.completions.create(
model="qwen3.8-max", # 旗舰模型;按量版也可用 qwen3.8-plus
messages=[
{"role": "system", "content": "你是专业技术助手,回答简洁严谨。"},
{"role": "user", "content": "用 Python 写一个读取 txt 文件的示例"},
],
temperature=0.6,
)
print(resp.choices[0].message.content)
curl 快速测试:
curl https://dashscope.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"qwen3.8-max","messages":[{"role":"user","content":"介绍通义千问的优势"}]}'
步骤 3(可选):Token Plan 订阅模式
百炼提供 Token Plan(个人版订阅),开通后在"订阅管理"页面生成专属 API Key(以 sk-tp- 开头),Base URL 为:
https://token-plan.cn-beijing.maas.aliyuncs.com/compatible-mode/v1
调用时把 model 设为 qwen3.8-max,其余代码与步骤 2 相同;用量在控制台 Token Plan 用量页查看 Credits 消耗。
步骤 4(可选):百炼 CLI 终端直调
npm install -g bailian-cli
bl --version
bl auth login --console # 交互式登录(按提示输入 API Key)
bl chat "简单介绍百炼CLI可以完成哪些工作"
bl text chat --model qwen3.8-max --content "写一段 FastAPI 接口规范"
常见问题
ollama pull modelscope.cn/...报错? 确认 Ollama 版本较新(ollama --version,旧版不支持该语法)。仍失败就改用官网库名ollama run qwen3:8b,或去魔搭下 GGUF 后用ollama create -f ModelFile注册。- 百炼调用报 401? 检查
DASHSCOPE_API_KEY是否复制完整、前后无多余空格;Token Plan 的 Key(sk-tp-开头)必须配 Token Plan 的 Base URL,两个体系的 Key 不能混用。 - 提示"模型不存在"? 模型名大小写敏感:
qwen3.8-max、qwen3.8-plus;qwen-plus等是旧系列名,不同计费体系。 - pip 安装 dashscope/vllm 太慢? 加国内源:
pip install dashscope -i https://mirrors.aliyun.com/pypi/simple/(或清华源)。 - Qwen3.8-27B 开源版和百炼 API 版什么关系? 开源版是 Apache 2.0 权重,可自己部署商用;API 版是阿里云托管的最强版本(Max),二者都可按需选择。