← 返回教程目录

Cohere Command

一句话简介:加拿大 AI 公司 Cohere 的企业级大语言模型系列(Command R / R+ / A)。

主流功能:企业 RAG、Agent 工作流、主权/本地部署

可用性:可用性:国内可直接使用。

适用人群:想本地跑一个擅长 RAG / Agent 工具调用的英文/多语言模型的开发者;需要通过 API 调用 Command 系列的后端工程师

前置条件:

  • 网络:本地部署需能访问 HuggingFace 镜像站(hf-mirror.com)
  • 账号:API 方式需注册 Cohere 账号(邮箱即可)
  • 费用:API 按量付费(有免费试用额度,用完需绑卡)
  • 硬件(本地):Command R7B 7B 量化版:8GB 显存/16GB 内存可跑

分步骤教程

方式一:Ollama 本地部署(最简单,推荐新手)

步骤 1:安装 Ollama

  • Windows / macOS:去 Ollama 官网下载安装包(ollama.com),双击安装
  • Linux 服务器:
curl -fsSL https://ollama.com/install.sh | sh

步骤 2:拉取并运行 Command R7B(7B 开放权重版,社区已收录)

ollama run command-r7b

Ollama 社区库中已收录 command-r、command-r-plus、command-a、command-r7b,可直接 ollama run <模型名>。看到 >>> 提示符即成功,直接打字对话。

步骤 3(备选):用 Modelfile + GGUF 手动接入

如果官方库拉取失败(llama.cpp 已支持 Cohere2 架构,GGUF 社区版见 bartowski/c4ai-command-r7b-12-2024-GGUF),从 HuggingFace 镜像站下载 GGUF 文件后:

# 1. 下载 GGUF(把下面的 HF 地址换成镜像站域名 hf-mirror.com 访问下载)
# 2. 新建 Modelfile 文件,内容:
FROM./c4ai-command-r7b-12-2024-Q4_K_M.gguf
TEMPLATE """{{ if.System}}<|START_OF_TURN_TOKEN|><|SYSTEM_TOKEN|>{{.System}}<|END_OF_TURN_TOKEN|>{{ end}}{{ if.Prompt}}<|START_OF_TURN_TOKEN|><|USER_TOKEN|>{{.Prompt}}<|END_OF_TURN_TOKEN|>{{ end}}<|START_OF_TURN_TOKEN|><|CHATBOT_TOKEN|>"""

# 3. 创建并运行
ollama create command-r7b-local -f Modelfile
ollama run command-r7b-local

方式二:HuggingFace transformers 本地部署(适合二次开发)

步骤 1:配置国内镜像

# pip 换清华源
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple torch transformers accelerate
# HF 镜像站(终端执行前 export)
export HF_ENDPOINT=https://hf-mirror.com

步骤 2:加载模型(以 Command R7B 为例)

from transformers import AutoTokenizer, AutoModelForCausalLM

model_id = "CohereLabs/c4ai-command-r7b-12-2024" # 经镜像站自动解析
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto")

messages = [{"role": "user", "content": "用中文介绍一下你自己"}]
input_ids = tokenizer.apply_chat_template(messages, tokenize=True,
add_generation_prompt=True,
return_tensors="pt")
out = model.generate(input_ids, max_new_tokens=200, temperature=0.3, do_sample=True)
print(tokenizer.decode(out[0], skip_special_tokens=True))

方式三:Cohere 官方 API 接入(用最强的 Command A,无需本地算力)

步骤 1:注册并获取 API Key

  1. 打开 https://dashboard.cohere.com/api-keys
  2. 用邮箱注册登录 Cohere 账号
  3. 点击 Create API Key,复制保存 Key(只显示一次)

步骤 2:Python SDK 调用(v2 接口)

pip install -i https://pypi.tuna.tsinghua.edu.cn/simple cohere
import cohere

co = cohere.ClientV2(api_key="你的API_KEY") # 也可设环境变量 CO_API_KEY
resp = co.chat(
model="command-a-03-2025", # 当前旗舰;轻量可选 command-r7b-12-2024
messages=[{"role": "user", "content": "用三句话解释什么是 RAG"}],
)
print(resp.message.content[0].text)

步骤 3(备选):REST 直接调用

curl https://api.cohere.com/v2/chat \
-H "Authorization: Bearer 你的API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"command-a-03-2025","messages":[{"role":"user","content":"你好"}]}'

步骤 4(备选):经 AWS Bedrock 调用(适合已有 AWS 账号的企业)

AWS Bedrock 提供 cohere.command-r-v1:0 等模型 ID,按 AWS 文档用 boto3 的 invoke_model 调用,国内企业出海常用此通道。详见 AWS 中文文档(来源列表)。

常见问题

  1. Command 开放权重能商用吗? 不能直接商用。CC-BY-NC 许可禁止商业用途,商用请走 Cohere 官方 API 或 AWS Bedrock 等授权渠道。

  2. ollama run command-a 拉取失败怎么办? 111B 的 Command A 体积巨大(量化后仍需数十 GB 显存),个人机器不建议跑。改用方式三 API 调用,或只本地跑 7B 的 command-r7b。

  3. v1 和 v2 SDK 有什么区别? v2(ClientV2)采用 OpenAI 风格的 messages 参数并支持新版模型 ID(如 command-a-03-2025);旧 co.chat(message=...) 的 v1 写法对应老模型别名,新项目建议直接用 v2。

  4. 免费额度有多少? 注册后有 trial 免费额度可体验;生产级调用需要绑定信用卡按量付费,具体价格以官网 Pricing 页为准(第三方价格站仅供参考)。

  5. 中文效果如何? Command R+ / A 的评测语言包含简体中文,日常中文问答可用;但其中文能力弱于同期的国产主力模型,中文场景建议对比测试后再选型。