← 返回教程目录

Kimi

一句话简介:月之暗面推出的 AI 助手,以长文本处理见长。

主流功能:长程代码、知识工作、Agent 群体、海外开发者 API

可用性:国内可直接使用,无需特殊网络。

适用人群:长文档/论文/报告分析用户、开发者、有服务器资源想本地跑开源权重的团队

前置条件:

  • 网络:普通国内网络
  • 账号:使用 API 需在 Kimi 开放平台(platform.moonshot.cn)注册,创建 API Key,按量充值
  • 费用:网页/App 基础使用免费
  • 硬件(本地):Kimi K3 完整版 2.8T 参数不可在家用电脑运行(MXFP4 权重约 1.56 TB,需数据中心级 GPU)

教程 A:Kimi 网页/App 使用(长文本是强项)

步骤 1:注册登录

  1. 浏览器访问 kimi.moonshot.cn,或手机应用商店下载"Kimi" App。
  2. 手机号/微信登录即可开始对话。

步骤 2:长文档分析(Kimi 核心用法)

  1. 点击输入框旁的附件/上传按钮,上传 PDF、Word、TXT(支持几十万字长文档)。
  2. 输入指令,例如:"你是行业分析师。吃透这篇报告,然后:1. 提炼 3 个最核心的观点;2. 找出 2 个最大的风险点;3. 总结 100 字摘要给老板看;4. 全部用清单体呈现。"
  3. Kimi 会基于文档全文作答,并标注引用位置,可追问"第 5 页那个数据再展开讲讲"。

步骤 3:其它常用场景

  • 读视频/扒稿:粘贴视频链接或逐字稿,"提炼黄金 3 分钟讲了什么,总结 3 个金句"。
  • 对比分析:粘贴两篇文章,"找出共同论点、3 处矛盾、哪篇论证更严谨,用表格呈现"。
  • 数据分析:粘贴数据,"找出最反常的趋势、分析可能原因、给 3 个行动建议"。

教程 B:开源权重本地部署

方案一(家用电脑):K2 GGUF 量化版 + llama.cpp/Ollama

GitCode 托管了 HF 镜像,国内下载快:

# 国内镜像下载 Kimi-K2-Instruct-GGUF(按需选量化版本,UD-Q2_K_XL 约 381GB)
git clone https://gitcode.com/hf_mirrors/unsloth/Kimi-K2-Instruct-GGUF

# 编译 llama.cpp(有 NVIDIA GPU 加 -DGGML_CUDA=ON)
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON -DLLAMA_CURL=ON
cmake --build llama.cpp/build --config Release -j

运行(MoE 卸载是关键,把专家层卸到 CPU/内存以省显存):

./llama.cpp/build/bin/llama-cli \
  --model unsloth/Kimi-K2-Instruct-GGUF/UD-Q2_K_XL/Kimi-K2-Thinking-UD-Q2_K_XL-00001-of-00008.gguf \
  --n-gpu-layers 99 --temp 0.6 --ctx-size 16384 \
  -ot ".ffn_.*_exps.=CPU"

也可用 llama-server 把本地模型封装成 OpenAI 兼容服务(端口 8080),再用 Cherry Studio 等客户端连接。

方案二(服务器):K3 完整权重 + vLLM/SGLang

官方 README 建议用 vLLM、SGLang 或 TokenSpeed 部署。HuggingFace 官方仓库为 MoonshotAI/Kimi-K3(MXFP4 格式,约 1.56TB)。国内下载建议:

# 方式一:huggingface_hub 走镜像站
export HF_ENDPOINT=https://hf-mirror.com
pip install -U huggingface_hub
huggingface-cli download MoonshotAI/Kimi-K3 --local-dir ./Kimi-K3

再按官方 README 的 vLLM/SGLang 部署命令启动服务(需多卡 GPU 服务器,个人电脑跳过本方案)。

方案三(最省事):Ollama 直接拉取

ollama run kimi-k2:1t-cloud   # 云端满血版(需网络,Ollama 账号)
# 或从魔搭/ModelScope 找 Kimi GGUF:ollama pull modelscope.cn/<组织>/<Kimi-GGUF模型>

教程 C:Kimi 开放平台 API 接入

步骤 1:创建 API Key

  1. 访问 platform.moonshot.cn 注册登录。
  2. 进入「API Keys」页面(console/api-keys),点击创建,Key 只展示一次,立即复制保存,建议存入环境变量。

步骤 2:OpenAI 兼容调用

export MOONSHOT_API_KEY="sk-你的Kimi密钥"
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MOONSHOT_API_KEY"],
    base_url="https://api.moonshot.cn/v1",   # Kimi 官方文档地址
)
resp = client.chat.completions.create(
    model="kimi-k3",   # 当前旗舰;其它模型名见开放平台模型列表
    messages=[
        {"role": "system", "content": "你是 Kimi,由月之暗面打造的 AI 助手。"},
        {"role": "user", "content": "用一句话介绍 Kimi K3。"},
    ],
)
print(resp.choices[0].message.content)

步骤 3:文件接口(长文本场景)

# 先上传文件,再引用 file_id 提问
file_resp = client.files.create(file=open("report.pdf", "rb"), purpose="file-extract")
resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": f"解析文件 {file_resp.id},提取财务数据并生成对比表格"}],
)

常见问题

  1. K3 权重 1.56TB,普通电脑能跑吗? 不能。家用电脑请用 K2 的 GGUF 量化版(245GB 起)或直接调 API;完整 K3 需要服务器级多卡 GPU。
  2. 开源权重能商用吗? Kimi K 系列用自有许可(含 revenue 分享条款),不是 MIT/Apache 2.0——商用前务必读 HuggingFace 模型页的 LICENSE。
  3. API 报 401? 检查 Key 是否复制完整、环境变量是否生效;base_url 必须是 https://api.moonshot.cn/v1。
  4. 下载权重太慢? 走 GitCode HF 镜像(gitcode.com/hf_mirrors)或设置 HF_ENDPOINT=https://hf-mirror.com;GitCode 需先注册登录。
  5. 网页版和 API 的模型是同一个吗? 网页版默认最新模型;API 的 model 参数按开放平台模型列表填写(如 kimi-k3),两者版本可能不同步,以文档为准。