ByteNoteByteNote

字节笔记本

2026年8月28日

NVIDIA 上免费用 kimi-k2.5

API中转
¥120

NVIDIA Build 用 Developer Program 的试用额度托管了一批开源模型,接口是标准 OpenAI Chat Completions。2026 年初上架的是 Moonshot 的 Kimi K2.5,同年 4 月底这条免费端点换成了 K2.6。想白嫖 Kimi 当编码代理,拿一把 nvapi- key、改一下 model 名就行。

现在该用哪个名字

K2.5 的 playground 已经 404。NVIDIA 当时给了迁移窗:页面 2026-04-30 下线,网关重定向维持到 5 月 20 日。之后再传 moonshotai/kimi-k2.5 会直接 403。

同一条 base URL 现在是 moonshotai/kimi-k2.6

OpenClaw 的 NVIDIA 目录里,K2.6 还在 bundled 表;K2.5 只留兼容条目,picker 里已经藏起来。老配置记得改名字。

免费是试用档,不用绑卡,受 NVIDIA API Trial 条款约束。额度、速率以账号页为准,别当生产 SLA。

模型本身

K2.5 / K2.6 都是 Moonshot 的 1T MoE(每次大约激活 32B),上下文 256K 量级,视觉侧是 MoonViT。文本、图、视频都能吃。K2.5 当时主打多模态和 thinking / instant 双模式;K2.6 更往长程编码和多智能体编排上走。对代理来说,关键是它走 OpenAI 兼容的 tool calling。

K2.5(托管已下线)K2.6(当前托管)
总参数 / 激活1T / 约 32B1T / 32B
架构384 experts,每 token 8 个 + 1 shared同族 MoE
上下文256K–262K256K
输入文本、图像、视频(视频当时标实验性)文本、图像、视频
Build 上架2026-01-262026-04-29

这些数字来自 NVIDIA 的模型卡,不是我测的。

申请一把 NVIDIA API key

  1. 用 NVIDIA 账号登录 build.nvidia.com
  2. 打开 API Keys 生成 key,前缀是 nvapi-
  3. 只放进环境变量,别写进仓库:
bash
export NVIDIA_API_KEY="nvapi-..."

先用 curl 打通

bash
curl https://integrate.api.nvidia.com/v1/chat/completions \
  -H "Authorization: Bearer $NVIDIA_API_KEY" \
  -H "Content-Type: application/json" \
  -H "Accept: application/json" \
  -d '{
    "model": "moonshotai/kimi-k2.6",
    "messages": [{"role": "user", "content": "用三句话说一下你能干什么。"}],
    "max_tokens": 1024,
    "temperature": 1,
    "top_p": 0.95,
    "stream": false
  }'

Python 用官方推荐的 OpenAI 兼容写法:

python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key=os.environ["NVIDIA_API_KEY"],
)

resp = client.chat.completions.create(
    model="moonshotai/kimi-k2.6",
    messages=[{"role": "user", "content": "写一个读 CSV 求均值的 Python 函数。"}],
    max_tokens=2048,
)
print(resp.choices[0].message.content)

K2.5 文档里 thinking 模式默认开,instant 要额外关。K2.6 的请求字段以当前模型卡为准;自己脚本里别把 K2.5 的 chat_template_kwargs 原样抄过去。

接到 OpenClaw

OpenClaw 认 NVIDIA 这套 key。官方步骤:

bash
export NVIDIA_API_KEY="nvapi-..."
openclaw onboard --auth-choice nvidia-api-key
openclaw models set nvidia/moonshotai/kimi-k2.6

配置里也可以写:

json5
{
  env: { vars: { NVIDIA_API_KEY: "nvapi-..." } },
  models: {
    providers: {
      nvidia: {
        baseUrl: "https://integrate.api.nvidia.com/v1",
        api: "openai-completions",
      },
    },
  },
  agents: {
    defaults: {
      model: { primary: "nvidia/moonshotai/kimi-k2.6" },
    },
  },
}

注意两层名字:OpenClaw 用 nvidia/moonshotai/kimi-k2.6(前面是 provider),真正发给 NVIDIA 的 model id 是 moonshotai/kimi-k2.6。配反了会 404。

默认模型其实是 Nemotron 3 Ultra。想用 Kimi 就显式 models set,别以为 onboard 完就是 Kimi。

接到任意 OpenAI 兼容客户端

Claude Code、Cline、自写脚本都是同一套:

  • base URL:https://integrate.api.nvidia.com/v1
  • API key:那把 nvapi-
  • model:moonshotai/kimi-k2.6

工具调用按 OpenAI tools 数组传即可。

几个容易踩的坑

  1. 还写 kimi-k2.5。 端点没了。改成 kimi-k2.6
  2. provider 前缀。 curl / OpenAI SDK 用 moonshotai/kimi-k2.6;OpenClaw 配置用 nvidia/moonshotai/kimi-k2.6
  3. 把试用当生产。 免费档有速率和额度,打满会 429 或 403。生产要自己用 vLLM 拉权重,或走 Moonshot / 其他付费口。
  4. 视频。 K2.5 模型卡把视频标成实验性;图和文本更稳。
  5. key 泄露。 nvapi- 跟普通云厂商 key 一样,进 git 就作废重签。

文档和仓库

日常试用就是申请 key、改 model 名、指到 integrate.api.nvidia.com。K2.5 的名字可以当考古,别再写进配置。

分享: