ByteNoteByteNote
Qwen3-Coder-Next 开源权重能干什么

字节笔记本

2026年8月28日

Qwen3-Coder-Next 开源权重能干什么

API中转
¥120

Qwen 团队放出了 Qwen3-Coder-Next 开源权重:总参数约 80B,每次推理只激活约 3B,定位就是给编码代理和本地开发用。下面按「能干什么、怎么跑、怎么接到代理」写一遍,方便你直接上手。

这模型适合什么场景

它不是又一个「补全几行代码」的小模型,而是按 agent 路径训出来的:

  • 长程工具调用:会多步改仓库、跑命令、失败后再试,而不是只吐一段静态代码
  • 仓库级上下文:原生上下文 256K(官方说明可用 Yarn 拉到约 1M),适合整仓阅读
  • 接现成脚手架:官方写明适配 Qwen Code、Claude Code、Cline、Qoder、Kilo、Trae,以及 OpenClaw、浏览器操作一类流程
  • 本地/自托管成本:80B 总量但 3B 激活,推理开销更接近小模型,适合自己起 API 给代理用

训练侧官方提到大约 80 万可验证任务,并配可执行环境做 agent 训练;基准上强调在 SWE-Bench Pro 一类 agent 评测里能打到明显更大激活参数量级模型的表现。具体数字以他们博客和 tech report 为准。

许可证是 Apache-2.0,权重在 Hugging Face / ModelScope 都能下。

规格速览

总参数 / 激活约 80B / 约 3B
架构Qwen3-Next 混合注意力 + MoE(512 experts,每次约 10 个 + 1 shared)
层数48
上下文262,144 tokens
模式仅 non-thinking,输出里不会带 <think>
语言覆盖官方称覆盖大量编程语言(README 列了三百多种)

基座是 Qwen3-Next-80B-A3B-Base,再在可执行任务合成、环境交互和强化学习上做 agent 后训练。

用 Transformers 快速试一把

环境建议用较新的 transformers。显存不够就把上下文砍短(比如 32K):

python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3-Coder-Next"

tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
)

prompt = "Write a quick sort algorithm."
messages = [{"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(
    messages, tokenize=False, add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)

generated_ids = model.generate(**model_inputs, max_new_tokens=65536)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]) :].tolist()
print(tokenizer.decode(output_ids, skip_special_tokens=True))

本地桌面栈方面,官方提到 Ollama、LM Studio、MLX-LM、llama.cpp、KTransformers 等也已跟进 Qwen3 系列;具体量化档位以各端仓库为准。

起 OpenAI 兼容 API(给代理用)

编码代理通常认的是「兼容 OpenAI 的 base_url」。官方推荐 SGLangvLLM,并要用他们的 qwen3_coder tool parser。

SGLang

需要 sglang>=0.5.8

shell
pip install 'sglang[all]>=v0.5.8'
python -m sglang.launch_server \
  --model Qwen/Qwen3-Coder-Next \
  --port 30000 \
  --tp-size 2 \
  --tool-call-parser qwen3_coder

vLLM

需要 vllm>=0.15.0

shell
pip install 'vllm>=0.15.0'
vllm serve Qwen/Qwen3-Coder-Next \
  --port 8000 \
  --tensor-parallel-size 2 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

默认上下文按 256K 配,起不来就先把上下文降到 32768 一类再试。多卡 tp-size / tensor-parallel-size 按你机器改。

采样参数官方建议:temperature=1.0top_p=0.95top_k=40

接到 Claude Code / Cline 一类工具

思路很简单:

  1. 用上面方式起本地(或内网)OpenAI 兼容端点
  2. 在代理工具里把模型指向该端点,模型名填服务端暴露的名字(例如 Qwen3-Coder-Next
  3. 务必打开对应的 tool-call parser;Qwen3-Coder 的函数调用格式和新的 special tokens 绑在一起,旧 parser 容易工具调用全挂

如果你已经在用 Claude Code、Qwen Code 或 Cline,通常只要把「自定义 API / 兼容端点」指过来即可。OpenClaw、浏览器自动化一类工作流同理:模型侧要稳定工具调用,服务侧就要带上 qwen3_coder parser。

最小工具调用示例(对本地 vLLM):

python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

tools = [{
    "type": "function",
    "function": {
        "name": "square_the_number",
        "description": "output the square of the number.",
        "parameters": {
            "type": "object",
            "required": ["input_num"],
            "properties": {
                "input_num": {
                    "type": "number",
                    "description": "number to square",
                }
            },
        },
    },
}]

completion = client.chat.completions.create(
    model="Qwen3-Coder-Next",
    messages=[{"role": "user", "content": "square the number 1024"}],
    tools=tools,
    max_tokens=65536,
)
print(completion.choices[0])

下载与文档

小结

Qwen3-Coder-Next 的卖点很清楚:用较小的激活参数换接近更大模型的 agent 编码能力,再配上 256K 上下文和现成脚手架兼容。如果你已经在跑 Claude Code / Cline / 自建代理,最实用的路径是 vLLM 或 SGLang 起服务 + qwen3_coder parser + 自定义 API,而不是只在聊天框里试补全。

分享: