
字节笔记本
2026年8月28日
Qwen3-Coder-Next 开源权重能干什么
Qwen 团队放出了 Qwen3-Coder-Next 开源权重:总参数约 80B,每次推理只激活约 3B,定位就是给编码代理和本地开发用。下面按「能干什么、怎么跑、怎么接到代理」写一遍,方便你直接上手。
这模型适合什么场景
它不是又一个「补全几行代码」的小模型,而是按 agent 路径训出来的:
- 长程工具调用:会多步改仓库、跑命令、失败后再试,而不是只吐一段静态代码
- 仓库级上下文:原生上下文 256K(官方说明可用 Yarn 拉到约 1M),适合整仓阅读
- 接现成脚手架:官方写明适配 Qwen Code、Claude Code、Cline、Qoder、Kilo、Trae,以及 OpenClaw、浏览器操作一类流程
- 本地/自托管成本:80B 总量但 3B 激活,推理开销更接近小模型,适合自己起 API 给代理用
训练侧官方提到大约 80 万可验证任务,并配可执行环境做 agent 训练;基准上强调在 SWE-Bench Pro 一类 agent 评测里能打到明显更大激活参数量级模型的表现。具体数字以他们博客和 tech report 为准。
许可证是 Apache-2.0,权重在 Hugging Face / ModelScope 都能下。
规格速览
| 项 | 值 |
|---|---|
| 总参数 / 激活 | 约 80B / 约 3B |
| 架构 | Qwen3-Next 混合注意力 + MoE(512 experts,每次约 10 个 + 1 shared) |
| 层数 | 48 |
| 上下文 | 262,144 tokens |
| 模式 | 仅 non-thinking,输出里不会带 <think> 块 |
| 语言覆盖 | 官方称覆盖大量编程语言(README 列了三百多种) |
基座是 Qwen3-Next-80B-A3B-Base,再在可执行任务合成、环境交互和强化学习上做 agent 后训练。
用 Transformers 快速试一把
环境建议用较新的 transformers。显存不够就把上下文砍短(比如 32K):
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen3-Coder-Next"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
)
prompt = "Write a quick sort algorithm."
messages = [{"role": "user", "content": prompt}]
text = tokenizer.apply_chat_template(
messages, tokenize=False, add_generation_prompt=True
)
model_inputs = tokenizer([text], return_tensors="pt").to(model.device)
generated_ids = model.generate(**model_inputs, max_new_tokens=65536)
output_ids = generated_ids[0][len(model_inputs.input_ids[0]) :].tolist()
print(tokenizer.decode(output_ids, skip_special_tokens=True))本地桌面栈方面,官方提到 Ollama、LM Studio、MLX-LM、llama.cpp、KTransformers 等也已跟进 Qwen3 系列;具体量化档位以各端仓库为准。
起 OpenAI 兼容 API(给代理用)
编码代理通常认的是「兼容 OpenAI 的 base_url」。官方推荐 SGLang 或 vLLM,并要用他们的 qwen3_coder tool parser。
SGLang
需要 sglang>=0.5.8:
pip install 'sglang[all]>=v0.5.8'
python -m sglang.launch_server \
--model Qwen/Qwen3-Coder-Next \
--port 30000 \
--tp-size 2 \
--tool-call-parser qwen3_codervLLM
需要 vllm>=0.15.0:
pip install 'vllm>=0.15.0'
vllm serve Qwen/Qwen3-Coder-Next \
--port 8000 \
--tensor-parallel-size 2 \
--enable-auto-tool-choice \
--tool-call-parser qwen3_coder默认上下文按 256K 配,起不来就先把上下文降到 32768 一类再试。多卡 tp-size / tensor-parallel-size 按你机器改。
采样参数官方建议:temperature=1.0,top_p=0.95,top_k=40。
接到 Claude Code / Cline 一类工具
思路很简单:
- 用上面方式起本地(或内网)OpenAI 兼容端点
- 在代理工具里把模型指向该端点,模型名填服务端暴露的名字(例如
Qwen3-Coder-Next) - 务必打开对应的 tool-call parser;Qwen3-Coder 的函数调用格式和新的 special tokens 绑在一起,旧 parser 容易工具调用全挂
如果你已经在用 Claude Code、Qwen Code 或 Cline,通常只要把「自定义 API / 兼容端点」指过来即可。OpenClaw、浏览器自动化一类工作流同理:模型侧要稳定工具调用,服务侧就要带上 qwen3_coder parser。
最小工具调用示例(对本地 vLLM):
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
tools = [{
"type": "function",
"function": {
"name": "square_the_number",
"description": "output the square of the number.",
"parameters": {
"type": "object",
"required": ["input_num"],
"properties": {
"input_num": {
"type": "number",
"description": "number to square",
}
},
},
},
}]
completion = client.chat.completions.create(
model="Qwen3-Coder-Next",
messages=[{"role": "user", "content": "square the number 1024"}],
tools=tools,
max_tokens=65536,
)
print(completion.choices[0])下载与文档
- Hugging Face 集合:https://huggingface.co/collections/Qwen/qwen3-coder-next
- 主权重:https://huggingface.co/Qwen/Qwen3-Coder-Next
- ModelScope:https://modelscope.cn/collections/Qwen/Qwen3-Coder-Next
- 博客:https://qwen.ai/blog?id=qwen3-coder-next
- GitHub / tech report:https://github.com/QwenLM/Qwen3-Coder
小结
Qwen3-Coder-Next 的卖点很清楚:用较小的激活参数换接近更大模型的 agent 编码能力,再配上 256K 上下文和现成脚手架兼容。如果你已经在跑 Claude Code / Cline / 自建代理,最实用的路径是 vLLM 或 SGLang 起服务 + qwen3_coder parser + 自定义 API,而不是只在聊天框里试补全。