字节笔记本
2026年8月29日
DeepClaude:先 DeepSeek 思考再交给 Claude
DeepClaude 把推理和成稿拆成两步:先让 DeepSeek R1 想清楚,再把思考结果交给 Claude(或 Gemini)写出来。仓库在 ErlichLiu/DeepClaude,对外暴露 OpenAI 兼容接口,本地 Docker 拉起来就能接 Cherry Studio、Chatbox、LobeChat 这类客户端。灵感来自 Aider 那组「R1 当架构师、Sonnet 当编辑」的基准结果,作者用 FastAPI 重写后加了图形化配置和多种模型组合。
下面按官方 README,写怎么本机或服务器跑起来,以及常见组合怎么配。
它在解决什么问题
单独用 DeepSeek R1,推理强,但日常写代码、改文案的成稿感往往不如 Claude。单独用 Claude,成稿漂亮,复杂题有时又少一层长思考。DeepClaude 中间做一层编排:推理模型产出 reasoning_content(或带思考标签的文本),再把这段思考喂给目标模型生成最终回复。客户端只看到一个 OpenAI 兼容的 /v1 服务。
官方推荐的三条线大致是:
- 编程:
deepclaude= DeepSeek R1 + Claude(README 里写 Sonnet 系列) - 内容创作:
deepgeminipro= DeepSeek R1 + Gemini Pro 类 - 日常试玩:
deepgeminiflash= DeepSeek R1 + Gemini Flash 类(成本更低,Gemini 侧还有免费额度)
组合名会随版本微调,以你容器里 /config 页面实际列出的模型为准。
准备 API Key
至少准备两把钥匙:
- 推理侧:DeepSeek R1(官方、硅基流动、派欧云等均可)。注意有的供应商在
reasoning_content字段返回思考,有的把思考包在content里的标签里——配置页有「是否支持原生推理」开关,对不上就会出现思考长度为 0。 - 成稿侧:Claude(Anthropic 官方,或 OpenRouter / OneAPI 一类中转)和/或 Gemini(Google AI Studio)。
本机试跑可以先只配 R1 + 一个目标模型;云端对外暴露前,务必改掉默认 API Key。
Docker 一键跑
官方镜像:
docker pull erlichliu/deepclaude:latest
docker run -d --restart unless-stopped -p 8000:8000 erlichliu/deepclaude:latest浏览器打开 http://localhost:8000/config。默认登录用的 API Key 是 123456——只在本机无所谓,挂公网请立刻在系统设置里改掉。
配置大致分三块:
- 推理模型:填 DeepSeek R1 的 base URL、模型名、API Key;按供应商选择是否开启「原生推理」。
- 目标模型:分别给 Claude、Gemini Flash、Gemini Pro 填 Key 和模型 ID。
- 系统设置:对外服务用的 API Key、代理开关、导入/导出配置等。1.0 之后已经不用手写
.env,网页里改完即可。
想自己构建:
git clone https://github.com/ErlichLiu/DeepClaude.git
cd DeepClaude
docker build -t deepclaude:dev .
docker run -p 8000:8000 deepclaude:dev镜像支持多平台拉取,docker pull erlichliu/deepclaude 会按本机架构选合适版本。配置可以导出成文件,换机器或升级后再导入,避免每次重填。
接到聊天客户端
服务起来后,按客户端选地址格式:
| 客户端 | API 地址 | 说明 |
|---|---|---|
| Cherry Studio / Chatbox(OpenAI API 模式) | http://127.0.0.1:8000 | 手动加 deepclaude、deepgeminiflash、deepgeminipro |
| LobeChat | http://127.0.0.1:8000/v1 | 支持拉模型列表 |
API Key 填你在配置页里设的那个(默认是 123456)。远端部署就把地址换成 https://你的域名,并确保只走 HTTPS、Key 已轮换。
非流式输出是缺省行为之一,方便接 Dify 这类工作流;也支持流式。OpenAI 兼容的 models 接口会返回组合模型名。思考内容会按 R1 常见规范带回,Cherry Studio 等能较好展示推理过程。
组合怎么选、成本怎么控
写代码、改仓库,优先 deepclaude:R1 拆题,Claude 落代码和 diff。写长文、大纲、多轮润色,可以试 deepgeminipro 或 Flash,Gemini 免费额度够日常实验。
成本上几处值得留意:
- 系统配置里可调 DeepSeek R1 的
max_tokens,推理段不必拉太长。 - Gemini 2.5 Flash 可关思考;Pro 侧 README 提到用提示词优化,平均能再压一截 tokens。
- 中间衔接 Prompt 已调过一轮,尽量别在客户端再叠一层「请先思考再回答」,避免重复推理。
报错现在会按多段落返回,上下文超限时前端更好读。某个供应商要走代理、某个不需要,可以按模型分别开。
部署时注意几点
容器重启会丢内存里的配置——用 volume 挂配置目录,或定期导出配置文件。docker-compose 示例在仓库里,建议 --restart unless-stopped。Fork 了仓库想跟主线同步,打开 GitHub Actions 权限即可用自动同步。
技术栈是 FastAPI + uv + Docker。协议与完整更新日志见仓库 README;组合效果和供应商字段会随上游 API 变动,以配置页和最新 Release 为准。
自己不想运维、只想用组合模型,作者站点也提供按量 API;自建的好处是 Key 留在自己机器上,也能接到 OneAPI 做统一分发。