ByteNoteByteNote

字节笔记本

2026年8月29日

Prompt Engineering Guide:开源提示工程怎么系统学

API中转
¥120

网上散落的提示词技巧很多,想系统学一遍往往不知道从哪开始。DAIR.AI 维护的 Prompt Engineering Guide 把入门、进阶技巧、应用、模型对照和论文索引收成一套开源文档,网页版在 promptingguide.ai,源码在 dair-ai/Prompt-Engineering-Guide(MIT 协议)。下面按「怎么读、怎么练、怎么在本机跑一份」把这份指南用起来。

这份指南覆盖什么

Elvis Saravia 和 DAIR.AI 从 2022 年底开始维护这份材料,后来做成了 Next.js + Nextra 的文档站。网页支持十几种语言,中文入口在 promptingguide.ai/zh

内容大致分几块:

  • Introduction:什么是提示工程、常见 LLM 参数、提示由哪些部分组成、写提示的通用建议。
  • Techniques:Zero-shot、Few-shot、Chain-of-Thought、Self-Consistency、RAG、ReAct、Tree of Thoughts、PAL、APE 等,每篇配论文出处和示例。
  • Applications:函数调用、生成数据、写代码、合成 RAG 数据集。
  • Prompt Hub:按分类、编码、抽取、问答、摘要等场景给可改的提示模板。
  • Models:ChatGPT、GPT-4、Gemini、Llama、Mistral、Mixtral、Phi-2 等各自的提示习惯。
  • Risks:对抗提示、事实性、偏见。
  • Papers / Tools / Notebooks / Datasets:论文索引、工具清单、可跑的 Jupyter、评测数据。

网页上的内容会比 GitHub README 更新。日常阅读直接打开站点即可,想校对翻译或离线改文档再克隆仓库。

建议的阅读顺序

别一上来就跳到 Tree of Thoughts。按这个顺序走一遍,后面高级技巧才接得上:

  1. IntroductionBasics of Prompting
  2. LLM Settings
  3. Prompt ElementsTips
  4. Techniques 里先读 Zero-shot、Few-shot、Chain-of-Thought
  5. 再看 RAG、ReAct、Prompt Chaining,这三块和现在的 Agent / 工具调用最相关
  6. 需要落地时去 Prompt Hub 和 Applications,查论文时走 Papers

指南里的示例默认在 OpenAI Playground 上用 gpt-3.5-turbo 测过,temperature=1、top_p=1。换到现在的 Claude、GPT-4o、本地模型时,输出会变,但格式和思路还能用。Chat 模型可以拆 system / user / assistant 三角色;指南里为了简单,多数例子只写 user 消息。

先把采样参数调明白

很多人把效果差全怪提示词,其实 temperature 和 top_p 没设对也会让结果飘。指南建议:

  • temperature:越低越偏向最高概率 token,适合事实问答;调高更发散,适合写文案或头脑风暴。
  • top_p(nucleus sampling):只从累计概率达到 top_p 的那一小撮 token 里采样。要稳就调低,要多样就调高。
  • 一般只改 temperature 或只改 top_p,别两个一起拧。
  • max length:卡住回复长度,也控制费用。
  • stop sequences:生成到某个字符串就停,适合限制列表项数。
  • frequency penalty / presence penalty:打压重复。同样建议只动其中一个。

调参时固定提示,只改一个旋钮,否则你分不清是提示改好了还是参数改好了。

从 zero-shot 到 few-shot

最简单的提示就是一句指令或一个问题:

text
把下面这段话压缩成三句,保留数字和结论:
……

这就是 zero-shot:不给示范,直接让模型干活。任务简单、模型够强时够用。分类、抽取这类格式敏感的任务,加上几条示范会稳很多,也就是 few-shot / in-context learning:

text
评论:这充电速度可以  // 正面
评论:包装破了还少配件  // 负面
评论:物流快,客服爱答不理  //

示范要覆盖你真正会遇到的类别,格式和你期望的输出一致。指南里也写了 QA 形式(Q: / A:),但不是必须;分类任务用 // 标签 这种更短的写法同样常见。

Chain-of-Thought:让模型先写推理再给答案

Wei 等人 2022 年的 Chain-of-Thought(CoT)把中间推理步骤写进示范里。指南用「这组奇数加起来是不是偶数」当例子:示范里先列出奇数、再求和、再判断奇偶,模型会跟着写出同样的步骤,正确率比直接给 True/False 高一截。

没有示范时,可以试 Kojima 等人的 zero-shot CoT:在问题后面加上请逐步思考的短句(英文原文常见是逐步思考那句固定提示)。指南里的买苹果题,不加这句会算错成 11;加上之后模型会逐步减赠、加新买、再减去吃掉的,得到 10。中文里写「请一步一步想」通常也有效,但不同模型对固定咒语的敏感度不一样,值得在你常用的模型上各测一次。

再往后还有:

  • Self-Consistency:同一题采样多条推理链,按答案投票。
  • Auto-CoT:先聚类问题,再自动生成示范链,少手写 few-shot。
  • ReAct:推理和行动交替,适合接搜索、计算器、代码解释器。
  • PAL:把推理写成 Python,交给解释器算,减少心算错误。
  • RAG:先检索再生成,补模型没见过的私有知识。

这些在 Techniques 目录里各有专页,读的时候把对应论文链打开对照,比只背模板有用。

用 Notebook 动手跑

文档站有 Notebooks 一页(https://www.promptingguide.ai/notebooks),对应仓库 notebooks 目录。比较适合上手的有 Getting Started with Prompt Engineering、Program-Aided Language Model、ChatGPT API Intro、ChatGPT API with LangChain、Adversarial Prompt Engineering。

另外还有一小时讲座,视频、讲义 PDF 和配套 notebook 都在仓库里。想快速建立地图,先看讲座,再按 Techniques 深挖。跑 notebook 需要自己的 API Key,仓库不会替你付调用费用。

本机跑一份文档站

文档站也能离线预览,按仓库 README 的开发说明即可。

如果只是自己学,不一定要本地跑。网页版已经带搜索,可以把当前页拷成 Markdown。

学完以后怎么用在自己的项目里

把指南当词典,不要当教条。先把任务写成明确指令并固定输出格式,锁死模型和采样参数,拿十几条真实样本试跑。 错的样本拿来当 few-shot,或改成 CoT、工具调用。需要外部知识就上 RAG,需要多步决策就看 ReAct 和 Prompt Chaining。对抗和偏见那两章至少翻一遍,尤其是要把模型接到用户输入上的时候。 Prompt Hub 里的模板可以抄结构,但要换成自己的字段名和约束。模型专页用来查该模型吃不吃 system 消息、代码块要不要指定语言。

小结

Prompt Engineering Guide 把提示工程收成一条能跟的路径:先搞懂提示结构和采样参数,再练 zero-shot、few-shot 和 CoT,然后按需进入 RAG、ReAct 和函数调用。日常打开 https://www.promptingguide.ai/ 或中文版 https://www.promptingguide.ai/zh ,源码在 https://github.com/dair-ai/Prompt-Engineering-Guide

分享: