
字节笔记本
2026年10月5日 · 约 4 分钟读完
上传一张照片,给你的内容配一套专属 IP 图解
写公众号、做课程、整理笔记,配图永远是个麻烦。找图费时间,AI 生图又长得不像你,随手截图更谈不上美观。最理想的状态是:有一套固定风格、一眼就像你的图解角色,文章写完,配图跟着自动出来。
开源项目 ip-diagram-creator 做的就是这件事:上传你的照片,它帮你建立一套 IP 角色资产,之后所有文章、课程、PPT 的配图,都可以基于这套角色来生成。
先说清楚它不是什么
上手之前,先划清边界:
- 不是头像生成器。头像只是生成一张图,它要建的是一整套系统。
- 不是模板套用工具。换个背景填几个字,谈不上视觉资产。
- 不保证复刻真人长相,也不适合拿去做证件照。
它的定位是一个「IP 主角 + 执行 Agent」的知识图解系统:IP 形象负责主讲、拆解、批注和调度,执行 Agent 负责搬卡片、递交结果、标记风险、反馈和试错。核心原则一句话:先定角色,再拆内容,最后生成图解。
核心工作流:三步走

第一步:角色建档
上传你的照片、主页截图或个人简介,Agent 会提取你的视觉特征,生成三张固定资产:
| 角色 | 说明 |
|---|---|
| 角色主锚图 | 固定「像谁」,IP 形象的基础锚点 |
| 角色规范说明图 | 固定「不能跑偏」,明确哪些特征不能变 |
| 扩展场景图 | 固定「小比例还能认出来」,覆盖动作、表情与小比例场景 |
这三张图一旦确认,就是你的长期视觉资产,后续所有内容图解都基于这套角色展开。
第二步:内容拆解
把一篇文章、一份课程大纲或一句话观点交给 Agent,它会分析内容结构,推荐适合做几张图、分别用什么类型,整理成一份 shot list(出图清单),等你确认后再逐张生成。
第三步:生成图解
Agent 会根据内容自动选择最合适的图解模式:
| 模式 | 适合内容 | 信息密度 |
|---|---|---|
| 手绘插图 | 单个观点、故事场景、隐喻表达 | 低 |
| 内容配图 | 文章段落、课程章节 | 中 |
| 知识卡 | 方法、步骤、流程、对比、案例 | 高 |
| 手机海报 | 传播用单图 | 高 |
| PPT 演讲页 | 直播分享、课程课件、主题演讲 | 按页控制 |
PPT 演讲模式:把做 PPT 变成导演拍片
这是最有意思的功能之一。它不只生成单张配图,而是生成整套演讲页面。
流程是这样的:你提供主题、大纲、逐字稿或旧 PPT;Agent 先输出导演规划卡,标明每页的类型、视觉权重、图文比例和人物职责;再做一两页样张确认风格;确认后分批生成整套页面,最后用 contact sheet(缩略总表)做整套 QA 检查。

页面类型覆盖封面页、大判断页、模块页、标准页、场景页、时间线页、方法页和收束页。本质上,它把「做 PPT」这件事变成了「导演拍片」:先规划节奏,再按场景逐页生成。
安装与上手
npx skills add https://github.com/haloshin/ip-diagram-creator安装后,上传照片说一句「帮我出一组 IP 图」就能跑通最短路径。如果想更可控,可以先对齐方向再动手:
先不要出图。请根据我的照片、主页截图和简介,先帮我对齐角色方向、三张角色资产思路和后续出图方式,确认后再继续。
推荐在支持图片读取和图像生成的 Agent 环境中使用,比如 Claude Code、Cursor。如果当前环境没有生图能力,它也会输出完整的 prompt,复制到 GPT Image 2 等工具里同样能用。
它适合谁
对持续输出内容的创作者来说,这套思路的价值不在「画好一张图」,而在「长期稳定」:这一篇内容里的角色,下一篇还在,风格一致、形象一致,读者一眼就能认出「这是你的内容」。公众号图文、知识付费课程、直播分享、团队培训材料,凡是需要反复出图又要保持统一形象的场合,这套资产化的做法,都比每次重新找图、重新生成划算得多。



