从模板到代码:AI 生成 PPT 的两条路线,与国模的能力边界
上篇讲历史与现状(两条技术路线、商业全景、为什么 SOTA 是 Claude 和 Codex);下篇拆我们自建的代码生成 harness,以及同一套框架换基模跑出的能力差异。
这篇是我自己搭 PPT harness 一段时间、又把市面上国内外的工具挨个拆过之后的总结。结论先放这儿:目前国内外主流的商业 AI PPT,本质都是「AI 生成内容 + 模板 / 排版引擎」;真正让大模型从零把版式也一行行码出来的「纯 AI 生成」路线,目前做得最好的是 Claude 和 Codex(OpenAI 的代码生成)。 上篇把这个结论怎么来的拆开讲,下篇讲我自己做的 harness 和它在不同基模上跑出的差异。
- 上篇 · 历史与现状:一段很短的历史 → 两条技术路线 → 为什么 SOTA 是 Claude 和 Codex → 商业现状(国内外)
- 下篇 · 我们的 harness:架构(两轴 QA + 渲染自检闭环)→ 同一套框架换基模的能力边界 → 结论
一、一段很短的历史
幻灯片软件本身几乎二十年没变过:PowerPoint、Keynote、Google Slides,打开都是一个空白矩形等你填。所谓「AI 做 PPT」,是分几波长出来的。
第一波,模板智能(非 LLM)。 2010 年代中期,PowerPoint Designer 这类功能上线,本质是云端的版式推荐——你把内容堆上去,它用规则和轻量 ML 给你几个排版方案。这跟大模型没关系,但它确立了一个后来一直没变的分工:内容是内容,排版是排版,排版由一套专门的引擎来做。
第二波,大纲生成器(GPT-3.5 时代)。 大模型能写文案之后,SlidesAI 这类工具出现,套路是「主题 → 大纲 → 文案」,然后灌进固定模板。模型只负责出字。
第三波,叙事派与 PPT killer 的喧嚣(2022–2024)。 Tome 是这一波的代表,主打「讲故事而不是堆要点」,用户涨得很快,峰值两千万量级,融了八千多万美元。但它没解决商业化,2025 年初关停了演示产品、团队转去做 CRM。这件事我觉得是个信号:光把「生成」做得花哨、不解决「能不能当成品交付」,撑不住。 同期 Beautiful.ai 走了另外一条路——它的 Smart Slides 是一组会自适应的模板,设计上限交给人类设计师。
第四波,大厂收编 + 代码生成(2023 至今)。 微软把 Copilot 塞进 PowerPoint(2023 年用 GPT-4,现在是 GPT-5.x);Gamma 在 2025 年爆发到七千万用户;Google 把 Gemini 接进 Slides。与此同时出现了一条以前没有的路线:让大模型直接写渲染代码(PptxGenJS / HTML),版式是模型自己码出来的。 Claude 的 artifacts、ChatGPT 的 skills 都属于这条。这条路线是这篇文章真正关心的东西。
二、两条技术路线
把市面上所有「AI PPT」摊开,会发现它们只分两类:
A内容生成 + 模板 / 引擎填充
大模型只出大纲和文案,真正的配图、配色、版式由一套独立的排版引擎完成。这套引擎吃的是人类设计师预先做好的模板库,做的事是「把结构化内容往模板的占位符里灌、做溢出处理、套配色」。模型在这条路线里是可热插拔的内容发动机,跟设计质量基本脱钩。
B代码生成(LLM 亲自排版)
大模型直接输出 PptxGenJS 或 HTML,每一页的坐标、间距、层级都是它一行行写出来的。这条路线里,模型的「品味」和「空间感」直接决定设计上限。
三、目前的 SOTA:纯生成为什么是 Claude 和 Codex
「纯 AI 生成」——也就是路线 B,不靠预制模板、让模型从零把版式也生成出来——目前能打的只有两家:Claude(artifacts / pptx skill)和 Codex(OpenAI 的代码生成 + skills)。 它们的做法高度趋同,而且是趋同到同一套工程范式:
- Skill 化的设计知识。 一个 markdown 形式的
SKILL.md,把「用 PptxGenJS 不用 python-pptx」「标题别加下划线短横」「深浅页交替」这类设计规则写进去,模型按它执行。两家的 slides / pptx skill 都已开源,结构几乎一样。 - 渲染器统一到 PptxGenJS。 早期用 python-pptx,后来都换成了 JS 的 PptxGenJS——为的是产出真正可编辑的 PowerPoint 原生元素,而不是图片化的死版。
- 视觉 QA 闭环。 这是路线 B 的灵魂:生成代码 → 渲染成图 → 模型看图 → 改 overflow / 重叠 / 出界 → 重渲染。不是一次性吐出来就完事。
为什么是这两家而不是别人?因为路线 B 同时吃两样东西:(a) 模型本身的空间构图品味,(b) 一套能跑通多轮、带视觉反馈的 agentic 闭环。 这两样目前只有 Claude 和 OpenAI 的前沿模型能稳定凑齐。这也是为什么 ChatGPT / Claude 直接生成的 deck,比那些「套壳模板」的工具更能做出为这个主题定制的版式——代价是更容易翻车,需要 QA 兜底。
下面是这两家官方路线 B 工具,对同一个开源项目(BettaFish)生成的封面/首页——版式都是模型自己码出来的,不靠预制模板:
四、商业服务的技术现状(国内外)
回到路线 A——这才是商业世界的绝对主流。
国外
| 产品 | 底层模型 | 关键事实 |
|---|---|---|
| Microsoft 365 Copilot(PowerPoint) | OpenAI GPT,2026 中已是 GPT-5.x(同时在加自研 MAI / 第三方降本) | PowerPoint 的 Designer(版式建议)是另一套非 LLM 的 ML 系统,排版不归大模型管 |
| Gamma 七千万用户 | model-agnostic,设计来自自家引擎 | 它和 ChatGPT / Claude 的差距是架构性的——整套 deck 编辑 + 自有排版;导出 PPTX 会有版面漂移(本质 web-native) |
| Canva | 明确多模型(GPT / Claude / Gemini) | 「先用第三方模型跑起来拿用户行为,验证后再投自研」——基模对它就是商品 |
| Beautiful.ai | LLM 只供内容 | Smart Slides 自适应模板引擎,设计一致性 + PPT 导出保真度最好——路线 A 做到极致,用模板智能彻底替代模型排版 |
国内
国内厂商爱标自家模型,但架构同样是「自研模型出文案 + 自家排版引擎」:
| 产品 | 底层模型 | 关键事实 |
|---|---|---|
| 讯飞智文 | 星火 V4.0(文本生成独立训练) | 另搭一套「AI PPT 编排创作引擎」,但官方描述其实主要是内容 / 结构编排(分页、要点数、层级繁简);真正的视觉排版是下游的模板库 + 图示系统 |
| 百度文库 AI / 一念 | 文心大模型 | 同样是文案 + 模板 |
| WPS AI / WPS AIPPT | 多模型(已接 DeepSeek 等) | model-agnostic |
| 博思 AiPPT(AiPPT.cn) | 集成 DeepSeek、豆包、通义 Qwen,一键切换 | 最典型的 model-agnostic,设计来自数百款模板;还是 Kimi、豆包等「模型 PPT 助手」的共同后端 |
| 豆包 / DeepSeek | 自家模型 | 在 PPT 场景里只吐 Markdown 大纲,要再「套壳」到 AiPPT / 迅捷 / 墨刀这类模板引擎才能成图 |
上篇说到,商业世界用模板绕开了「让模型排版」这个难题。我没走模板路线——我走的是路线 B,让大模型直接生成 PptxGenJS 代码、自己亲自排版。下篇讲这套 harness 怎么搭,以及用它当「同一把尺子」量出来的国模能力边界。
五、我们搭的 harness:架构
架构上核心是两块:一套两轴 QA 框架,加一个渲染—自检—修正闭环。
两轴 QA:防崩溃 × 防难看
我把「翻车」和「丑」当成两类正交的问题分开治:
- 防崩溃(结构层):文件能不能打开、元素出不出界、字数溢不溢出。这一层是确定性的,可以用代码断言。
- 防难看(设计层):配色、层级、版式选择。这一层靠 skill 规则 + 视觉判断。
分开治的好处是:防崩溃可以做成零成本、零基础设施的硬卡口,不依赖模型「看图自觉」;防难看才交给模型品味和 VLM。
渲染—自检—修正闭环
生成完转 PDF、转图,再判断有没有 overflow / 重叠 / 出界,改了再渲。这一步是路线 B 的命门,缺了它就是开环,质量上不去。
六、同一套 harness,只换基模:国模的能力边界
架构定死之后,我用同一套 harness、只换基模,在同一个 BettaFish 项目上跑了三个模型:DeepSeek V4 Pro、Claude Opus、GPT-5.5。下面是观察到的能力边界。
Claude Opus 4.8 / GPT-5.5:上限长这样
同一套 harness,换上这两个,产出肉眼级地好:统一的英文 eyebrow + 标题版式系统、不用下划线靠留白分隔、颜色有语义、甚至有跨页的叙事呼应。下面是同一个 BettaFish 项目、这两个模型在我的 harness 上跑出来的封面/首页:
这两张的共性:没有模板感——版式是为 BettaFish 这个主题现编的,eyebrow、KPI 卡、彩色 chip 都是模型自己想出来的设计语言。但 GPT-5.5 也不是不翻车——我见过它在一页 chevron 箭头上把文字居中压进箭头缺口、左边被切掉。这说明:再强的模型也消不掉 QA 闭环的必要性,它只是把基线抬高了。
DeepSeek V4 Pro:下限与上限同时往下掉
换成 DeepSeek V4 Pro,内容能力没问题——大纲、文案、信息密度都够。但设计肉眼可见地降一档:
典型表现(含我在其它页上见到的):
- 标题底下挂下划线短横——AI 生成 PPT 最经典的 tell,好 skill 是明令禁止的;
- 文字溢出卡片下边界(出框);
- 序号「01」因为文本框太窄被压成「0」「1」两行。
这些缺陷有个共性:它们大多是「渲染—自检」闭环本该抓到的那一类。 换句话说,V4 Pro 的问题一部分是模型品味(上限低一档),一部分是闭环没兜住(下限没夯实)。
七、结论
把这套观察抽象一下:
| 由什么决定 | 三模对比 | |
|---|---|---|
| 上限 | 基模——品味、构图、版式发明、叙事 | V4 Pro ≪ Opus ≈ GPT-5.5;QA 闭环造不出来——闭环能去掉缺陷,但不会替你发明一套版式系统 |
| 下限 | QA 闭环 + skill 规则——出框、重叠、AI tell | 和换不换模型无关,连 GPT-5.5 都需要 |
一句话:很多看起来像「丑」的问题,其实是下限没兜住,不是上限不够高。 这部分靠 QA 闭环能补;真正补不上的,是上限那层的空间品味。
DeepSeek V4 系列最近才补上多模态(vision),这意味着「让国模当视觉裁判跑 QA 闭环」现在才刚成为可能。下限这一层国模是补得上的,真正的差距在上限的空间品味。
- AI PPT 在工程上只有两条路线:内容 + 模板引擎(路线 A),代码生成(路线 B)。
- 国内外几乎所有商业服务都在路线 A。 它们的设计上限来自人类设计师做的模板库,基模只是可热插拔的文案发动机——这就是为什么它们快、稳、但有套路感,也是为什么它们敢对底层模型无所谓。
- 纯 AI 生成(路线 B)目前做得最好的是 Claude 和 Codex。 因为这条路同时要「模型的空间品味」和「带视觉反馈的 agentic 闭环」,目前只有这两家凑得齐。
- 我自己的 harness 走路线 B,实测出了国模当前的能力边界:内容够用,但设计上限(空间品味)还差一档;而很多看起来像「丑」的问题其实是下限没兜住——这部分靠 QA 闭环能补,且国模刚补上 vision、补得上。
最后一句留给路线之争:商业世界用模板绕开了「让模型排版」这个难题,我是在正面刚它。绕开的那条路上限被模板锁死,正面刚的这条路上限是模型品味——前者已经成熟,后者还在随基模一起往上长。我赌后者。