← 返回首页
Research · AI PPT Teardown

从模板到代码:AI 生成 PPT 的两条路线,与国模的能力边界

上篇讲历史与现状(两条技术路线、商业全景、为什么 SOTA 是 Claude 和 Codex);下篇拆我们自建的代码生成 harness,以及同一套框架换基模跑出的能力差异。

2026-06-18 · 更新于 2026-06-21 AI PPT pptxgenjs 国模评测 视觉 QA English →
概念图:左侧的文档与数据流入中央一个发光的 AI 内核(立在底座上),内核向右侧吐出排版精致的幻灯片卡片,整体深靛蓝调——象征从原始内容到成品 deck 的生成过程
AI 生成 PPT 的两端:左边是原始内容,右边是成品 deck,中间那一步——「谁来排版」——决定了一切。

这篇是我自己搭 PPT harness 一段时间、又把市面上国内外的工具挨个拆过之后的总结。结论先放这儿:目前国内外主流的商业 AI PPT,本质都是「AI 生成内容 + 模板 / 排版引擎」;真正让大模型从零把版式也一行行码出来的「纯 AI 生成」路线,目前做得最好的是 Claude 和 Codex(OpenAI 的代码生成)。 上篇把这个结论怎么来的拆开讲,下篇讲我自己做的 harness 和它在不同基模上跑出的差异。

本文结构
  1. 上篇 · 历史与现状:一段很短的历史 → 两条技术路线 → 为什么 SOTA 是 Claude 和 Codex → 商业现状(国内外)
  2. 下篇 · 我们的 harness:架构(两轴 QA + 渲染自检闭环)→ 同一套框架换基模的能力边界 → 结论
上篇 · AI 生成 PPT 的历史与现状

一、一段很短的历史

幻灯片软件本身几乎二十年没变过:PowerPoint、Keynote、Google Slides,打开都是一个空白矩形等你填。所谓「AI 做 PPT」,是分几波长出来的。

第一波,模板智能(非 LLM)。 2010 年代中期,PowerPoint Designer 这类功能上线,本质是云端的版式推荐——你把内容堆上去,它用规则和轻量 ML 给你几个排版方案。这跟大模型没关系,但它确立了一个后来一直没变的分工:内容是内容,排版是排版,排版由一套专门的引擎来做。

第二波,大纲生成器(GPT-3.5 时代)。 大模型能写文案之后,SlidesAI 这类工具出现,套路是「主题 → 大纲 → 文案」,然后灌进固定模板。模型只负责出字。

第三波,叙事派与 PPT killer 的喧嚣(2022–2024)。 Tome 是这一波的代表,主打「讲故事而不是堆要点」,用户涨得很快,峰值两千万量级,融了八千多万美元。但它没解决商业化,2025 年初关停了演示产品、团队转去做 CRM。这件事我觉得是个信号:光把「生成」做得花哨、不解决「能不能当成品交付」,撑不住。 同期 Beautiful.ai 走了另外一条路——它的 Smart Slides 是一组会自适应的模板,设计上限交给人类设计师。

第四波,大厂收编 + 代码生成(2023 至今)。 微软把 Copilot 塞进 PowerPoint(2023 年用 GPT-4,现在是 GPT-5.x);Gamma 在 2025 年爆发到七千万用户;Google 把 Gemini 接进 Slides。与此同时出现了一条以前没有的路线:让大模型直接写渲染代码(PptxGenJS / HTML),版式是模型自己码出来的。 Claude 的 artifacts、ChatGPT 的 skills 都属于这条。这条路线是这篇文章真正关心的东西。

二、两条技术路线

把市面上所有「AI PPT」摊开,会发现它们只分两类:

A内容生成 + 模板 / 引擎填充

大模型只出大纲和文案,真正的配图、配色、版式由一套独立的排版引擎完成。这套引擎吃的是人类设计师预先做好的模板库,做的事是「把结构化内容往模板的占位符里灌、做溢出处理、套配色」。模型在这条路线里是可热插拔的内容发动机,跟设计质量基本脱钩。

B代码生成(LLM 亲自排版)

大模型直接输出 PptxGenJS 或 HTML,每一页的坐标、间距、层级都是它一行行写出来的。这条路线里,模型的「品味」和「空间感」直接决定设计上限。

这能解释一个一开始让我困惑的现象:为什么商业工具敢对底层模型无所谓、随便换?因为它们全在路线 A——设计不归模型管,模型当然可换。而我自己的 harness 在路线 B,所以我换个基模,产出质量会肉眼级地变。同一件事,在两条路线上根本不是同一个问题。

三、目前的 SOTA:纯生成为什么是 Claude 和 Codex

「纯 AI 生成」——也就是路线 B,不靠预制模板、让模型从零把版式也生成出来——目前能打的只有两家:Claude(artifacts / pptx skill)和 Codex(OpenAI 的代码生成 + skills)。 它们的做法高度趋同,而且是趋同到同一套工程范式:

  1. Skill 化的设计知识。 一个 markdown 形式的 SKILL.md,把「用 PptxGenJS 不用 python-pptx」「标题别加下划线短横」「深浅页交替」这类设计规则写进去,模型按它执行。两家的 slides / pptx skill 都已开源,结构几乎一样。
  2. 渲染器统一到 PptxGenJS。 早期用 python-pptx,后来都换成了 JS 的 PptxGenJS——为的是产出真正可编辑的 PowerPoint 原生元素,而不是图片化的死版。
  3. 视觉 QA 闭环。 这是路线 B 的灵魂:生成代码 → 渲染成图 → 模型看图 → 改 overflow / 重叠 / 出界 → 重渲染。不是一次性吐出来就完事。

为什么是这两家而不是别人?因为路线 B 同时吃两样东西:(a) 模型本身的空间构图品味,(b) 一套能跑通多轮、带视觉反馈的 agentic 闭环。 这两样目前只有 Claude 和 OpenAI 的前沿模型能稳定凑齐。这也是为什么 ChatGPT / Claude 直接生成的 deck,比那些「套壳模板」的工具更能做出为这个主题定制的版式——代价是更容易翻车,需要 QA 兜底。

下面是这两家官方路线 B 工具,对同一个开源项目(BettaFish)生成的封面/首页——版式都是模型自己码出来的,不靠预制模板:

Claude 官方 opus 4.8 生成的 BettaFish 封面:深靛蓝底,圆形品牌图标,超大衬线标题,青色副标题,底部一排四张半透明 KPI 卡(40.7K Stars / 7.5K Forks / 98% Python / GPL-2.0)
Claude 官方(opus 4.8):克制的主视觉封面,KPI 卡对齐工整。
ChatGPT 官方 GPT-5.5 生成的 BettaFish 介绍页:浅蓝底,左侧爬来的真实 betta 鱼 logo 与功夫风格插图『舆情分析只需简单三板斧』,右侧流程箭头
ChatGPT 官方(GPT-5.5):会主动爬真实配图(logo、插画),信息更具象。
两张都是模型亲自排版的产物,但风格取向不同:Claude 偏克制的版式系统,GPT-5.5 更倾向抓真实图片来填充。这正是路线 B 的特征——结果跟着模型品味走,而不是跟着模板走。

四、商业服务的技术现状(国内外)

回到路线 A——这才是商业世界的绝对主流。

国外

产品底层模型关键事实
Microsoft 365 Copilot(PowerPoint)OpenAI GPT,2026 中已是 GPT-5.x(同时在加自研 MAI / 第三方降本)PowerPoint 的 Designer(版式建议)是另一套非 LLM 的 ML 系统,排版不归大模型管
Gamma
七千万用户
model-agnostic,设计来自自家引擎它和 ChatGPT / Claude 的差距是架构性的——整套 deck 编辑 + 自有排版;导出 PPTX 会有版面漂移(本质 web-native)
Canva明确多模型(GPT / Claude / Gemini)「先用第三方模型跑起来拿用户行为,验证后再投自研」——基模对它就是商品
Beautiful.aiLLM 只供内容Smart Slides 自适应模板引擎,设计一致性 + PPT 导出保真度最好——路线 A 做到极致,用模板智能彻底替代模型排版

国内

国内厂商爱标自家模型,但架构同样是「自研模型出文案 + 自家排版引擎」

产品底层模型关键事实
讯飞智文星火 V4.0(文本生成独立训练)另搭一套「AI PPT 编排创作引擎」,但官方描述其实主要是内容 / 结构编排(分页、要点数、层级繁简);真正的视觉排版是下游的模板库 + 图示系统
百度文库 AI / 一念文心大模型同样是文案 + 模板
WPS AI / WPS AIPPT多模型(已接 DeepSeek 等)model-agnostic
博思 AiPPT(AiPPT.cn)集成 DeepSeek、豆包、通义 Qwen,一键切换最典型的 model-agnostic,设计来自数百款模板;还是 Kimi、豆包等「模型 PPT 助手」的共同后端
豆包 / DeepSeek自家模型在 PPT 场景里只吐 Markdown 大纲,要再「套壳」到 AiPPT / 迅捷 / 墨刀这类模板引擎才能成图
豆包生成的 BettaFish 介绍页:浅灰底,左侧爬来的真实 betta 鱼 logo 图,右侧三张卡片,每张卡片左边缘是一条蓝色竖向色条 + 图标 + 标题正文,底部一条浅蓝 callout 条
豆包(路线 A):爬一张网图当配图,套上「左竖色条卡片」的模板版式——干净,但一眼能看出是模板,还带点 AI 味。
豆包这张很典型:爬取一张真实图片 + 模板化的「带竖线色条的卡片」,排版稳定但有套路感。这就是路线 A——设计来自模板库,模型只负责把文案塞进去。
一个有意思的点:DeepSeek 在国内 PPT 生态里,恰恰是「只出大纲、自己不排版」的那一类。它在那些产品里根本没机会展示排版能力,因为排版被模板接管了。这也直接引出了下篇我自己做的事——把 DeepSeek 这类国模放进路线 B,逼它亲自排版,看它能走多远。
下篇 · 我们的 harness 与国模能力边界

上篇说到,商业世界用模板绕开了「让模型排版」这个难题。我没走模板路线——我走的是路线 B,让大模型直接生成 PptxGenJS 代码、自己亲自排版。下篇讲这套 harness 怎么搭,以及用它当「同一把尺子」量出来的国模能力边界。

技术路线
B
代码生成,模型亲自排版
QA 轴
2
防崩溃 × 防难看
同尺基模对照
3
DeepSeek V4 Pro · Opus · GPT-5.5

五、我们搭的 harness:架构

架构上核心是两块:一套两轴 QA 框架,加一个渲染—自检—修正闭环

流水线概念图:左侧一份文档,经过三个串联的处理节点——带放大镜的「抓取/调研」、带层级框的「策划/大纲」、带画笔的「设计/排版」——每个节点上方挂着齿轮,最终右侧输出一叠带图表的幻灯片
路线 B 的流水线:内容抓取 → 策划大纲 → 代码排版,每一步都是模型在做,而不是往模板里灌。

两轴 QA:防崩溃 × 防难看

我把「翻车」和「丑」当成两类正交的问题分开治:

分开治的好处是:防崩溃可以做成零成本、零基础设施的硬卡口,不依赖模型「看图自觉」;防难看才交给模型品味和 VLM。

渲染—自检—修正闭环

生成完转 PDF、转图,再判断有没有 overflow / 重叠 / 出界,改了再渲。这一步是路线 B 的命门,缺了它就是开环,质量上不去。

六、同一套 harness,只换基模:国模的能力边界

架构定死之后,我用同一套 harness、只换基模,在同一个 BettaFish 项目上跑了三个模型:DeepSeek V4 Pro、Claude Opus、GPT-5.5。下面是观察到的能力边界。

Claude Opus 4.8 / GPT-5.5:上限长这样

同一套 harness,换上这两个,产出肉眼级地好:统一的英文 eyebrow + 标题版式系统、不用下划线靠留白分隔、颜色有语义、甚至有跨页的叙事呼应。下面是同一个 BettaFish 项目、这两个模型在我的 harness 上跑出来的封面/首页:

harness + Opus 4.8 生成的 BettaFish 封面:深靛蓝底,圆形鱼形图标,英文 eyebrow『MULTI-AGENT PUBLIC OPINION INTELLIGENCE』,手写体大标题『微舆 · BettaFish』,底部四张 KPI 卡(30+ / 数百万 / 5类 / 7×24)
harness + Opus 4.8:eyebrow + 标题系统 + KPI 卡,层级靠留白分隔。
harness + GPT-5.5 生成的 BettaFish 首页:深色底,左侧大标题『人人可用的多 Agent 舆情分析助手』,右侧『项目关键词』卡内嵌六枚不同颜色的标签 chip,底部四张小卡(GPL-2.0 / Python / Flask+Streamlit / 报告输出)
harness + GPT-5.5:用语义化彩色 chip 编码关键词,左右分栏承载主次。

这两张的共性:没有模板感——版式是为 BettaFish 这个主题现编的,eyebrow、KPI 卡、彩色 chip 都是模型自己想出来的设计语言。但 GPT-5.5 也不是不翻车——我见过它在一页 chevron 箭头上把文字居中压进箭头缺口、左边被切掉。这说明:再强的模型也消不掉 QA 闭环的必要性,它只是把基线抬高了。

DeepSeek V4 Pro:下限与上限同时往下掉

换成 DeepSeek V4 Pro,内容能力没问题——大纲、文案、信息密度都够。但设计肉眼可见地降一档:

harness + DeepSeek V4 Pro 生成的 BettaFish 流程页:浅蓝底,标题『一次完整分析流程』下方挂着一条下划线短横,七个节点的横向时间轴,下方深色 callout 条与一排支撑卡
harness + DeepSeek V4 Pro:标题底下那条下划线短横,正是 AI 生成 PPT 最经典的 tell;整体打磨明显逊于 Opus / GPT 两张。

典型表现(含我在其它页上见到的):

这些缺陷有个共性:它们大多是「渲染—自检」闭环本该抓到的那一类。 换句话说,V4 Pro 的问题一部分是模型品味(上限低一档),一部分是闭环没兜住(下限没夯实)。

七、结论

把这套观察抽象一下:

由什么决定三模对比
上限基模——品味、构图、版式发明、叙事V4 Pro Opus GPT-5.5;QA 闭环造不出来——闭环能去掉缺陷,但不会替你发明一套版式系统
下限QA 闭环 + skill 规则——出框、重叠、AI tell和换不换模型无关,连 GPT-5.5 都需要

一句话:很多看起来像「丑」的问题,其实是下限没兜住,不是上限不够高。 这部分靠 QA 闭环能补;真正补不上的,是上限那层的空间品味。

DeepSeek V4 系列最近才补上多模态(vision),这意味着「让国模当视觉裁判跑 QA 闭环」现在才刚成为可能。下限这一层国模是补得上的,真正的差距在上限的空间品味。

  1. AI PPT 在工程上只有两条路线:内容 + 模板引擎(路线 A),代码生成(路线 B)。
  2. 国内外几乎所有商业服务都在路线 A。 它们的设计上限来自人类设计师做的模板库,基模只是可热插拔的文案发动机——这就是为什么它们快、稳、但有套路感,也是为什么它们敢对底层模型无所谓。
  3. 纯 AI 生成(路线 B)目前做得最好的是 Claude 和 Codex。 因为这条路同时要「模型的空间品味」和「带视觉反馈的 agentic 闭环」,目前只有这两家凑得齐。
  4. 我自己的 harness 走路线 B,实测出了国模当前的能力边界:内容够用,但设计上限(空间品味)还差一档;而很多看起来像「丑」的问题其实是下限没兜住——这部分靠 QA 闭环能补,且国模刚补上 vision、补得上。

最后一句留给路线之争:商业世界用模板绕开了「让模型排版」这个难题,我是在正面刚它。绕开的那条路上限被模板锁死,正面刚的这条路上限是模型品味——前者已经成熟,后者还在随基模一起往上长。我赌后者。