* feat: support GPT Image 2.5 models and output options * docs: link GPT Image 2.5 changes to PR 101
5.5 KiB
常见问题
Q:生成的是可编辑 PPT 吗?
不是。Codex PPT 生成的是图片式 PPT,每一页是一张完整幻灯片图片。视觉效果更统一,但页面里的文字、图表、形状不能像传统 PPT 那样逐项编辑。生成完成后,如果需要调整内容或视觉效果,推荐直接在同一段对话里继续让 AI 修改具体页面。
如无必要,请不要转成可编辑 PPT,除非你 Codex 额度充足。
如果需要进一步转换成可编辑 PPT,可以在生成后尝试使用 image-to-editable-ppt-skill。不过 image-to-editable-ppt-skill 目前属于测试版本,且目前只支持 ChatGPT Plus / Pro 会员在 Codex 中使用,不支持其他 agent。如果效果不稳定,请等待后续更新通知。
注意:图片转可编辑 skill 目前消耗 token 较多,对 Plus 用户不友好,Pro 用户随意。
Q:支持其他 agent 吗?
支持。Codex PPT 本身是基于 SKILL.md 的 skill,除了 Codex,也可以在 Claude Code、OpenClaw、Hermes Agent 等支持 SKILL.md 的 agent 中使用。
本 skill 在 Codex 场景下开发和测试,对 Codex 的适配度最好,推荐优先使用。
需要注意的是,不同 agent 的图片生成能力和工具接口不一样。如果不是在 Codex 中使用,通常需要配置 gpt-image-2.5-flare 或第三方 OpenAI 兼容格式的生图 API。具体配置方式可以参考安装与配置,并在使用过程中让 AI 根据当前环境引导完成。
Q:如何更新 skill 到最新版本?
重新执行一遍安装命令即可覆盖为最新版本,或者直接让 agent 帮你更新,然后重启 agent 生效。API key 配置和个人风格库都存放在 skill 安装目录之外,更新不会丢失。具体命令参见安装与配置。
Q:为什么第一张样张不错,后面的页面又变差或风格不一样?
这通常说明“样张风格”没有被稳定传递到后续页面,或者后续页面在生成时换了提示词、换了后端、换了子智能体执行方式。
正常情况下,样张确认后,后续页面应该继承同一套视觉语言,包括配色、字体气质、版式密度、插画方式和图片生成后端。如果后面页面明显跑偏,可以让 AI 检查:是否把样张作为风格参考传给每一页;是否记录并沿用了同一个生图方式;子智能体有没有擅自换成别的生成方式;每页提示词是否过于宽泛。
建议处理方式是:不要整套重来,先挑 1-2 页明显跑偏的页面,让 AI 对照已确认样张重新生成,并明确要求“保持样张的视觉风格、同一图片生成后端和同一版式密度”。
Q:生成的 PPT 很丑怎么办?
请先检查所选生图后端是否可以正常生图。如果后端不可用、返回质量异常,或者第三方 API / 中转站未正确支持所选模型和参数,生成效果会明显变差。
确认模型可用后,再让 AI 针对具体问题修改,例如风格不统一、文字太小、页面太挤、配色不好看、插图不贴合主题等。建议先重新生成 1 页样张,满意后再继续整套生成。
Q:生成的幻灯片图片比较模糊怎么办?
优先使用当前环境可调用的内置生图工具;实际模型、分辨率和可调参数取决于环境,不能仅凭会员身份或成功出图确认。若需精确指定尺寸或质量,而内置工具未暴露这些参数,可选择支持相应参数的 API/CLI fallback。API/CLI fallback 默认输出为 2K 16:9;文字较多或仍模糊时可尝试 4K;GPT Image 2.5 超过 2560x1440 像素的输出属于实验性能力,需检查实际结果。
API/CLI fallback 默认使用 gpt-image-2.5-flare,可用 --model gpt-image-2.5-sunburst 切换。两者支持 xhigh / max 质量及透明 PNG/WebP;默认仍为 2K 16:9、medium。旧模型保留原参数限制,第三方服务需确认其支持的模型和参数。
Q:为什么要先确认大纲?
因为 PPT 的返工成本主要来自结构问题。先确认页数、标题、顺序和每页要点,可以避免后面图片都生成完了才发现内容方向不对。
Q:为什么要先生成样张?
样张是整套 PPT 的视觉基准。确认样张后,后续页面可以继承同一套配色、字体气质、密度和视觉语言。
Q:Codex 里需要配置 API key 吗?
如果 Codex 内置图片生成工具可用,通常不需要配置 API key。只有在选择 API/CLI fallback 时,才需要配置 OPENAI_API_KEY、可选 OPENAI_BASE_URL 和模型名。
Q:可以插入论文原图或架构图吗?
可以。建议在大纲阶段明确图片对应的页码和用途,并说明它是严格输入素材还是风格参考。对于论文图、实验结果图、截图和架构图,应尽量保留原始信息、标签、坐标轴、数值和箭头关系。
Q:某一页效果不好怎么办?
优先只修改这一页。告诉 agent 具体问题,例如文字太小、层次不清、配色不适合、图太拥挤或某个概念表达不准确。
Q:可以保存自己的风格吗?
可以。把喜欢的 PPT 截图、PDF 或完整 PPT 交给 agent 分析,生成满意后,可以让 agent 把这套风格保存到个人风格库(~/.codex-ppt-skill/references/)。风格库存放在 skill 安装目录之外,更新或重装 skill 都不会丢失;如果与内置风格同名,个人风格优先。详见风格与个人风格库。