<style>.toc-chapters{max-height:none!important}.copy-btn,#sidebar-toggle,#fullscreen-toggle{display:none!important}@media(max-width:768px){.tutorial-app{display:flex;height:auto;overflow:visible;flex-direction:column}.tutorial-main{order:0;overflow:visible}.tutorial-content{overflow:visible}.tutorial-sidebar{order:1;position:static!important;width:100%!important;min-width:0!important;max-height:none!important;display:flex!important;transform:none!important}.sidebar-toc{overflow:visible}}</style>
首页 🔥 任务工坊 AI 写短视频脚本:别让 AI 写文章了,让它设计节奏

AI 写短视频脚本:别让 AI 写文章了,让它设计节奏

📥 ⭐⭐ 入门 ⏱ 15 分钟 🤖 ChatGPT / DeepSeek / Claude

跟着步骤完成任务;每段 Prompt 都可直接复制。

开始前先确认

按选题、时间轴、逐字稿和分镜,完成短视频脚本初稿。

适合谁
自媒体人 / 品牌运营
预计时长
15 分钟
所需工具
ChatGPT / DeepSeek / Claude
步骤数
4 步
开始前准备
准备你的目标、已有材料或原始信息。
从第 1 步开始 ↓

你让 AI 写的是"文章",但短视频要的是"节奏"。


你是不是也这样过?

你在抖音刷到一个 300 万播放的视频。点进去看完,退出来想:"内容也不难啊,我上我也行。"

然后你打开 ChatGPT:

帮我想一条抖音口播脚本,讲职场新人的 3 个误区。

AI 输出了一篇 800 字的小作文。你录了 3 遍,发出去,播放量 500。

你怀疑 AI 不行。其实是你让它干了一件它永远做不好的事——让它用写文章的方式写视频脚本。

文章和短视频脚本,根本上是两种东西:

  • 文章是"给人读的"——可以长句、可以铺垫、可以倒回去重看
  • 短视频脚本是"给人听的"——一秒听不懂,观众就划走了

你把写作文的方式交给了 AI,得到的当然是一篇作文,不是一个脚本。


🤔 问题在哪?

让 AI 写一条短视频脚本,它需要同时做三件事:

  1. 策划 —— 定选题、定角度、定目标人群
  2. 设计节奏 —— 开头怎么吸人、中间怎么留住人、结尾怎么让人动起来
  3. 写逐字稿 —— 把内容变成"说出来"而不是"读出来"的语言

你让它一句话干完三件事,结果就是三件事都没干好。


💡 正确思路

先设计节奏,再填文字。

短视频不是写出来的,是"设计"出来的。你看任何一个爆款视频,拆开看它的节奏都是精心设计过的——第几秒抛钩子,第几秒换景,第几秒抛反转,第几秒引导关注。

把节奏设计交给 AI,把文字填充也交给 AI——但分两步做


🎬 4 步工作流:先把时间轴画好,再把内容填进去

第1步:先憋住,别写脚本。让 AI 帮你做选题策划。

你打开 AI,第一件事不是写脚本,而是做策划

把你脑子里大概想做的方向扔给 AI:

我想做一条抖音口播,主题是职场新人避坑。
受众是 22-28 岁的职场新人,关注点:升职加薪、少走弯路。
帮我策划 3 个不同角度的选题方向,每个给出:
- 一句话切入点(这条视频的核心吸引力)
- 目标人群的哪个痛点被打到了
- 预估哪条更容易爆

这时候 AI 只做一件事:选题策划。没有写稿压力,它给出的方向会比你自己想的有吸引力得多。

选好选题,停在这里。 别急着进下一步。


第2步:画时间轴。让 AI 把节奏打出来,不写内容。

好,现在你确定了选题:"职场新人最容易犯的 3 个错误,第 2 个你肯定中过。"

你再交给 AI,但这次只让它做节奏设计

这条口播视频约 60 秒,3 段式结构:
- 前 5 秒:用什么钩子开场?(给 3 个不同方案)
- 中间 45 秒:3 个误区怎么排节奏?每 10 秒抛一个什么信息点?
- 最后 10 秒:怎么引导互动?(给 2 个方案)

每个节点标注:第几秒 → 观众此刻在想什么 → 画面/语气提示。
先不打正文,只做节奏设计。

这一步输出的东西,就是你视频的"骨架"。

00:00-00:05 → 钩子:"这三个职场习惯,毁了我整整两年。"
              画面:出镜直视镜头,语速快
              观众反应:"啊?哪三个?"

00:05-00:20 → 误区一:不敢问问题
              画面:切中景,表情变化
              观众反应:"说的就是我……"

00:20-00:30 → 误区二:太把同事当朋友
              画面:语速放缓,眼神变化
              观众反应:"这个确实中过"

00:30-00:40 → 误区三:做完不汇报
              画面:语速加快,语气严肃
              观众反应:"卧槽,戳心"

00:40-00:50 → 总结 + 方法论
              画面:正面机位,条理清晰
              观众反应:"好有道理"

00:50-01:00 → 互动引导 + 下期预告
              画面:轻松语气,笑容
              观众反应:点赞关注

发现了吗?这时候 你还没写一个字的口播稿,但整条视频的结构已经出来了。节奏清晰,每个节点都知道观众在想什么。

这一步 AI 只做一件事:节奏设计。它还没碰文字,只是把时间轴排好。


第3步:写逐字稿!但这次是"写给人听的",不是"写给人看的"

节奏框架有了,现在让 AI 开始写逐字稿。注意要求——口语化、短句、可念出声

把第2步的节奏框架喂回 AI:

请根据以下节奏框架,写出完整逐字稿。

节奏框架:
{粘贴第2步的内容}

写作要求:
1. 口语化,像跟朋友聊天,不是背稿
2. 每句话不超过 20 个字,多用短句
3. 关键信息重复一次(观众可能走神)
4. 标注语气提示:(快/慢/严肃/笑着讲/停顿)
5. 不要用"亲爱的观众朋友们""大家好"这种套路开场
6. 总字数控制在 250-300 字(60 秒口播)

这时候 AI 只做一件事:写逐字稿。节奏和结构是给定的,它只需要把文字填进去——而且必须是"说出来"的文字,不是"读出来"的文字。

得到的逐字稿应该能直接拿起来念,不会卡壳。


第4步:画面分镜 + 字幕/封面建议(搞定最后一公里)

文字搞定了,最后让 AI 帮你把"视觉"这一环也补上。

请根据以下内容,输出完整的分镜拍摄方案。

逐字稿:{粘贴第3步的内容}

输出格式(每页一条分镜):
| 时间 | 画面 | 声音/口播 | 字幕 | 备注 |

要求:
1. 每 5-8 秒一个镜头切换
2. 标注景别(近景/中景/特写/俯拍)
3. 封面建议:给 3 个封面文案方案,每行不超过 12 个字
4. BGM 风格建议

这时候 AI 只做一件事:视觉策划。它不需要改文字,不需要想节奏,只需要把画面和文字对齐。

做完这一步,你拿到了一个完整的可拍摄方案:有选题、有节奏、有逐字稿、有分镜、有封面文案、有 BGM 建议。直接拿去拍摄,不需要再想任何事。


为什么是 4 步?

不是随便分的。4 步刚好对应一条短视频的 4 个构成要素:

步骤 AI 做的事 对应要素
第1步 选题策划 + 方向定位 题材策略
第2步 节奏设计 + 时间轴打点 完播率引擎
第3步 逐字稿写作 口播执行
第4步 分镜方案 + 封面文案 视觉呈现

每一步只调用 AI 的一个能力。质量自然提升。

注意看第2步和第3步的区别:我不让 AI 同时做"节奏"和"写稿",因为这是两件不同的大脑活动。做节奏时不想文字,写稿时不想画面。一关一关过。


📝 完整 Prompt 模板

直接复制粘贴就能用。


第1步 — 选题策划:

你是一个资深短视频编导。我想做一条短视频,帮我策划选题方向。

主题方向:{你想做的方向}
发布平台:{抖音 / 视频号 / B站}
目标受众:{受众画像,比如"22-28岁职场新人"}
账号类型:{口播 / Vlog / 知识科普 / 剧情}

请输出:
1. 3 个不同角度的选题方向,每个配一句话切入点
2. 每个选题"打中了受众的哪个痛点"
3. 你推荐哪一个?用一句话说明原因

第2步 — 节奏设计(画时间轴):

请为以下选题做节奏设计。只做时间轴框架,不写逐字稿。

选题:{选中的选题方向}
视频时长:{时长,比如 60 秒}
平台:{抖音 / 视频号 / B站}

请按时间轴输出:
00:00-00:05 → 钩子方案(给 3 个不同方案,最终选1个)
00:05-00:20 → 正文前半段节奏
00:20-00:40 → 正文后半段节奏  
00:40-00:50 → 收尾 + 核心信息
00:50-01:00 → 互动引导

每个节点标注:
- 第几秒到第几秒
- 这 5 秒讲什么
- 观众此刻的心理状态(好奇/共鸣/惊讶/想划走)
- 语气/画面提示(快/慢/严肃/笑着讲)

第3步 — 写逐字稿:

请根据以下节奏框架,写出完整逐字稿。

节奏框架:
{粘贴第2步的输出}

写作要求:
1. 口语化,像跟朋友聊天
2. 每句话不超过 20 个字,多用短句
3. 关键信息重复一次
4. 标注语气提示:(快/慢/严肃/笑着讲/停顿)
5. 不要用"大家好""姐妹们"这类套路开场
6. 总字数控制在 250-300 字(60秒口播)
7. 输出为完整的口播脚本,标注每段对应的秒数和语气

第4步 — 分镜 + 封面 + BGM 方案:

请根据以下逐字稿,输出完整的分镜拍摄方案和封面文案。

逐字稿:{粘贴第3步的输出}

请输出:
1. 完整的分镜表(每 5-8 秒一行):
   | 时间 | 画面描述 | 景别 | 口播内容 | 字幕重点 | 备注 |

2. 封面文案方案(3 个):每行不超过 12 个字

3. BGM 风格建议:给出 1-2 个推荐曲风或方向

4. 拍摄提醒:这条视频拍摄时需要注意什么(眼神、语调、动作等)

📊 Before vs After

Before(直接说"帮我想条口播脚本")

输入:职场新人常犯的错误,60秒口播。
输出:一篇 800 字的小作文,长句多、像读稿、没有节奏感。

40 分。 内容和文字都没问题,但念出来像读书报告,观众 10 秒内就划走了。

After(4 步法)

第1步输出:3 个选题方向,挑了最易爆的一个
第2步输出:秒级时间轴,每个节点观众在想什么
第3步输出:250 字逐字稿,短句+口语化,拿起来就能念
第4步输出:分镜表 + 3 个封面方案 + BGM 建议

最终效果:有选题、有节奏、有稿子、有分镜。直接架机子拍就行。

90 分。 不是"写"了一条视频,是"设计"了一条视频。


🎯 这套思路还能用在哪儿

"先设计节奏,再填内容"——这个方法不只适用于短视频脚本。

  • 直播带货话术 → 先设计整场节奏(开场吸粉→痛点共鸣→产品引入→限时逼单→收尾续流),再写每个环节的具体话术。主播再也不用全场临场发挥。

  • 知识科普口播 → 先设计"好奇-解惑-联系生活"的认知节奏,再写口语化解说。保证观众能跟着你思路走,不会中途退出去。

  • 产品视频文案 → 先定品牌调性和受众,再设计"15 秒内抓住人"的节奏框架(问题→方案→结果),最后写画面和口播。

无论什么形式,底层逻辑都一样:把 AI 当成你的分镜导演,让它先画节奏,再写内容,最后配画面。

你拆得越细,它干得越好。