无脸短视频流水线 — 对话 · 静帧 · TTS
用 ForgeEcho 做无脸 YouTube Shorts / TikTok / Reels:AI 对话写脚本、9:16 静帧、ElevenLabs 配音、CapCut 合成。无需原生视频模型。
这里的「无脸」指什么
无脸短视频是 15–45 秒竖屏内容:不露脸,用产品静帧 / 空镜 + 字幕 + TTS 旁白完成种草或讲解。ForgeEcho 不生成原生视频片段(产品内无 Sora/Veo)。生产栈是:
AI 对话(脚本 + 封面提示词)
→ AI 生图(9:16 关键帧)
→ AI 语音(口播)
→ CapCut / Premiere(合成 + 字幕)直到剪辑步骤之前,积分都在同一套账本里。
开聊前先填 brief
| 字段 | 示例 |
|---|---|
| 渠道 | TikTok / Reels / Shorts |
| 时长 | 18–22 秒 |
| 卖点 | 30ml 精华,「7 天更稳的肤感」(注意广告合规) |
| 画面风格 | UGC 手持 或 干净棚拍——二选一 |
| 人设音色 | 怀疑朋友 / 冷静专家 / 忙碌父母 |
| CTA | Shop / 链接在简介 |
一条视频锁定 一个人设 + 一种画面风格。
单条成片流程(约 45–60 分钟)
1. AI 对话写口播(约 8 分钟,1–1.5 积分)
写一段约 18 秒可朗读的无脸广告脚本(英文约 35–45 词 / 中文相应缩短)。
结构:钩子(前 8–12 词)→ 一个利益点 → 软 CTA。
人设:[忙碌父母 / 怀疑者 / 热情用户]。
不要括号表演提示。短句。品牌名只出现一次。给 2 个变体。选能一口气读完、不打结的版本;让对话把超过约 14 词的长句拆开。
2. 封面 + 空镜提示词(约 5 分钟,约 1 积分)
要 两条 生图提示词:
- 钩子封面 — 产品英雄位,9:16,上三分之一留低纹理给字幕
- 空镜 — 成分/材质特写或同色系生活场景
默认加:画面内无字、无水印、无真人脸(除非你故意做人像,那就不是无脸流程)。
3. AI 生图:先筛后定(约 20 分钟)
| 轮次 | 模型 | 尺寸 | 数量 |
|---|---|---|---|
| 筛选 | nano-banana-fast | 1K | 每个提示词 3–4 张 |
| 成片 | nano-banana-2 | 2K | 胜出 1–2 张 |
包装外形/标签必须准时,务必上传产品参考图。用手机宽度检查:前 3 秒能否认出产品?
4. AI 语音:先试听再全文(约 10 分钟)
两条音色试听 → 检查钩子重音、品牌读音、语速 0.95–1.05。计费规则见 AI 语音。
5. 外部合成(约 15–20 分钟)
| 层 | 建议 |
|---|---|
| 时间线 | 封面 0–3s → 空镜 → CTA 回到产品 |
| 字幕 | 大字居中安全区 |
| BGM | 压在人声下 −18 至 −24 dB |
| 导出 | 1080×1920,30fps,H.264 |
三种稳妥结构
- 问题 → 产品 → CTA
- 误区 → 材质/成分证明 → CTA
- 清单体(3 tips):三个同色系空镜 + 30 秒内口播
一周 9 条的节奏
周一脚本 → 周二 1K 封面 → 周三 2K + 配音 → 周四剪辑 → 周五发 3 条、留 6 条做疲劳替换。积分带见 积分预算与模型选型。
发布前检查
- 静音也能靠字幕+封面看懂钩子
- 首帧能认出产品
- 人声与画面起幅对齐
- 包装无乱码「AI 字」
- 广告宣称合规
- 胜出脚本与提示词已进提示词库
常见错误
- 写成「阅读文」而不是「口播文」
- 为 1080×1920 导出却狂出 4K 封面
- 15 秒里混三种画面风格
- 期待 ForgeEcho 直接出成片 MP4(不会——这是设计边界)