🔥 热点视频技能
返回工作站
HOT VIDEO PIPELINE

从热点词到可发布短视频

这条流水线不是把一件事丢给 AI 完事,而是把选题、文案、配音、字幕、画面、合成拆成独立节点。这样每个节点可以单独复盘、单独重跑,也能按新需求继续升级。

热点抓取 + 选题评分 豆包 LLM 写脚本 火山豆包 TTS 配音 Seedance 图生视频 FFmpeg 竖屏合成

整体流程

先确定“蹭什么”,再生成“怎么讲”,最后由不同工具分别完成声音、画面和排版。

STEP 01

抓热点与评分

聚合抖音、微博、百度、知乎、头条、B 站等平台热点,再按传播潜力做评分,并过滤伤亡、灾害、谣言、冲突等不适合蹭的红线题材。

多源热点跨平台聚类风险过滤
STEP 02

写口播与标题

LLM 根据热点补充信息,输出钩子标题、四句口播稿、画面提示词、配乐风格和发布标签,形成后续节点共同使用的脚本结构。

标题钩子口播稿分镜提示词
STEP 03

独立出声画并合成

配音、字幕、画面各自生成后,再按时间轴交给 FFmpeg 合成:竖屏背景、标题、画中画视频、底部字幕和背景音乐统一定版。

配音先行时间轴驱动9:16 输出

三类资产是分开生成的

配音先定总时长,字幕和画面再围绕同一套时间轴展开,避免各自为政。

🎙️

配音

使用火山豆包 TTS 生成正式口播。它能输出整段配音,也能按句子拆分出时长,给后续画面和字幕提供对齐基准。

scriptTTSvoice.wavseg_durations.json
🔤

字幕

字幕不是识别配音得到的,而是跟随脚本与 TTS 断句结果生成 SRT,再用 Pillow 渲染成 PNG,最后由 FFmpeg 按时间叠加。

SRTPillow PNGFFmpeg overlay
🎞️

画面

画面由脚本提示词驱动。早期用 Seedance 文生视频;更新后先用真实图片定首帧,再扩展成运动镜头,提升可信度。

prompt / photoSeedanceclip.mp4

两个版本的对照

第一版验证了热点的传播势能,第二版解决了“一眼假”的问题,但也暴露出素材网覆盖不足的新问题。

版本一 · 纯 AI 提示词生成

火箭发射视频

这个视频靠“火箭发射”热点拿到了 5000+ 播放量,说明选题节奏有效。但画面全部由 AI 提示词生成,虽然蹭到了热点,画面却明显偏假。

5000+ 播放量 画面真实感弱
版本二 · 真实图 + 图生视频

真实素材首帧版

更新后先让 AI 去素材网找图,再根据现有图片扩展生成视频。真实图进入画面后,可信度明显提高。但很多热点话题在素材网里找不到对应配图,这是这个版本最大的限制。

真实感更强 热点配图不一定存在
CURRENT COST

当前成本模型

现在画面生成使用抖音 Seedance 2.0 mini,并且正在享受 4 折优惠。按当前优惠口径,一段 8 秒视频消耗约 2 元。

¥2 / 8秒
单段画面:约 ¥2 每个 8 秒分镜生成一次画面,按优惠后价格估算。
4 段成片:约 ¥8 一条完整视频通常包含 4 段画面,脚本、配音和字幕成本相对很低。
重生成:只补改段 某一段不满意时只重建这一段,不重新生成整片,避免浪费。
后续计划:4 折优惠结束后,会评估接入即梦购买会员积分。目标是在保证画面质量的前提下,把单条视频的固定生成成本压得更低。

下一版升级方向

现在的问题是:真实图更可信,但热点不总能在素材网找到合适的图。所以下一版要再往上走一层——外接生图 API,让系统先自己做分镜。

1. 分镜优先先把一句口播拆成可审阅的关键画面,再进入视觉生成。
2. 生图补缺口素材网找不到图时,用生图 API 生成首帧,避免退回纯 AI 直生视频的老问题。
3. 图生视频定运动关键帧确认后再用 Seedance 扩展运动,让真实感和可控性同时保留。

升级后的目标链路

未来的每一段画面都先有“设计稿”,再进入动态化,而不是直接让提示词碰运气。

热点 → 口播稿继续保留当前稳定的选题、脚本和配音流程。
分镜关键帧 → 人工确认每一镜先看图,确认画面主体、场景和情绪。
关键帧 → 图生视频确认后再生成运动画面,降低废片和重跑成本。

当前定位:这条流水线已经能稳定完成“热点发现 → 脚本 → 配音 → 字幕 → 竖屏成片”。接下来重点不是再造一套流程,而是把画面源头升级成可分镜、可确认、可控质量的生图 API。