抓热点与评分
聚合抖音、微博、百度、知乎、头条、B 站等平台热点,再按传播潜力做评分,并过滤伤亡、灾害、谣言、冲突等不适合蹭的红线题材。
这条流水线不是把一件事丢给 AI 完事,而是把选题、文案、配音、字幕、画面、合成拆成独立节点。这样每个节点可以单独复盘、单独重跑,也能按新需求继续升级。
先确定“蹭什么”,再生成“怎么讲”,最后由不同工具分别完成声音、画面和排版。
聚合抖音、微博、百度、知乎、头条、B 站等平台热点,再按传播潜力做评分,并过滤伤亡、灾害、谣言、冲突等不适合蹭的红线题材。
LLM 根据热点补充信息,输出钩子标题、四句口播稿、画面提示词、配乐风格和发布标签,形成后续节点共同使用的脚本结构。
配音、字幕、画面各自生成后,再按时间轴交给 FFmpeg 合成:竖屏背景、标题、画中画视频、底部字幕和背景音乐统一定版。
配音先定总时长,字幕和画面再围绕同一套时间轴展开,避免各自为政。
使用火山豆包 TTS 生成正式口播。它能输出整段配音,也能按句子拆分出时长,给后续画面和字幕提供对齐基准。
字幕不是识别配音得到的,而是跟随脚本与 TTS 断句结果生成 SRT,再用 Pillow 渲染成 PNG,最后由 FFmpeg 按时间叠加。
画面由脚本提示词驱动。早期用 Seedance 文生视频;更新后先用真实图片定首帧,再扩展成运动镜头,提升可信度。
第一版验证了热点的传播势能,第二版解决了“一眼假”的问题,但也暴露出素材网覆盖不足的新问题。
这个视频靠“火箭发射”热点拿到了 5000+ 播放量,说明选题节奏有效。但画面全部由 AI 提示词生成,虽然蹭到了热点,画面却明显偏假。
更新后先让 AI 去素材网找图,再根据现有图片扩展生成视频。真实图进入画面后,可信度明显提高。但很多热点话题在素材网里找不到对应配图,这是这个版本最大的限制。
现在画面生成使用抖音 Seedance 2.0 mini,并且正在享受 4 折优惠。按当前优惠口径,一段 8 秒视频消耗约 2 元。
现在的问题是:真实图更可信,但热点不总能在素材网找到合适的图。所以下一版要再往上走一层——外接生图 API,让系统先自己做分镜。
未来的每一段画面都先有“设计稿”,再进入动态化,而不是直接让提示词碰运气。
当前定位:这条流水线已经能稳定完成“热点发现 → 脚本 → 配音 → 字幕 → 竖屏成片”。接下来重点不是再造一套流程,而是把画面源头升级成可分镜、可确认、可控质量的生图 API。