本文目录16 个章节
从技术选型到 Skill 开源:AI 视频的工业化生产路径
利用 Codex、HyperFrames、HeyGen 与 IndexTTS2 四大工具,构建了一套全自动化的视频生产流水线。在此基础上,将整个创作流程拆解为 55 个可复用的 AI Skill 并全面开源。
Skill 的实质是一份结构化的 Markdown 指引,明确指定某一特定生产环节的执行逻辑、约束边界与质量交付标准。通过将创作决策固化为 Skill,AI 能够自主完成从灵感捕获、洗稿配音到动效渲染与发布质检的全过程。整套体系在实际应用中实现每月不到 10 小时总投入下高频产出成片。
视频流水线实战成果
-
55 个
开源的标准化 AI 视频制作与商业诊断 Skill 总数 55 个。
-
10 小时
全自动化流水线每月所需的实际人工交互总时长少于 10 小时。
-
12 层
覆盖选题、洗稿、配音、数字人至渲染质检的全流程分层架构共 12 层。
所有 Skill 按照内容创作与编码开发划分为 2 大板块,其中内容创作类划分为 12 个核心层级。
1. 选题与策划(4 个)
视频生产的第一步是锁定内容主题并制定可执行的策划方案 4 个步骤。
- ra-选题:选题全生命周期管理 Skill。收到灵感提示时自动创建 Obsidian 选题卡;收到深化指令时检索素材库与 3 天方法论;请求推荐时抓取对标账号近 3 天新作与高互动题材,按流量潜力排序输出 5 个候选清单。立项后自动修改状态并路由至视频工作台。
- ra-实操策划:长视频与实测教程策划 Skill。针对 8 到 15 分钟的 B 站与 YouTube 长片,生成包含测试题组(附 Prompt)、结构时间轴(标注出镜与画中画时段)、口播稿与录屏清单的策划案,并通过 frontmatter 的 status 字段管控生产状态。
- ra-hook:短视频前 5 秒钩子类型选择 Skill。将钩子归纳为 7 种细分类型与 3 大维度(悬念挂在内容、痛点挂在观众、热点挂在事件),为每种类型制定 3 项适用前提、句型模板与错误踩坑项,专门负责 5 秒钩子类型的匹配决策。
- ra-video-title:视频标题生成 Skill。首先进行一句话主题锁定,随后拆解对标账号的标题共性,按两段式结构生成 8 到 12 个候选标题并附带 Top 3 推荐理由。标题在洗稿阶段即写入交接稿,供发布时人工挑选。
2. 内容创作(5 个)
将原始素材与参考资料高效转化为可供制作的标准 5 个视频脚本。
- ra-video-wash-pipeline:洗稿自动化调度主控 Skill 覆盖 5 个环节。接收视频链接或本地文件后,自动串联下载视频、提取逐字稿、洗稿改写、质量校验及排入待制作队列的全套流程。
- ra-逐字稿提取skill:去水印与语音转写 3 步 Skill。调用去水印服务获取源视频,使用 Paraformer ASR 模型生成带精确时间戳的逐字稿。提取出的文字稿作为内部中间件存储于隐私区,成稿中屏蔽任何来源痕迹。
- ra-洗稿:脚本二次创作主控 Skill。接收逐字稿后重构为新视频脚本,内部依次调度 5 个模块:ra-人话 去除 AI 腔、dbs-ai-check 扫描机械痕迹、dbs-hook 诊断前 5 秒吸引力、dbs-resonate 检查情绪共鸣及 ra-video-title 生成 8 到 12 个标题候选,最终输出标准交接稿。
- ra-人话:去 AI 味与口语化重构 Skill。设立硬性规则清单,严禁使用“不是 A 而是 B”的伪对比、严禁“真正/本质上”等伪洞察标记、严禁冒号讲义腔及“更值得关注的是”等空泛转折。所有面向公众的中文稿件均需通过此 Skill 精修。
- ra-公众号提取:微信公众号文章抓取 Skill。通过 MicroMessenger UA 绕过访问限制提取纯文本内容,无需 API Key 即可为 downstream 洗稿或选题提供源素材 5 个。
3. 视频下载(2 个)
提供高效且合规的跨平台 2 个视频与音频素材本地拉取能力。
- ra-video-download:多平台视频下载 Skill。基于 yt-dlp 支持抖音、YouTube、B 站、Twitter/X 及小红书视频下载,抖音平台优先调用 TikHub 接口获取无水印源文件。下载文件存储于本地隐私目录 .internal/,严格禁止进入公开归档。
- xiaohu-video-download:海外与批量视频处理 Skill。在基础下载之外提供音频分离、播放列表批量抓取及本地视频烧录中文字幕等扩展功能,专用于海外视频翻译与素材二次加工场景。
4. 配音(1 个)
建立标准化且具备严格质量门的本地 1 个声音克隆机制。
- tts-skill:IndexTTS2 本地音色克隆 Skill。基于固定无损 WAV 参考声线生成平静语气的配音,设置 atempo=1.12 进行保持音高的轻微提速。渲染时生成 voice_manifest.json 记录参数与校验哈希,严禁使用云端 TTS 降级,环境异常时强制中断并要求修复。
5. 数字人(1 个)
实现自动化数字人视频生成与合成参数控制 1 个机制。
- heygen-digital-avatar:HeyGen 数字人合成 Skill。默认调用已训练的个人 Digital Twin 形象(黑 T 恤坐姿),以圆形裁切样式置于画面左下角。管理 OAuth 认证、形象选定与合成渲染。严格执行付费门禁:合成前必须取得经人工确认的试听音频。
6. 视频编辑(3 个)
提供从真人口播粗剪到多轨道编辑与 FCPXML 导出的 3 个剪辑能力。
- ra-local-talking-head-cut:口播视频本地自动化粗剪 Skill。基于火山引擎 ASR 转写生成校对 SRT,等待人工确认后自动执行语义剪辑(删除重复开场与失败 Take)、压缩长停顿至 380 到 450ms、保持源分辨率帧率并规范响度至 -16 LUFS,最多使用 3 个克制转场,最终输出经字幕 QC 校验的 MP4 文件的粗剪结果。
- video-use:通用视频编辑 Skill。提供涵盖转写、剪辑、调色、动效叠加与字幕烧录的通用视频处理能力,适合非口播类素材剪辑与多 Take 方案选优。
- AI剪口播:口误识别与工程导出 Skill。基于火山 ASR 自动标记口误并生成删除清单,支持导出 FCPXML 文件,无缝对接剪映与 Final Cut Pro 进行精细化后续剪辑。
7. 字幕(2 个)
实现字幕时间戳提取与外观渲染的解耦管控 2 个模块。
- ra-audio-to-subtitles:词级时间戳提取与 QC Skill。调用 Doubao-ASR 提取词级时间戳并生成 json 与 srt 文件。自动检测英文术语拆碎、孤立字、跨屏连接词及阅读速度过快问题,输出 caption-qc.json,校验未通过则阻断流水线。
- skill-captions:字幕样式设计与烧录 Skill。采用 anchor-dark 默认视觉样式(STHeiti Medium 字体、炭灰半透明圆角底框、白色文字、底部固定锚点与 4K 原生 2 倍重绘)。通过代表帧预览确认后再执行全量烧录与质检。
字幕流水线分工对比
-
ra-audio-to-subtitles (时间戳与 QC)
负责提取词级时间戳,自动扫描术语拆碎、孤立字与阅读速度过快等质量缺陷,生成结构化 JSON 与校验报告。
-
skill-captions (样式与烧录)
负责应用 anchor-dark 视觉样式,生成代表帧预览,确认无误后执行 4K 原生重绘与视频烧录。
8. 视觉与封面(6 个)
包含 IP 配图生成、封面设计及动态拼贴在内的 6 个视觉资产制作体系。
- ian-xiaohei-cat-illustrations:小黑猫 IP 概念配图 Skill。通过 DashScope wanx 引擎生成纯白手绘风格、带红橙蓝批注的知识点插图,图片本身不含文字,文字在渲染层动态叠加。
- ian-xiaohei-illustrations:通用概念 5 种可视化 Skill。继承小黑猫风格但解锁形象限制,用于更为广泛的技术概念抽象图解 5 种场景。
- skill-cover:封面预设管理 Skill。注册多种封面设计风格与双比例(16:9 与 3:4)资产,支持一键生成多套候选封面。
- editorial-dot-cover:点阵编辑风封面 Skill。采用暖灰纸质底纹、超大黑色中文标题、大面积留白及点阵矢量图标,输出可编辑的 SVG 与 PNG 矢量文件。
- editorial-collage-motion:半色调纸张拼贴动效 Skill。将参考图拆解为拼贴规范,生成静帧图层后利用 FFmpeg 或 HyperFrames 构建“空白背景逐件组装”的杂志复刻动画。
- rn-cover-skill:编辑图解风封面 Skill。直接基于标题与摘要生成 5:2 暖白画布封面,左侧进行大字排版,右侧实时生成概念图示,保持家族化视觉一致性。
9. 图文制作(1 个)
将长文快速转化为适配社交媒体排版的 1 个图片组模块。
- xhs-article-to-images:小红书图文转化 Skill。内置 5 套排版皮肤(雅刊、暖杏奶咖、雾松青、黛墨描金、夜读鎏金)与 3 个主题风格,将 Markdown 长文解析排版为 3:4 比例 HTML,通过 Playwright 截图输出高清 PNG 图片组。
10. 制作调度与质检(2 个)
管控自动化视频生产全流程的 2 个指挥中枢与复盘系统。
- ra-video-production-director:制作层总导演 Skill。读取交接稿中的 frontmatter 硬契约(比例、时长、音色、字幕风格),按需调度配音、数字人、动效与字幕 Skill,控制项目文件夹状态迁移并在归档前执行全量渲染质检。
- ra-复盘:数据分析与资产沉淀 Skill。发布后抓取播放与互动数据,按互动率划分为 R 级与 M 级爆款,归因分析成功要素,将金句、案例与概念沉淀入库并回写至选题卡。
11. 视频动效 HyperFrames(6 个)
基于 HyperFrames 代码驱动框架的 6 个高质量视频动效制作体系。
- rn-motion-director:动效总导演 Skill。将文本脚本转化为视觉隐喻、运动语法与场景节拍图,并执行 Anti-PPT 质量评估,确保视频具备连续运动感。
- rn-motion-replica:参考动效复刻 Skill。拆解优秀参考视频的布局、时序与转场,构建原创且可编辑的 HyperFrames 代码工程。
- rn-dark-saas-video:暗色 SaaS 产品展示 Skill。内置黑色星空舞台、紫色底光、大字动效与渐变 CTA 元素,提供 8 套场景蓝图与 3 种时长预设。
- rn-bw-text-opener:黑白打字机开场 Skill。提供纯黑背景、白色逐字打字动效及同步音效,内置 3 种时长预设与 Python 时序规划脚本。
- rn-replica-qc:复刻质检 Skill。执行 5 级保真度评估与素材、运行时、交付物 3 道全帧质检门禁。
12. dbs 商业工具箱(22 个)
整合自 @dontbesilent 开源的 dbskill 项目,作为商业诊断、内容质检与策略制定的 22 个核心工具箱。
dbs 商业工具箱调用模式分类
-
视频流水线自动调用 Skill
嵌入视频洗稿与选题链中自动触发,专注于文本去 AI 味、前 5 秒钩子诊断及情绪共鸣穿透力校验。
-
交互式独立诊断 Skill
由开发者显式发起调用,专注于商业模式根因分析、竞品对标过滤、卡点心理突破及多维诊断报告生成。
根据在视频生产流水线中的触发方式,dbs Skill 分为自动调用与独立诊断两类:
-
视频生产中自动调用的 3 个 dbs Skill:
- dbs-ai-check:文本 AI 痕迹扫描 Skill。精准识别机械化词汇与过平逻辑,辅助 ra-洗稿 实现去味精修。
- dbs-hook:开头钩子质量诊断 Skill。评估短视频前 5 秒对目标的吸引力并给出具体的修改建议。
- dbs-resonate:内容共鸣诊断 Skill。检查文稿是否切中受众痛点与情绪共鸣点,防止内容“全面但平淡”。
-
独立发起的 7 个 dbs 商业诊断 Skill:
- dbs-diagnosis:商业模式根因诊断。分析生意底层逻辑、定价策略与客群匹配度。
- dbs-content:内容策略与选题质量深诊。评估账号选题大方向与长尾内容价值。
- dbs-benchmark:竞品对标筛选。基于 5 重过滤法定位高质量对标账号与可复刻范式。
- dbs-unblock:卡点突破诊断。引入阿德勒心理学框架分析执行阻碍并给出破局路径。
- dbs-deconstruct:商业概念拆解。运用语言哲学将模糊商业术语拆解至原子级别。
- dbs-save / dbs-restore:会话状态存档与恢复。将诊断上下文保存为 Markdown 快照以支持跨会话接续。
- dbs-report:诊断报告生成。合并多次诊断快照生成结构化商业复盘报告。
- 扩展商业策略模块:包含 12 个专项诊断与衍生工具(如 dbs-persona、dbs-pricing、dbs-pitch、dbs-traffic、dbs-review 等)。
Skill 协作网络与链式调用机制
大部分 Skill 支持通过硬性契约自动串联,只需单条指令即可触发多环节自动化执行。
视频洗稿自动化链条
-
视频抓取与转写
ra-video-wash-pipeline 调度 ra-video-download 拉取源视频,随后调用 ra-逐字稿提取skill 提取带时间戳的逐字稿。
-
脚本重构与去 AI 味
调用 ra-洗稿 改写脚本,内部自动触发 ra-人话 抹去 AI 写作痕迹。
-
质量诊断与标题生成
依次调度 dbs-ai-check、dbs-hook 与 dbs-resonate 完成质量扫描,最终调用 ra-video-title 产出标题候选并入队。
视频制作与渲染链条
-
配音与形象合成
ra-video-production-director 校验交接稿,调度 tts-skill 生成语音,确认后调用 heygen-digital-avatar 合成数字人。
-
动效渲染与字幕烧录
调用 ian-xiaohei-cat-illustrations 生成配图,通过 HyperFrames 渲染动效,随后调度 ra-audio-to-subtitles 提取时间戳并由 skill-captions 烧录字幕。
-
质检与自动化归档
运行画面与音视频流全量质检,通过后自动将项目归档至已制作目录。
除上述核心链条外,钩子链(ra-hook 选型与 dbs-hook 打磨)与封面链(skill-cover 生成候选与用户确认)同样实现了高度解耦的模块化协作。
零代码编排:极速生产模式落地路径
通过将复杂工序封装为 Skill 并建立自动化调度链路,视频创作的精力消耗被大幅压缩。
极速视频生产操作路径
-
触发自动化洗稿
向 AI 发送指令将链接制作成视频,ra-video-wash-pipeline 自动串联 8 个 Skill 并在几分钟内完成交接稿写入队列。
-
后台自动渲染
Codex 自动从待制作队列获取任务,ra-video-production-director 调度配音、数字人合成、字幕与渲染质检。
-
轻量人工节点确认
人类创建者仅需在 3 个关键节点进行二次确认:审查校对稿、听取试听音频确认、挑选最终视频封面。
实测表明,3 项人工确认叠加仅需约 5 分钟。按月产 30 条视频计算,纯人工交互时间仅需 150 分钟,叠加必要的出镜录制与前期策划,总投入控制在 10 小时以内。
55 个开源 Skill 全量速查表
| 层级 | Skill 名称 | 触发场景/指令示例 | 核心职责与交付物 |
|---|---|---|---|
| 1. 选题与策划 | ra-选题 | 灵感 xxx / 深化一下 | 选题卡创建、资料检索与流量潜在选题排序推荐 4 个 |
| 1. 选题与策划 | ra-实操策划 | 策划长视频 | 生成 8 到 15 分钟长片策划案(包含测试题组、时间轴与录屏清单) |
| 1. 选题与策划 | ra-hook | 选钩子类型 | 短视频前 5 秒 7 种钩子类型匹配与句型模板推荐 3 个 |
| 1. 选题与策划 | ra-video-title | 生成视频标题 | 主题锁定、对标分析及 8 到 12 个两段式候选标题生成 3 个 |
| 2. 内容创作 | ra-video-wash-pipeline | 将链接做成视频 | 洗稿全流程调度(下载到转写到洗稿到质检到入队)5 个 |
| 2. 内容创作 | ra-逐字稿提取skill | 提取逐字稿 | 视频去水印抓取与 Paraformer ASR 词级时间戳文本提取 3 步 |
| 2. 内容创作 | ra-洗稿 | 洗稿此文 | 逐字稿重构为视频脚本,自动串联 5 道质量检查工序 |
| 2. 内容创作 | ra-人话 | 去 AI 味 | 面向公众中文稿件的去 AI 味精修与地道口语化重构 |
| 2. 内容创作 | ra-公众号提取 | 提取公众号文章 | 通过 MicroMessenger UA 解析并提取微信公众号纯文本 5 个 |
| 3. 视频下载 | ra-video-download | 下载视频 | 基于 yt-dlp 与 TikHub 提取无水印源视频至隐私目录 2 个 |
| 3. 视频下载 | xiaohu-video-download | 批量抓取/提取音频 | 音频分离、播放列表批量抓取及字幕烧录 |
| 4. 配音 | tts-skill | 生成配音 | 基于 IndexTTS2 的无损声音克隆与音高保持提速渲染 1 个 |
| 5. 数字人 | heygen-digital-avatar | 生成数字人 | HeyGen 数字人形象合成与试听音频门禁校验 1 个 |
| 6. 视频编辑 | ra-local-talking-head-cut | 粗剪口播 | ASR 转写校对、语义去重、长静音压缩与响度规范化 3 个 |
| 6. 视频编辑 | video-use | 通用编辑 | 多轨道视频编辑、调色、动效叠加与多 Take 选优 |
| 6. 视频编辑 | AI剪口播 | 识别口误 | 口误自动标记并导出 FCPXML 供剪映与 FCP 精剪 |
| 7. 字幕 | ra-audio-to-subtitles | 提取时间戳 | 词级时间戳提取与阅读速度和文本拆碎质量检查 2 个 |
| 7. 字幕 | skill-captions | 烧录字幕 | 应用 anchor-dark 样式、代表帧预览与 4K 重绘烧录 2 倍 |
| 8. 视觉与封面 | ian-xiaohei-cat-illustrations | 生成小黑猫配图 | 基于 DashScope wanx 生成手绘风格知识点插图 6 个 |
| 8. 视觉与封面 | ian-xiaohei-illustrations | 生成概念插图 | 通用技术概念 5 种可视化与极简风格手绘插图生成 5 种场景 |
| 8. 视觉与封面 | skill-cover | 注册封面预设 | 多风格与多比例 16:9 和 3:4 视频封面资产注册 6 个 |
| 8. 视觉与封面 | editorial-dot-cover | 生成点阵封面 | 暖灰底纹与大字排版的点阵编辑风矢量封面设计 |
| 8. 视觉与封面 | editorial-collage-motion | 生成拼贴动效 | 半色调纸张拼贴规范拆解与定格复古拼贴动画生成 |
| 8. 视觉与封面 | rn-cover-skill | 生成图解封面 | 5:2 画布大字排版与实时概念图图解风封面设计 |
| 9. 图文制作 | xhs-article-to-images | 文章转小红书图文 | 5 套皮肤排版、3:4 比例 HTML 转换与 Playwright 高清截图 1 个 |
| 10. 制作调度与质检 | ra-video-production-director | 启动视频制作 | 读交接稿契约、调度下游 Skill 并执行终审质检 2 个 |
| 10. 制作调度与质检 | ra-复盘 | 视频复盘 | 数据抓取、爆款分级、成功归因与方法论资产沉淀 |
| 11. 视频动效 | rn-motion-director | 规划动效 | 脚本到视觉隐喻转换、节拍图生成与 Anti-PPT 质检 6 个 |
| 11. 视频动效 | rn-motion-replica | 复刻参考动效 | 拆解参考视频布局时序并构建 HyperFrames 原生工程 |
| 11. 视频动效 | rn-dark-saas-video | 制作 SaaS 视频 | 暗色舞台、紫光与渐变 CTA 的 SaaS 产品展示视频 |
| 11. 视频动效 | rn-bw-text-opener | 生成打字机开场 | 纯黑背景、白色打字动效与同步音效开场动画 3 种 |
| 11. 视频动效 | rn-replica-qc | 动效复刻质检 | 5 级保真度评估与 3 道全帧质检门禁 |
| 12. dbs 商业工具箱 | dbs-ai-check | 自动扫 AI 味 | 扫描文本中的 AI 痕迹与机械习惯用语 22 个 |
| 12. dbs 商业工具箱 | dbs-hook | 自动诊钩子 | 诊断短视频前 5 秒钩子吸引力并给出修改建议 |
| 12. dbs 商业工具箱 | dbs-resonate | 自动诊共鸣 | 检查文稿情绪共鸣度与痛点切入精准度 |
| 12. dbs 商业工具箱 | dbs-diagnosis | /dbs-diagnosis | 商业模式与生意逻辑底层根因诊断 |
| 12. dbs 商业工具箱 | dbs-content | /dbs-content | 内容策略、选题大方向与长尾价值深诊 |
| 12. dbs 商业工具箱 | dbs-benchmark | /dbs-benchmark | 5 重过滤法定位行业高质量对标账号 |
| 12. dbs 商业工具箱 | dbs-unblock | /dbs-unblock | 阿德勒心理学框架分析执行卡点与破局路径 |
| 12. dbs 商业工具箱 | dbs-deconstruct | /dbs-deconstruct | 商业概念原子化拆解与语言哲学语义澄清 |
| 12. dbs 商业工具箱 | dbs-save / restore | /dbs-save | 本地 Markdown 诊断状态存档与跨会话恢复 |
| 12. dbs 商业工具箱 | dbs-report | /dbs-report | 多次诊断快照合并与结构化商业报告生成 |
| 12. dbs 商业工具箱 | dbs 扩展工具 (12个) | 专项诊断调用 | 包含 12 个商业衍生 Skill(如用户画像、定价策略、Pitch 演练等) |
REFERENCES