目录
- 背景
- 整体架构
- 第一环:脚本生成
- 第二环:画面生成
- 第三环:数字人口播
- 第四环:合成输出
- 架构价值分析
- 总结
背景
一人公司做短视频内容获客,最大的瓶颈不是创意,而是边际制作成本。传统流程需要编导写脚本、剪辑找素材、配音录声音、后期加字幕,单人操作至少半天到一天。
核心策略:不追求单条爆款,追求将单条视频生产成本降至接近零,用数量覆盖概率。
整体架构
WorkBuddy 短视频自动化流水线拆分为四个环节,输入为"选题关键词",输出为"完整短视频文件":
选题关键词 → 脚本生成 → 画面生成 → 数字人口播 → 合成输出 → 最终视频 ↓ ↓ ↓ ↓ ↓ ↓ 人工 自动化 自动化 自动化 自动化 完成第一环:脚本生成
流程
- 选题 Skill:输入关键词,自动生成 40 个选题方向
- 脚本 Skill:根据选中的选题,生成完整短视频脚本
- 结构固定:hook(3秒)→ 干货内容 → 引导关注
技术要点
- 输出格式为结构化 JSON,作为整条流水线的"配置清单"
- 后续环节从 JSON 中读取参数
- 选择 JSON 而非文本,因为工具链读取 JSON 效率远高于自然语言解析
第二环:画面生成
流程
- 脚本 JSON 包含每一帧画面的描述词
- 即梦 Skill 自动读取描述词,调用即梦 AI API
- API 将文字描述转成画面图片
策略
- 生成 4-6 张画面
- 从中选取最优可用素材
- 不追求每张精修,能用即可
- 所有步骤由 Skill 自动完成,无需人工操作
第三环:数字人口播
解决的问题
一人公司最大痛点:没有"脸"出镜。
流程
- 脚本文案直接喂给数字人 Skill
- 数字人 Skill 调用平台 API 生成口播视频
- 口型、表情、动作在后台渲染完成
- 只需指定数字人形象
关键点:从"没人出镜"到"有一个数字人在替你说话",中间只隔了一个 Skill。
第四环:合成输出
底层技术
- LibTV 做底层调度
- WorkBuddy 合成 Skill 统一接管
自动化步骤
| 步骤 | 操作 | 自动化 |
|---|---|---|
| 1 | 画面素材排成时间线 | ✅ 自动 |
| 2 | 数字人口播对齐到画面轨道 | ✅ 自动 |
| 3 | 配音文件生成字幕并压制 | ✅ 自动 |
| 4 | 添加背景音乐 | ✅ 自动 |
| 5 | 输出最终视频文件 | ✅ 自动 |
架构价值分析
确定性优先
传统模式:每一步都需要人工决策(脚本质量、画面适配、配音效果、字幕校对),每一步都在消耗决策能量。
自动化模式:仅需决策选题,其余由 Skill 链自动执行。
决策与执行分离
一人公司最值钱的不是执行能力,而是决策能力。自动化流水线将执行层完全标准化,将人的精力集中在选题决策这一高价值环节。
总结
WorkBuddy 短视频自动化链路的本质不是技术堆叠,而是将制作流程固化为可复用的系统。
核心公式:一人公司做内容 = 一条能自动跑的生产线 + 一个能持续做决策的自己。
数字人不是替代真人,是替代真人做重复性劳动。真人做创意和决策,数字人做批量化产出。