抖音上各类书评号内容制作成本不低,从选书、写文案到配音、剪辑,每一步都需要时间。近日有开发者分享了一套纯 Codex 方案,利用本地开源模型和免费资源,实现了"一键出视频"的完整工作流。
整体架构
这套工作流由四个核心模块组成,全部基于开源或免费服务,无需付费 API:
- 文案生成:通过微信读书 Skill 爬取书评内容,作为视频文案底本
- 语音合成:使用 Qwen TTS 0.6B 模型在本地 M1 Mac 上运行,实现自然语音朗读
- 图片素材:封面图取自微信读书 Skill 返回的书籍封面;配图素材来自 Pixabay 免费图库
- 背景音乐:同样从 Pixabay 下载免费音乐素材
技术实现
整个流程完全基于 Codex 搭建,纯代码实现,没有使用任何付费 API。从语音推理到素材下载,各环节均为本地运行或对接免费服务。
Qwen TTS 0.6B 模型在 Apple Silicon M1 上能以可接受的推理速度完成文本到语音的转换。微信读书 Skill 负责从书库中抓取用户评价内容,将其转化为视频旁白文案。图片和音乐素材则通过 Pixabay 的免费 API 获取。
产出效果
生成的视频为竖屏格式(1080×1920),时长约 92 秒,包含配音、配图和背景音乐。从演示效果来看,基本达到了书评号内容的标准水平。
迭代方向
作者指出当前版本为第一版,文案质量仍需要打磨。后续可以优化的方向包括:
- 优化文案逻辑结构和信息密度,让书评更有深度
- 增加画面与旁白的匹配度,利用 AI 理解文案后匹配合适的配图
- 引入更多配音风格选择,除 Qwen TTS 外可探索其他开源 TTS 模型
- 支持批量生成和多平台分发
适用场景
这套工作流对于以下场景尤其具有参考价值:
- 内容创作者希望低成本试水书评类短视频
- 想学习 Codex 和本地模型搭建自动化管线的开发者
- 对微信读书 Skill 应用感兴趣的 AI 工具使用者
注意事项
使用 Pixabay 素材时,请注意遵循其授权协议(大部分素材可免费商用,但需确认具体条款)。微信读书 Skill 的使用应遵守相关平台的用户协议。本地运行 Qwen TTS 模型需要一定的硬件条件,M1 以上芯片可较好运行 0.6B 版本。
您必须登录或注册以后才能发表评论