996· 149 forks· Python· MIT开发工具

Vox Director: 一键生成 Vox 风格拼贴解说视频

Alisa0808/vox-director

输入一个主题自动生成 Vox 风格纸质拼贴解说视频,从脚本、关键帧、动画到配音配乐字幕全流程 AI 自动化

成熟度维护活跃,最近提交 0 天前,无未解决 issue,近期持续更新

GitHub 仓库 →对标:Vox Media 视频制作流程

项目体检

技术 · Python + ffmpeg,调用 Atlas Cloud API(Google nano-banana-2/Gemini/Kling 等多模型)

许可 · MIT 协议,可自由商用(需遵守 Atlas Cloud API 服务条款)

活跃 · 今日仍有提交,2 位贡献者,项目创建 24 天已获 996 stars,活跃度高

解决什么

传统解说视频制作需要编剧、设计师、动画师、配音师多工种协作,周期长成本高。Vox Director 将 Vox Media 标志性的纸质拼贴解说视频制作流程全自动化:输入一个主题(如"足球如何征服世界"),系统自动生成分镜脚本、设计拼贴风格海报关键帧、添加动画效果、配音配乐和字幕,最终输出完整 MP4 视频。整个流程从构思到成片压缩至分钟级,让个人创作者也能产出媒体级视频内容。

为何火

项目上线 24 天即获近千 stars,核心吸引力在于三点:一是视觉风格独特,完美复刻 Vox 经典的手撕纸张、剪报拼贴、半色调网点、大标题等元素,辨识度极高;二是全流程自动化,从叙事结构(14 种预设叙事弧线)到视觉风格(9 种主题预设)再到技术实现(调用 Google nano-banana-2 生成海报、Gemini 做动画、xAI 配音),无需人工干预;三是AI 代理友好设计,作为 Claude Code 等编码代理的"技能包",通过自然语言指令即可调用,符合当前 AI 工作流趋势。

核心功能

三种输入模式:

  • B-roll(纯生成):输入主题文本,全自动生成内容
  • A-roll(真人改造):上传真人讲解视频,保留面部和口型,重新渲染为拼贴风格
  • C-roll(产品植入):上传静态照片(如产品图),作为贴纸锚定在每帧拼贴中,周围内容自动生成

六步生产流水线:

  1. 分镜规划:根据主题生成 beats.json(人工审批关卡 1)
  2. 风格试验:同一分镜渲染 3-4 种主题风格供选择(人工审批关卡 2)
  3. 关键帧生成:每个分镜生成一张完整拼贴海报
  4. 动画合成:海报整体动画化或拆解为零件逐帧组装
  5. 声音制作:AI 配音 + 背景音乐生成
  6. 最终合成:ffmpeg 拼接视频、音频闪避、烧录字幕和水印

模型矩阵(通过 Atlas Cloud API 调用):

  • 海报生成:Google nano-banana-2
  • 动画:Gemini Omni Flash(通用内容)/ Kling Video O3 Pro(真人品牌内容)
  • 配音:xAI TTS-v1 / ByteDance seed-audio-1.0(声音克隆)
  • 配乐:MiniMax Music 2.6

安装

作为 AI 代理技能安装(以 Claude Code 为例):

# 方式 A:克隆到技能目录
git clone https://github.com/Alisa0808/vox-director.git ~/.claude/skills/vox-director

# 方式 B:下载 .skill 文件通过 UI 安装
# 下载 vox-director.skill 后在 Claude 技能界面导入

# 配置 API 密钥
export ATLASCLOUD_API_KEY="sk-..."

# 安装依赖
brew install ffmpeg  # macOS
pip install pillow

使用示例:

"制作一个介绍墨西哥街头美食的 Vox 风格视频,英文,16:9,15 秒"

代理会自动执行完整流程,最终输出到 out/<项目名>/final.mp4

适合谁

  • 内容创作者:快速产出高质量解说视频,无需专业团队
  • 营销团队:批量生成产品介绍、品牌故事视频
  • 教育工作者:制作知识科普短视频
  • AI 开发者:作为视频生成能力集成到自己的 AI 工作流

中国用户注意:Atlas Cloud API 需要稳定国际网络连接,建议先在控制台测试 API 可用性;配音模型理论支持中文但文档示例以英文为主,中文效果需实测;ffmpeg 需本地安装,Windows 用户需手动配置环境变量。

社区评价

暂无足量社区公开讨论,以下为基于项目本身的中立评估:

项目定位清晰,技术路线成熟(调用成熟商业 API 而非自研模型),降低了使用门槛。MIT 协议 + 详尽文档(包含中文版)显示出开源诚意。24 天获 996 stars 的增速说明市场需求真实存在,149 个 fork 表明已有开发者尝试二次开发。

潜在争议点:完全依赖 Atlas Cloud 付费 API,成本不透明且存在供应商锁定风险;作为"代理技能"的定位限制了非编码用户的使用场景;生成内容的版权归属(尤其商用场景)需用户自行确认 API 服务条款。

选型对比

vs Vox Media 人工制作流程:

  • Vox Director:分钟级产出,成本仅 API 费用,风格一致性高但创意灵活度受限于预设模板
  • 人工流程:周期数天,成本数千美元,可实现完全定制但难以批量化

vs 通用 AI 视频工具(Runway/Pika):

  • Vox Director:专注拼贴解说风格,全流程自动化,输出标准化
  • Runway 等:风格自由度高,需手动分步操作(脚本→分镜→生成→剪辑),适合艺术创作而非批量生产

vs 模板化视频工具(Canva Video/剪映):

  • Vox Director:AI 原生生成内容,每次输出独特
  • 模板工具:基于预设模板填充素材,产出同质化但操作门槛更低

已知坑

  1. API 依赖风险:Atlas Cloud 服务中断或调价直接影响可用性,建议关键项目保留人工备选方案
  2. 中文支持未充分验证:README 虽有中文版,但示例视频全为英文,中文配音质量、字幕渲染效果需实测
  3. 成本不透明:文档未披露单视频 API 调用成本,建议先用短视频测试费用
  4. 人工审批关卡:两次人工决策(批准分镜、选择风格)打断自动化流程,不适合完全无人值守场景
  5. 本地环境依赖:ffmpeg 版本兼容性问题可能导致合成失败,Windows 用户尤其需注意路径配置
  6. 真人内容局限:A-roll 模式虽保留真人面部,但 Gemini 视频编辑能力有限,复杂动作可能失真,需回退到 Kling 模型(成本更高)

来源: GitHub 仓库信息 + README 技术文档

安装方式:git clone + pip install pillow