AI Video Generator · All-in-One Video Production Platform
三条独立生产线:产品介绍视频 / 短剧草稿 / 数字人口播,从文案到成片一站式 AI 视频工厂
AI 视频制作全能平台(AI Video Generator)是一套覆盖「产品介绍视频、短剧低成本草稿、数字人口播」三条独立生产线的全栈 AI 视频工厂。系统基于 React + FastAPI 前后端分离架构,集成 LLM 文案生成、Edge-TTS 语音合成、Remotion 电影感渲染、WanGP/face_swap/lip_sync 数字人管线及内置浏览器精修编辑器,支持 Web / Electron 桌面端 / PWA 移动端多端访问,并提供 GPU 集群管理与任务队列监控后台。从输入一句产品描述到输出 1080P 带字幕的成品视频,全链路自动化。






把"做视频"拆成三条专业生产线,每条聚焦一种场景、互不干扰;底层共享 GPU 集群与资产库,上层各自优化体验。
产品介绍视频走 Remotion 确定性模板(高质量可复用),短剧走剧本→分镜→Wan 逐镜头生成(快速试错低成本),数字人走 TTS+换脸+唇同步(口播类内容一条龙)。三条线共享同一套用户体系、资产库和 GPU 集群。
LLM 自动生成口播文案 → Edge-TTS 合成语音(免费多音色)→ ffmpeg/Remotion 渲染视频 → 自动质量检查(时长/覆盖率/一致性)。用户只需输入产品描述或上传素材,其余全自动。
React 前端同时支持 Web 浏览器、Electron 桌面应用(原生菜单/文件对话框/自动更新)和 PWA 移动端(添加到主屏幕/离线缓存/响应式),一套代码三端运行。
服务端管理页面实时监控 GPU 服务器集群状态与任务队列。支持 face_swap / lip_sync / wan_draft 等多种 GPU 能力标签,任务按能力路由到对应节点,心跳检测自动下线故障节点。
每条生产线针对一类视频场景做了深度优化,从输入到输出形成闭环。
Remotion 确定性模板渲染,高质量可商用。支持竖屏 1080×1920 / 横屏 1280×720,时长 15-90 秒可配。LLM 生成口播文案 → TTS 多音色合成 → BGM 自动匹配(9 种情绪→5 首曲库)→ ASS 字幕烧录 → 质量自动检查。
剧本→分镜→逐镜头 Wan 生成→草稿看片的快速试错流水线。输入剧本前提(≤200 字)→ 自动分镜 → Wan v12 / 本地 WanGP 渲染逐镜头 → 草稿层快速出片 / 后端精修 / 自动筛选镜头。适合前期创意验证。
TTS → face swap 换脸 → lip_sync 唇形同步 → 降噪 → BGM → 字幕 → 导出 1080P MP4 的完整数字人管线。支持自定义数字人形象(上传参考图训练)、绿幕抠图导出透明 WebP、多音色切换(1080P/720P)。
基于 Remotion 的在线视频编辑器,无需安装任何软件。支持 15+ 格式媒体导入、多轨时间线编辑、画布属性微调(位置/尺寸/旋转/不透明度/锚点)、预览帧精确跳转、导出 MP4。
三条线的产出统一在「我的作品」中管理,按生产线分 Tab,每条记录显示缩略图/标题/状态标签(Draft ready/Refined/Completed)/时间戳,支持预览/精修/下载/批量模板精修。
GPU 集群管理(服务器注册/能力标签/心跳检测/在线状态/下线删除)、任务队列监控(任务 ID/能力类型/关联任务/排队/完成/错误日志)、用户管理、仪表盘总览。
以产品介绍视频线为例,从输入产品描述到输出 1080P 成品视频的全链路流程。
从架构设计到用户体验的核心指标沉淀。
不是简单调用 API,而是把视频生产的每个环节工程化、可观测、可管控。
三条生产线共享用户认证/资产库/GPU 集群/任务队列等基础设施,但各自的 UI 流程、渲染引擎和参数配置完全独立——加新线不影响已有线。
TTS → face swap → lip sync → denoise → subtitle → export 全链路自研集成,不依赖外部 SaaS 平台,数据自主可控,成本近乎为零(Edge-TTS 免费)。
标准场景走 ffmpeg 快速合成(秒级出片),高要求场景走 Remotion 电影感模板(高帧率/高设计感/镜头卡配方),按需选择不浪费算力。
基于 Remotion 的在线编辑器让用户无需离开浏览器即可完成导入/剪辑/调参/导出全流程,降低非专业用户的视频后期门槛。
把技术能力转化为可量化、可复用的业务价值。
该产品的介绍内容已基于内部资料整理上线,以下为后续可继续深化的方向:
浏览贤码智能在其他领域的 AI 产品与解决方案