只输入一个主题,就能自动生成解说视频?这款开源工具实测记录
【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor
晚上十点,你想发一条科普视频,却卡在第一步:文案不会写,配音没人录,配图不会画,剪辑更是两眼一抹黑。如果告诉你,有个开源项目只要输入一个主题,就能自动生成带语音解说的完整视频,你是不是想立刻试试?它就是 auto-video-generateor——一个把"写稿、配音、配图、合成"整条流水线串起来的自动视频生成器,而且从 v3 版本开始,整套流程几乎可以零成本跑通。
先看看它长什么样
打开网页,你会看到一排配置项:主题内容、提示词模板、图像大小与字体、语音人、语速、音量、音调。旁边一排按钮写着"生成故事""切分文本""合成语音""生成图像""创建记录""生成视频",外加一个"一键生成"。说白了,这一页就是一个分工明确的视频车间,每个环节都能单独开工,也能一键全流程。
没有它 vs 有了它
先算一笔老账。做一支 3 分钟的解说视频,传统路子大概是:写稿两小时,找素材图两小时,录音加剪辑一小时——半天时间搭进去,还不算中途推翻重来。
有了这个工具呢?你把主题输进去,几分钟后就能拿到一份 story.txt、几十段 wav 语音、几十张 png 配图,以及一支能直接播放的 mp4。中间任何一步不满意,不必从头再来:换一个音色重新合成、单独重生成某一张图、逐字修改某一句文案,都行。
它到底做了什么:一条四道工序的流水线
整个项目可以想象成一条小型生产线,核心代码在auto_video_generateor/video_generateor.py里,每道工序都是独立函数,既能单独跑,也能一键串起来。
- 写稿。
generate_story()把主题丢给大语言模型(默认 DeepSeek,v2 版可换百度千帆的 ERNIE-Speed),扩展成结构完整、有风格的解说词。提示词模板支持自定义,想要"深夜电台风"还是"新闻播报风"都随你。 - 分句。
split_text()用四级切分策略把长文切成几十个短句,保证每句长度适中,恰好对应一帧画面,免得一句念 20 秒、画面却一动不动。 - 配音。
synthesize_speech()调用豆包 TTS,音色表里躺着几十个选项:温柔淑女、影视解说小帅、新闻男声、小萝莉……连"说唱小哥"都有。语速、音量、音调全部可调。 - 配图。
text2image()把每句文案转成文生图提示词,按指定分辨率生成配图;add_subtitle()顺手把句子烧录成字幕压在图上。更贴心的是,万一免费图接口抽风,系统会自动降级成一张纯色字幕卡,保证流程不中断。 - 合成。
create_video()用 moviepy 把每段语音的时长映射到对应图片上,拼接成视频。合成前还有两道质检:is_video_renderable()检查片段能否渲染出帧,check_audio_video_sync()检查音画时长是否匹配,坏片段会被直接跳过。
举个例子。你想给自家产品做一支 60 秒介绍视频,输入产品名和一句话卖点,系统先写出解说词,再切分、配音、配图,最后合成成片。你只需要在"一键生成"上点一次,中间每道工序的产物都会存进素材目录,随时可以打开检查。
动手实测:照着跑一遍
先确认环境:Python 3 环境即可;如果你要用 PPT 转视频功能,还得额外安装 LibreOffice 并配置好环境变量。
git clone https://gitcode.com/gh_mirrors/au/auto-video-generateor cd auto-video-generateor pip install -r requirements.txt然后编辑根目录的config.env,把DEEPSEEK_API_KEY(文本生成)、DOUBAO_TTS_APPID和DOUBAO_TTS_ACCESS_TOKEN(语音合成)填成你自己的值。这些 key 不填程序也能启动,只是生成时会报错。
启动时可选四个版本:无参直接跑默认的 v4(免费+校对版),也可以python main.py 1(极简版)、2(千帆版)、3(免费版)、4(校对版)。
python main.py浏览器打开http://127.0.0.1:9020,登录账号密码随意——只要密码和用户名相同即可(大小写不敏感)。接着在输入框里填主题,点"一键生成",耐心等一会儿,逐条检查生成的资源,确认无误后再点"生成视频"。
几个常见报错和解决办法:
| 现象 | 原因与对策 |
|---|---|
| 生成故事时卡住或提示 key 无效 | 检查config.env是否填对、网络能否访问 DeepSeek 接口 |
| 语音合成失败 | 豆包 APPID 与 Token 未配置;旧教程里的 edge-tts 已不可用,代码默认走豆包 TTS |
| 图像生成慢或只出文字卡 | 免费文生图接口偶发超时,系统会自动降级成字幕卡,稍后单独点"生成图像"重试即可 |
| moviepy 安装报错 | 依赖清单里锁定moviepy==1.0.3,不要手动升级大版本 |
它适合谁
- 日更的自媒体创作者:输入当天热点,先拿到一支带文案和配音的草稿,再微调成片,比从零开始省下大半时间。
- 老师和课程开发者:把讲义做成 PPT,在备注里写好逐字稿,用 PPT 转视频功能一键生成讲解视频;
auto_video_generateor/ppt_utils.py甚至支持 PDF 版 PPT。 - 电商运营:几十个商品要各配一支介绍视频,把商品信息批量填进去,剩下的交给流水线。
- 想搞懂 AI 工具链的学生:v1 极简版把 Gradio、大模型、TTS、文生图、moviepy 拆成几步,就是一份现成的教学 demo。
两个容易被忽略的好用细节
一是**"代号"即项目文件夹**。每个代号对应mnt/materials/用户名/代号/下的完整素材:story.txt、text/、audio/、image/、resource/、video.mp4、metadata.json,整整齐齐。做系列视频时复用同一个代号,下次打开点"加载参数""加载资源",素材秒回,不用重新生成一遍,既省钱又省时间。
二是v4 的逐帧校对。生成的每一帧,文本、语音、图片都分开管理:文案能改,语音能换音色重生成,音频片段还能切分、合并,图片可以单独重跑,全部确认后再合成视频。这意味着你改一行字幕,不必把整条流水线重跑一遍,对追求质量的创作者来说非常实用。
下一步做什么
把仓库 clone 下来,先跑一支 1 分钟的视频试试手,再从 v3 免费版升级到 v4 校对版体验完整工作流。一次只改一个参数,看看它对成片的影响,你对"AI 视频生成"这件事的理解会清晰很多。
【免费下载链接】auto-video-generateor自动视频生成器,给定主题,自动生成解说视频。用户输入主题文字,系统调用大语言模型生成故事或解说的文字,然后进一步调用语音合成接口生成解说的语音,调用文生图接口生成契合文字内容的配图,最后融合语音和配图生成解说视频。项目地址: https://gitcode.com/gh_mirrors/au/auto-video-generateor
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考