三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Pixelle-Video 全自动短视频引擎指南:零基础 5 分钟生成第一条 AI 视频

Pixelle-Video 全自动短视频引擎指南:零基础 5 分钟生成第一条 AI 视频

Pixelle-Video 全自动短视频引擎指南:零基础 5 分钟生成第一条 AI 视频

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

上周五晚上,我在 Pixelle-Video 的输入框里敲下「为什么我们还没找到外星文明」,然后转身去冲了杯咖啡。回来时,一条带解说、AI 配图、背景音乐、1080x1920 竖屏的完整视频已经躺在输出区,全程约 5 分钟,一个剪辑动作都没有。这就是这款开源 AI 全自动短视频引擎的日常:你出主题,它出成品。

60 秒初体验:从零跑通第一条视频的最短路径

别急着研究安装文档,最短路径其实只有四步:

  1. 下载 Windows 一键整合包并解压(它内置了 Python、ffmpeg 等全部依赖);
  2. 双击start_web.bat,浏览器自动打开 http://localhost:8501;
  3. 展开「⚙️ 系统配置」,选一个 LLM 预设(比如通义千问)并填入 API Key,保存;
  4. 在左侧输入框敲一个主题,比如「为什么要养成阅读习惯」,点「🎬 生成视频」。

从源码跑也一样简单:克隆项目后执行uv run streamlit run web/app.py,其余流程完全相同。接下来你会看到实时进度条依次走过「生成文案 → 生成配图 → 合成语音 → 合成视频」,一个 5 分镜的视频大约 2-5 分钟出炉,成片自动保存在output/目录。整个过程没有任何一处需要你动手剪辑。

核心能力地图:它到底帮你做了哪些事

内容生成能力:文案不用自己写一个字LLM(大语言模型,负责理解和生成文字的人工智能)会把你输入的主题自动拆成带画面感的分镜脚本,每句话对应一帧画面。支持通义千问、GPT、DeepSeek 和完全本地运行的 Ollama;如果你已有现成稿子,切到「固定文案内容」模式直接粘贴即可。

视觉表现能力:每个分镜配一张 AI 插图系统为每个分镜生成一张配图,再套进 HTML 模板合成画面。templates/目录下按竖屏、横屏、方形分类了 30 多套模板,从治愈系到霓虹灯风格应有尽有,还可以用提示词前缀统一全片画风。

语音交互能力:配音和 BGM 一键到位内置 Edge-TTS 免费语音、Index-TTS 声音克隆等主流 TTS(文字转语音)方案;把音乐文件丢进bgm/文件夹,界面里就能直接选用背景乐。

批量生产能力:一晚上产出 20 条不是梦历史记录页、批量创建任务、ComfyUI/RunningHub 云端工作流随时切换,还能扩展数字人口播、图生视频、动作迁移等进阶流水线。

一个完整故事线:美食博主小林的一夜

我叫小林,运营一个小红书美食号。过去一条 1 分钟的视频,写脚本 1 小时、找素材 2 小时、剪辑 2 小时,一周更 3 条就快被榨干。

上个月我开始用 Pixelle-Video 做「深夜食堂」系列:

  • 第 1 步,把本周想讲的 5 个菜名一次性输进批量模式,每行一个主题;
  • 第 2 步,视觉模板固定选image_modern.html,保证每期画面风格统一;
  • 第 3 步,上传一段 30 秒的真人试吃录音作为参考音频,克隆出「我自己的声音」;
  • 第 4 步,点生成,然后去睡觉。

第二天醒来,5 条成品视频安静躺在历史记录页。单条成本约 1-5 分钱(通义千问配 RunningHub 云端),我却省下了每周 20 多个小时。发布后评论区有人问「小林你声音怎么变好听了」,其实那本来就是 AI 克隆的。

配置速查表:三种方案照着抄就行

方案适合人群关键配置大致成本一句话点评
完全免费有本地显卡Ollama + ComfyUI 本地0 元数据不出门,最省钱
云端经济无显卡、预算有限通义千问 + RunningHub每条约 1-5 分性价比之王
专业混合追求画质与效率GPT + 直连 API 媒体模型按量付费灵活但要多点耐心

新手最容易配错的两处:第一,把config.example.yaml复制为config.yaml时只填了 api_key 忘了 base_url,LLM 会一直报错;第二,选图像工作流时,带runninghub/前缀的要填 RunningHub API Key,带selfhost/前缀的要有本地 ComfyUI,混着用就会卡死在「生成配图」这一步。

高手才知道的 3 个技巧

  1. 用参考音频克隆专属音色现象:同一段解说,默认音色和你自己的声音,完播率天差地别。原理:Index-TTS 支持声音克隆,只需一段短音频作声线样本。操作:在语音设置里上传参考音频(MP3/WAV),再选择支持克隆的 TTS 工作流。效果:视频开口就是「你」的声音,个人辨识度拉满。

  2. 用提示词前缀锁死全片画风现象:同一个主题生成的两张配图,风格可能悄悄漂移。原理:prompt_prefix 会在每次生图前自动拼上你写的风格描述。操作:在config.example.yaml的 image.prompt_prefix 填上类似 "Minimalist black-and-white matchstick figure style illustration, clean lines" 的英文描述。效果:整条视频像出自同一个设计师之手,观感立刻专业。

  3. 让一张静态照片动起来现象:老照片和产品图只能配文字,画面显得干。原理:图生视频与动作迁移流水线能把静态图像变成动态镜头。操作:在扩展工作流中上传参考视频和一张照片。效果:历史人物能「开口演讲」,产品图能变成动态展示,一条视频瞬间有了高级感。

延伸生态:想深入可以从这些入口走

  • 官方文档:docs/zh/覆盖安装、配置、快速开始、自定义风格、声音克隆等完整教程,遇到问题先翻 docs/zh/faq.md
  • 模板库:templates/ 按 1080x1920、1920x1080、1080x1080 分类,改 CSS 就能定制品牌风格
  • 预置工作流:workflows/runninghub 与 workflows/selfhost 提供了图片、视频、TTS 全套 JSON 工作流,懂 ComfyUI 还能自己加
  • 音色清单:pixelle_video/tts_voices.py 列出了所有支持的语音,配 TTS 时先来这挑

现在就动手:你的第一条视频正在等你

Pixelle-Video 最适合「内容很多、时间很少」的人——知识博主、电商运营、想低成本起号的新手。现在就动手:git clone https://gitcode.com/GitHub_Trending/pi/Pixelle-Video,然后运行uv run streamlit run web/app.py(Windows 用户直接双击start_web.bat)。找一个你早就想讲的主题输进去,等你那杯咖啡放凉之前,第一条完全属于你的 AI 视频就该出锅了。

【免费下载链接】Pixelle-Video🚀 AI 全自动短视频引擎 | AI Fully Automated Short Video Engine项目地址: https://gitcode.com/GitHub_Trending/pi/Pixelle-Video

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表