WorkBuddy 获客自动化,字幕方案我替你选好了
我花了两周时间,把市面上能用的字幕方案全试了一遍。
大家好,我是小虎。
上周训练营有个学员跟我说,他的视频自动化链路全跑通了,脚本自动写、配音自动出、画面自动生成,但最后一步加字幕,怎么弄都丑,丑到他自己都不想发。
我一看他发的截图,好家伙,白色宋体小字贴在画面最底下,没描边没阴影没动画,活脱脱 2005 年盗版 DVD 的感觉。
我说你用的什么加的字幕?他说 FFmpeg,一条命令烧进去的。
我说那就对了。FFmpeg 能自动化,但它出来的字幕就是长这样。
这件事让我意识到一个问题。做短视频自动化的人,大部分把字幕当成了「加个 SRT 就完事」的简单环节。但真正卡住你的,不是识别准不准,是字幕长什么样。
识别这件事,2026 年早就不是问题了。百炼 FunASR 一小时才 0.13 元,edge-tts 配音还免费带时间戳,Whisper 本地跑完全不要钱。随便选一个都能打。
但识别出来的文字,怎么让它好看地出现在画面上?这才是真正的坑。
我花了两周时间,把市面上能用的字幕方案全试了一遍。今天把结果给你,5 款工具,逐个说清楚,最后告诉你我选哪个、为什么选、怎么搭。
这次对比的 5 款工具
先列出来,心里有个数。
- 1.剪映(字节跳动)
- 2.FFmpeg(开源命令行)
- 3.妙幕 SmartSub(开源桌面工具)
- 4.Remotion(开源代码渲染)
- 5.ChatCut(第三方 Web 平台)
下面逐个说。每款我会讲清楚它是什么、怎么接入、字幕效果怎么样、能不能自动化、价格多少、适合谁。说完一个再说下一个,不跳着来。
剪映
剪映不用我多介绍了吧?字节跳动的,APP 下载量 1.2 亿,国内做短视频的人手机里基本都有。
它的字幕能力确实是开箱即用的天花板。你录一段视频或者导入一段音频,点「识别字幕」,几秒钟就出来了。中文普通话识别率号称 98.5%,我实测下来确实很高,日常说话基本不出错。
识别完以后,花字模板几百种。逐字弹跳、打字机效果、描边阴影、渐变背景条、霓虹发光,你见过的短视频上那些好看字幕,大部分就是剪映出的。点一下模板就套上去了,不用写任何东西。
还能做多语言翻译字幕,一键把中文翻成英文、日文,字幕直接替换。
价格方面,手机端基本免费,专业版有些高级花字模板要会员,但日常够用。
听起来完美对吧?但问题来了。
剪映没有 API。一个字都没有。
它的字幕能力锁在客户端里,只能手动操作。你没办法写一行代码让剪映自动给视频加花字。WorkBuddy 调不了它,n8n 调不了它,Python 调不了它,任何自动化框架都调不了它。
这意味着什么?你每天做 10 条视频,每条都要打开剪映,手动点识别字幕,手动选花字模板,手动调位置大小。10 条就是 10 次手动操作。做 100 条就是 100 次。
这不是自动化,这是半自动化的体力活。
而且剪映的工程文件是私有格式,你没法用代码批量修改字幕内容。想改一个字?打开剪映,找到那条视频,手动改。
所以剪映的定位很清楚。单条视频手动加字幕,效果最好,没有之一。但如果你想做批量、做流水线、做一人公司视频工厂,剪映帮不了你。
FFmpeg
FFmpeg 是开源的命令行音视频处理工具,做视频自动化的人基本都绕不开它。
字幕方面,它能做的事情很简单。你给它一个 SRT 或者 ASS 字幕文件,一条命令就能把字幕烧进视频画面里。完全命令行操作,能被任何脚本调用,自动化能力满分。
ffmpeg -i input.mp4 -vf "subtitles=subs.srt" output.mp4就这一行,字幕就烧进去了。
但效果呢?默认是白色 Arial 字体,没有描边,没有阴影,没有背景,没有动画。贴在画面底部,小得跟蚂蚁似的。你看过那种盗版电影的字幕吗?就那个感觉。
01_ffmpeg
能不能调?能。FFmpeg 支持 ASS 字幕格式,ASS 可以设置字体、字号、颜色、描边、阴影、位置,甚至简单的淡入淡出动画。但 ASS 的语法极其反人类,写一个带描边加阴影加居中加淡入的字幕样式,你得查半天文档,写一堆标签。
而且 ASS 的上限就在那了。逐字弹跳?做不到。当前词高亮?做不到。毛玻璃背景条?做不到。弹簧动画?想都别想。
价格方面,FFmpeg 完全免费,开源,本地运行,不联网。
所以 FFmpeg 的定位也很清楚。自动化能力满分,但渲染效果停在 2005 年。适合「有字幕就行,好不好看无所谓」的场景,比如内部培训视频、监控录像加时间戳这种。做获客短视频?你自己看了都不想发。
妙幕 SmartSub
妙幕是一个开源的桌面字幕工具,GitHub 上能找到,跨平台,Windows 和 Mac 都能用。
它做的事情比较完整。从音视频生成字幕、翻译、校对、到烧录,一条龙。支持批量处理,支持 GPU 加速。
最厉害的是它支持 6 种 ASR 引擎。whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、Whisper CLI,你本地装了哪个它就能调哪个。识别完以后可以在界面里校对修改,改完直接烧录。
字幕样式方面,比 FFmpeg 强不少。字体、大小、颜色、描边、阴影、位置都能调,还有样式预设。比纯 SRT 好看,但跟剪映的花字比还是差一截。没有逐字动画,没有弹跳效果,就是静态样式调得好一点。
烧录方式支持两种。硬字幕(直接烧进画面)和软字幕(封装成可开关的字幕轨道)。
价格完全免费,开源,本地运行,数据不出你的电脑。
但妙幕有个致命问题。它是 GUI 工具,图形界面的。你得用鼠标点,用眼睛看,手动操作。WorkBuddy 调不了它,脚本调不了它,自动化链路里塞不进去。
它适合什么场景?你有一批视频需要批量加字幕,但不需要全自动。比如你手动跑一下妙幕,它帮你批量识别加烧录,省得你一条一条在剪映里点。比纯手动快,但不是真正的自动化。
Remotion
Remotion 是一个开源框架,用 React 加 CSS 来写视频。听起来很疯狂对吧?用写网页的方式做视频。但 2026 年它已经非常成熟了,GitHub 上 star 数很高,社区活跃。
字幕方面,Remotion 的能力是降维打击级别的。因为字幕样式本质上就是 CSS,动画本质上就是 JavaScript。你能用 CSS 写出来的任何效果,Remotion 都能渲染成视频帧。
02_remotion
逐字弹入动画?spring 物理弹簧,几行代码。当前词金色高亮?条件渲染,一个 if 的事。毛玻璃背景条?backdrop-filter 一行 CSS。渐变描边?text-shadow 叠几层。打字机效果?逐帧控制显示字数。
上限不是工具决定的,是你的 CSS 水平决定的。而 CSS 这东西,比 ASS 字幕格式好学一百倍。
自动化方面,Remotion 本身就是代码,天然在自动化链路里。WorkBuddy 调它跟调任何一个 Node.js 脚本没有区别。ASR 出词级时间戳,喂给 Remotion 组件,组件按时间戳逐词渲染,最后输出 MP4。全程零手动。
价格完全免费,开源,本地渲染。唯一需要的是 Node.js 环境和一个 Chrome 浏览器(渲染用)。
缺点呢?有,说实话。
第一,你得会写一点 React 和 CSS。不是说要精通,但基本的组件概念、JSX 语法、CSS 属性你得知道。如果你连 HTML 都没碰过,上手会有学习曲线。不过话说回来,你在做视频自动化,说明你已经接受了「用代码代替手动」这个前提。
第二,首次配置需要装 Node.js、装 Remotion、配置 Chrome 路径。国内网络下载 Chromium 经常卡住,需要用本地 Chrome 绕过。我后面实操部分会讲怎么解决。
第三,渲染速度取决于你的电脑配置。一条 12 秒的 1080x1920 视频,我的电脑大概渲染 30 秒到 1 分钟。不算快,但能接受。
Remotion 的定位。自动化能力满分,渲染效果天花板,但有一定技术门槛。适合已经在用代码做视频自动化的人,字幕环节用 Remotion 补齐,整条链路就闭环了。
ChatCut
ChatCut 是一个第三方的 Web 端 AI 视频编辑器,公司叫 ChatCut Inc。,跟剪映没有任何关系。
它的思路比较新。你用自然语言跟它说话,它帮你剪视频。比如你说「把第三段删掉,加个字幕」,它就帮你做了。
字幕方面,它支持近 100 种语言的自动转录,能识别不同说话人,时间码精确到帧。导出格式包括 MP4、XML、SRT 字幕、Word 文档等。
它有一个开源的 Agent 插件(GitHub 上能找到),还提供了 MCP 接口,理论上 AI Agent 可以调用它。
但实际用下来,有几个问题。
第一,核心剪辑能力跑在它的云端,不是真正开源。插件只是调用入口,数据要过它的服务器。做获客视频的话,内容安全是个考量。
第二,字幕样式能力没有公开文档,不确定能不能自定义花字效果。从演示来看,字幕样式比较基础,没有剪映那种丰富的花字模板。
第三,价格没公开,需要联系商务。对个人创作者来说,这是个不确定因素。
ChatCut 的定位。思路很新,对话式剪辑是未来方向,但目前字幕能力不够成熟,价格不透明,数据过云端。适合尝鲜体验,不适合放进生产链路。
5 款工具推荐星数
说完了,给个总结。5 星满分。
说明一下这个评分逻辑。
剪映识别和渲染都是满分,但自动化能力是 1 星,因为完全没有 API。如果你只做单条视频,剪映是 5 星。但如果你要做批量、做流水线,它只能给 3 星。
FFmpeg 自动化满分,但渲染效果 1 星,识别能力 2 星(它本身不做识别,得配合其他 ASR 工具)。适合「有就行」的场景。
妙幕识别和渲染都还行,但自动化 2 星,因为是 GUI 工具。适合批量手动处理。
Remotion 五项全高,唯一扣在上手难度 4 星。但一旦学会了,就是字幕自动化的终局方案。
ChatCut 思路新但不够成熟,价格不透明,暂时观望。
我的选择是 Remotion。 理由很简单,做短视频获客自动化,字幕环节必须能进流水线,同时效果不能丑。同时满足这两个条件的,只有 Remotion。
怎么用 Remotion 搭字幕自动化
好,选型说完了,下面讲怎么搭。我尽量说得简单,没写过代码的也能跟着做。
整条链路就三步。配音加时间戳、搭 Remotion 项目、渲染出片。
配音加时间戳
用 edge-tts,免费,一行命令同时出配音和字幕时间戳。
先装 edge-tts。
pip install edge-tts装好以后跑这条命令。
edge-tts --voice zh-CN-YunxiNeural --rate="+5%" --text "你的文案内容" --write-media voice.mp3 --write-subtitles subs.vtt跑完你会得到两个文件。voice.mp3 是配音,subs.vtt 是带时间戳的字幕。
打开 vtt 文件看一下,长这样。
1 00:00:00,100 --> 00:00:02,157 大家好,我是小虎。每句话的起止时间都有了。后面 Remotion 就靠这个时间来同步字幕动画。
😅 有个坑。edge-tts 给的是句级时间戳,不是词级。要做逐词动画,得自己按字数比例拆。比如一句话 2 秒,10 个字,那每个字大概 0.2 秒。不需要精确到毫秒,视觉上看不出差别。
搭 Remotion 项目
在 D 盘建个文件夹(C 盘空间紧张的朋友注意),初始化项目。
mkdir D:\subtitle-demo cd D:\subtitle-demo pnpm init pnpm add remotion @remotion/cli react react-dom pnpm add -D typescript @types/react把 voice.mp3 复制到 public 文件夹里。
然后在 src 目录下写一个字幕组件。核心逻辑很简单。每个词是一个 span 标签,用 spring 动画控制弹入,当前正在读的词变金色,其余白色。整行字幕加个半透明背景条。
我直接给你完整代码,复制就能用。
// src/AnimatedCaptions.tsx import React from 'react'; import {AbsoluteFill, Audio, staticFile, useCurrentFrame, interpolate, spring, useVideoConfig} from 'remotion'; // 把vtt时间戳换算成帧数(秒数×30),按字数比例拆词 const captionLines = [ { startFrame: 3, endFrame: 65, words: [ {word: '大家好', startFrame: 3, endFrame: 30}, {word: '我是', startFrame: 30, endFrame: 48}, {word: '小虎', startFrame: 48, endFrame: 65}, ], }, // 后面的句子同理,按vtt时间×30填进来 ]; export const AnimatedCaptions = () => { const frame = useCurrentFrame(); const {fps} = useVideoConfig(); return ({captionLines.map((line, i) => { if (frame < line.startFrame || frame > line.endFrame + 10) return null; return (
{line.words.map((w, j) => { const appeared = frame >= w.startFrame; const active = frame >= w.startFrame && frame <= w.endFrame; const p = spring({frame: frame - w.startFrame, fps, config: {damping: 12, stiffness: 200}}); return ( <span key="{j}" style="{{;" display:="" 'inline-block',="" fontsize:="" 52,="" marginright:="" 6,="" opacity:="" appeared="" ?="" p="" :="" 0,="" transform:="" `scale(${appeared="" 0.6="" +="" 0.4="" *="" 0})`,="" color:="" active="" '#ffd700'="" '#fff',="" textshadow:="" '0="" 0="" 20px="" rgba(255,215,0,0.8)'="" 2px="" 4px="" rgba(0,0,0,0.9)',="" fontweight:="" 900="" 700,="" fontfamily:="" '"microsoft="" yahei",="" sans-serif',="" }}="">{w.word} ); })}
); })}
); };
这段代码做了什么?每个词弹入的时候有个从小变大的弹簧动画,正在朗读的词变成金色加发光,其余词白色。整行有个半透明黑底。字号 52px,在竖屏手机上看得很清楚。
想调样式?改 CSS 就行。字号改 fontSize,颜色改 color,动画快慢改 damping 和 stiffness。全是前端那套东西,没有黑魔法。
渲染出片
一条命令。
npx remotion render src/index.ts AnimatedCaptions out/result.mp4 --browser-executable="C:/Program Files/Google/Chrome/Application/chrome.exe"😅 这里有个坑。Remotion 默认会下载一个 Chromium 浏览器,国内网络经常卡住。加--browser-executable参数指向你本地的 Chrome 或 Edge,跳过下载,秒开。
渲染完打开 result.mp4,你应该看到深色背景上,字幕逐词弹入,当前词金色高亮,配音同步播放。
验证方式很简单。播放视频,看字幕出现的时间和配音是不是对齐的。如果有偏移,回去改 captionLines 里的帧数就行。
效果对比
我做了个对比视频。左边 FFmpeg 默认字幕,右边 Remotion 动态字幕。同一段配音,同一段文案。
03_comparison
左边是白色宋体小字,无动画无背景,像 2005 年的盗版碟。右边是逐词弹入加金色高亮加半透明背景条,像 2026 年的抖音爆款。
差距不在内容,在渲染层。
成本账
最后算个账。
edge-tts 配音,免费。Remotion 渲染,本地跑,免费。整条链路零额外费用。
如果你用百炼 FunASR 做识别(比如你有真人录音需要转字幕),0.13 元一小时,一条两分钟的视频不到半分钱。
跑一条是这个成本,跑一百条也是,跑一千条还是。链路搭好以后,边际成本趋近于零。
对比一下手动方案。剪映手动加字幕,一条 3 到 5 分钟。一天 10 条就是半小时到一小时的纯体力活。一个月下来十几个小时花在「点字幕」上。
自动化方案把这些时间还给你了。
但是,上面这些你其实都不用自己做
我知道你看到代码块的时候心里咯噔了一下。
React? CSS? spring 动画?我一个做内容的,为什么要学这些?
说得好。你不需要学。
上面那些代码、那些命令、那些配置,是我替你趟过的路。我写这篇文章的目的,不是让你自己去学 Remotion,是让你知道这条路存在、效果能打、成本为零。
真正干活的时候,你只需要打开 WorkBuddy,跟它说几句话。
比如你可以这样说。
「帮我用 edge-tts 给这段文案配音,声音用云希,语速加 5%。然后用 Remotion 做逐词弹入的动态字幕,当前词金色高亮,背景半透明黑底,字号 52,竖屏 1080x1920。渲染成 MP4 给我。」
WorkBuddy 会自己装环境、写代码、跑命令、出视频。你全程不需要碰一行代码。
它背后调的就是我上面讲的这套链路。edge-tts 出配音加时间戳,Remotion 组件渲染逐词动画,Chrome 渲染输出 MP4。但这些细节你不用管,WorkBuddy 替你管。
你只管给文案,它给你成品视频。带配音的,带动态字幕的,能直接发的那种。
这才是真正的自动化。不是你学会了所有工具,而是你只需要说一句话,工具自己串起来干活。
写在最后
整条链路串起来看。脚本有素材库,配音有 edge-tts,画面有分镜图加即梦,视频渲染有 Remotion,字幕也是 Remotion。每个环节都能被 WorkBuddy 一句话调起来。
字幕是这条链上最后一个补齐的环节。补上以后,从文案到成片,全程零手动。
你一个人,一台电脑,一个 WorkBuddy,就是一个视频工厂。
以前做 10 条视频要一天,现在做 10 条视频要 10 分钟。省下来的时间,拿去谈客户、做产品、陪家人,哪个不比「点字幕」值钱?
字幕不是视频自动化的配角,是成片的最后一道门面。而这道门面,现在一句话就能搞定。
我还在持续更新短视频获客自动化的系列内容。想深入聊这块的话,后台私信我,我拉你进交流群。
群里都是正在做 AI 短视频的朋友,大家一起碰方法,比一个人闷头摸索强太多了。
想,都是问题。干,就对了。