三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Buzz 音频转写完全指南:零基础搞定本地语音转文字,从安装到导出字幕

Buzz 音频转写完全指南:零基础搞定本地语音转文字,从安装到导出字幕

Buzz 音频转写完全指南:零基础搞定本地语音转文字,从安装到导出字幕

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

凌晨一点,剪辑师小李盯着屏幕上一段三小时的采访录音发愁——明天一早就要交字幕稿,手动听写根本来不及。如果你也经历过类似的时刻,那么 Buzz 值得你花五分钟认识。这是一款在本地离线运行的语音转文字(音频转写)工具,基于 OpenAI 的 Whisper 模型,能把音频和视频转成文字、字幕甚至另一种语言,全程不联网、不上传,数据只留在你自己的电脑里,而且免费开源。

这篇指南不堆代码、不讲原理,只讲三件事:Buzz 能解决什么、怎么开始用、怎么用得更顺手。读完之后,你今晚就能把那段三小时的录音变成可交付的字幕稿。

先花一分钟看懂:Buzz 和市面上其他转写工具到底差在哪

市面上并不缺语音转文字产品,但它们的取舍各不相同。把你常见的几种选项摆在一起看,Buzz 的位置就清楚了:

方案数据是否出本地成本准确率适合谁
在线云转写服务上传服务器按量付费或会员高(中文较好)不介意上传隐私,追求省事
手机自带语音助手依赖厂商免费一般,长度受限随手记个几分钟便签
外包人工转写完全离线按分钟收费最高预算充足、要求 100% 准确
Buzz 本地转写完全离线免费高,可选模型调节在乎隐私、要批量、要字幕格式

换句话说:如果你只是偶尔转一段两分钟的语音,手机上随便一个工具就够;但如果你每周都要处理会议录音、采访素材、课程视频,又不想把内容传到别人的服务器上,Buzz 几乎是唯一兼顾"免费 + 离线 + 专业格式导出"的选项。

它的独特价值可以概括成三句话:

  • 离线:断网也能跑,录音内容不出你的电脑,适合会议纪要、访谈这类敏感素材;
  • 多后端:同一套界面背后,可以切换 Whisper、Whisper.cpp、Faster Whisper、Hugging Face 模型甚至 OpenAI 云端 API,想要本地自由还是云端省电,自己说了算;
  • 跨平台:Windows、macOS、Linux 都有安装包,还提供了命令行接口方便自动化。

新手起步:三十分钟跑通你的第一次转写

第一关不是选模型,而是先装上、跑起来。

首次安装时的常见坑

Buzz 在 Windows 和 macOS 上通过安装包分发,注意两点:Windows 版本未签名,安装时系统会弹警告,选择"更多信息 → 仍要运行"即可,这是所有个人开发者软件的常态,不是病毒;Linux 用户可以用 Flatpak 或 Snap 一条命令装好:

# Flatpak 方式 flatpak install flathub io.github.chidiwilliams.Buzz # Snap 方式(先补依赖再安装) sudo apt-get install libportaudio2 libcanberra-gtk-module libcanberra-gtk3-module sudo snap install buzz

Python 开发者还有更轻的选择,用 pip 安装后直接命令行启动:

pip install buzz-captions python -m buzz

三分钟配置好第一次自动转写

启动后你会看到一个干净的任务列表界面,工具栏上的加号按钮就是入口。点击它(或用快捷键 Ctrl/Cmd+O)选中一段音频或视频,然后按下面的顺序把参数过一遍:

  1. 任务类型:选"转录"(保留原语言),或"翻译"(转成英文);
  2. 语言:建议手动指定,比如中文填zh,别偷懒用自动检测(原因后面避坑部分细说);
  3. 模型:第一次体验用basesmall足够,跑得动、听得清;
  4. 运行:点"运行",任务列表里会实时显示进度百分比。

第一次转写完成后,双击任务行就能看到结果——每一段文字都带开始和结束时间,底部还有播放器可以对照着听。

选模型其实是选"翻译的资历"

Whisper 系列模型从 tiny 到 large,大小、速度、准确率依次上升。你可以把它想象成请翻译:实习生便宜但容易出错,资深专家贵但靠谱,日常沟通请个普通员工就够了。实操上:

模型相对速度准确率推荐场景
tiny / base中等实时转写、快速出草稿
small良好日常会议、普通播客
medium优秀需要交稿的专业内容
large最慢顶尖学术访谈、术语密集素材

记住一条经验:先拿small试跑,觉得不满意再升到medium,而不是一上来就上large干等半小时。模型在首选项 → Models标签页里管理,下载、删除、加自定义模型链接都在这里。

日常熟练:把转录结果从"能看"变成"能用"

跑通第一次之后,接下来值得花心思的是导出微调这两件事,它们决定了你的成果是草稿还是成品。

导出不是只有一种格式

转录完成后的导出菜单里有四种格式,别一上来就全选:

  • TXT:纯文本,适合快速分享或放进笔记;
  • SRT / VTT:标准字幕格式,视频剪辑软件和网页播放器直接认;
  • JSON:结构化数据,带每段、每词的时间戳,适合后续程序处理。

剪辑师和做课程的人记住 SRT 就够了;做数据分析或学术引用的,JSON 才是你的菜。

转录查看器是隐藏的效率开关

双击任务打开查看器后,上面那排"View / Export / Translate / Resize"按钮很少有人全用过。它支持搜索定位、播放时文字高亮同步、语速调节,还有一个容易被忽略的功能——翻译:选中文本就能调用 OpenAI 兼容接口做实时翻译,跨国会议记录直接中英对照。

用"字幕整形"解决长句断行难看

Whisper 默认断句有时很任性,一句废话被拆成三段,或者一大段憋成一整行。Resize 窗口就是干这个的:设定期望的字幕长度(默认 42 字符)、按时间间隙合并相邻片段、按标点(句号、逗号)智能分割长句。快速对话把长度调小,演讲内容把长度调大,两下就顺眼多了。

进阶玩家:实时转写、命令行与插件

如果你已经把文件转写玩熟了,下面这三个能力会让你从"会用"进阶到"离不开"。

实时录音转文字,开会时可以放手了

点击主界面麦克风图标进入录音模式,选好音频输入设备,把延迟参数设到 20~30 秒(这是缓冲时间,设太短反而会频繁出错),就能边录边出文字。配合演示窗口,可以把实时字幕全屏投到投影仪上,讲座、例会、线上课的观众都有字幕可看。录完的内容还能一键保存为转录记录。

命令行:把转写变成一条命令

不想每次点界面?Buzz 提供了完整的 CLI:

# 把视频转成中文字幕,同时导出 SRT 和 VTT 两种格式 buzz add --task transcribe --language zh --model-size small --srt --vtt 访谈视频.mp4 # 用初始提示词提升专业术语准确率 buzz add --task transcribe --prompt "术语:神经网络、深度学习、强化学习" lecture.mp3 # 后台运行,不弹界面,适合挂在服务器上 buzz add --task transcribe --hide-gui batch_folder/*.wav

参数含义从左到右:任务类型、语言、模型大小、要导出的格式、输入文件。--hide-gui这个参数让 Buzz 可以完全无头运行,是自动化脚本的关键。

插件:不修改核心代码的扩展点

从 1.4.5 版本起,Buzz 支持插件系统。内置插件里有几颗"珍珠":DeepFilterNet 降噪(转录前把背景噪音剥掉)、增强语言检测(先用小模型自动判断语言)、导出 DOCX(直接生成 Word 文档)、跳过已转录文件(批量重复导入时不重复劳动)。在"帮助 → 插件"菜单里管理启用顺序和配置,还能通过 URL 安装社区插件。

完整演示:把一小时访谈变成带时间戳的字幕

理论说了一堆,不如跟着走一遍真实任务。假设你手上有一段 50 分钟的采访音频,目标是交付一份中文字幕 SRT。

第一步:导入。打开 Buzz,点加号选中音频文件。如果想批量处理多个素材,一次全选即可,它们会排队进任务列表。

第二步:定参数。任务选"转录",语言手动填zh,模型选small(先求快,准确率不够再换 medium),勾上"单词级时间戳"——这会为每个词都记下精确时间,是后面调字幕的底气。

第三步:跑。点运行,去做别的事。进度条走到 100% 后双击任务打开查看器,先通读一遍,把明显的识别错误改掉。

第四步:整形。打开 Resize 窗口,期望字幕长度设 42,勾上"按间隙合并"和"按标点分割",点一下合并,字幕从"一坨"变成"一行一行"。

第五步:导出。选 SRT 格式导出到指定文件夹。搞定,这份文件可以直接拖进剪映、Premiere 或 B 站投稿后台。

同样的流程,如果素材是个 YouTube 链接,Buzz 从 1.2.0 起也支持直接导入 URL 转录,省去先下载的功夫。

新手最常见的五个坑:误区与正解

误区一:模型越大越好。事实是 large 可能比 small 慢十倍,而日常口语素材两者的差距肉眼几乎看不出。正解:默认从 small 起步,按实际效果升级。

误区二:自动检测语言最省事。自动检测确实能工作,但在方言、口音、环境音多的录音上容易翻车,一旦检测错,整篇结果全毁。正解:转录前确认语言,手动填语言代码。

误区三:实时转写点了就该立刻出字。录音转写需要攒够一段音频才识别,不是麦克风同声传译。正解:延迟设在 20~30 秒,屏幕上先出的是已确认片段,不完整的部分会更新替换。

误区四:转录结果没法改。很多人转完发现错别字只能去文本文件里改。正解:查看器里的文本是可以直接编辑的,改完再导出,导出的是修正版。

误区五:GPU 加速很难配。其实用 Whisper.cpp 后端时 Buzz 会自动探测 Vulkan 支持,多数集成显卡都能受益;NVIDIA 独显再配合 CUDA 版 PyTorch 效果最佳。正解:设置里能开就开,白捡的速度。

三个"组合拳"玩法,让效率再上一个台阶

单个功能都是零件,组合起来才叫流水线。

组合一:降噪 + 术语提示 + 单词时间戳 = 访谈稿神器。采访录音通常嘈杂,先让 DeepFilterNet 插件把背景音剥掉,再在初始提示里填上受访人名字和专业术语,最后开单词级时间戳。出来的稿件干净、术语正确、引用时能精确到秒,直接达到可交付标准。

组合二:文件夹监控 + 自动导出 = 无人值守流水线。在"首选项 → Folder Watch"里设一个监控目录,Buzz 会自动检测新加入的音频并转写、导出。开会录音丢进文件夹,下班前收稿子,跟外卖柜取餐一个道理。

组合三:CLI + 循环脚本 = 批量字幕工厂。如果你有几百集课程视频,写个简单的 bash 循环,每条执行buzz add --task transcribe --srt 第N集.mp4,睡觉前挂上,第二天收获一整个目录的 SRT 文件。这就是把批处理类比成流水线作业的实际操作。

想继续深挖?从这里出发

这篇文章只覆盖了 Buzz 的日常面,剩下的深度内容都在项目里等着你:

  • 使用手册:docs/docs/usage/目录下有逐项功能的图文说明;
  • 命令行参考:docs/docs/cli.md,所有参数和示例一应俱全;
  • 插件开发:buzz/plugins/AGENTS.md是官方插件协议,想自己写插件的从内置插件源码buzz/plugins/读起;
  • 测试素材:仓库里的testdata/提供了多种语言的示例音频,可以用来验证不同模型的表现;
  • 源码结构:想了解实现的话,buzz/transcriber/是各转写后端、buzz/widgets/是界面、buzz/db/是数据存储,脉络很清晰。

从"凌晨发愁"到"睡前挂上任务"的距离,其实就是一个 Buzz 而已。挑一段你手头最长的录音,今晚就试着把它变成字幕——这是学会任何工具最快的捷径。

【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAI's Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表