三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

Audacity AI插件实战指南:免费本地完成音乐分离、降噪与语音转文字

Audacity AI插件实战指南:免费本地完成音乐分离、降噪与语音转文字

Audacity AI插件实战指南:免费本地完成音乐分离、降噪与语音转文字

【免费下载链接】openvino-plugins-ai-audacityA set of AI-enabled effects, generators, and analyzers for Audacity®.项目地址: https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity

如果你经常和音频打交道,大概经历过这些"差一点就完美"的时刻:录好的播客被风扇声毁了、喜欢的歌找不到干净伴奏、两小时的会议录音懒得逐句整理。这套开源的Audacity AI插件,把音乐分离、本地AI降噪、语音转文字、音乐生成和音频超分辨率装进免费软件Audacity的菜单里,而且全部在本地运行,不用联网、不花一分钱。下面从安装到五个实战,一步步带你走完。

先认识它:不是"又一个AI滤镜",而是一整套音频工作台

  • 免订阅:插件本身开源免费,AI模型推理不产生任何使用费。
  • 不出门:所有处理都在本机完成,音频文件不会上传到任何服务器。
  • 跑得快:基于OpenVINO运行时调度CPU、GPU、NPU,老电脑也能压榨出性能。
  • 长得熟:功能直接挂在Audacity的"效果""生成""分析"菜单里,界面还是你熟悉的样子。

一句大白话解释原理:OpenVINO像一个"翻译官",把AI模型的运算指令翻译成你电脑显卡或NPU听得懂的语言,让那些原本很重的AI任务,在普通机器上也能顺畅跑起来。

装好这套插件,总共只要三步

Windows和Linux的装法略有不同,但核心逻辑一致:把插件文件放进Audacity,然后在偏好设置里点亮它。

第一步:获取插件文件

Windows 用户可以克隆仓库获取全部源码,也可以直接从项目发布页下载编译好的插件包:

git clone https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity

如果打算自己动手编译,仓库里附带了完整的构建文档,照着步骤执行即可:Windows构建指南、Linux构建指南。

第二步:放到Audacity的插件目录

Windows 下把编译好的mod-openvino.dll复制到 Audacity 安装目录下的Plug-Ins文件夹即可。Linux 用户则省事得多——直接安装官方 Snap 版,OpenVINO 模块已经内置:

sudo snap install audacity sudo audacity.fetch-models --batch

第二条命令会把所需的AI模型一次性下载好,建议在首次使用前执行。

第三步:在偏好设置里启用模块

打开 Audacity,进入编辑 → 偏好设置 → 模块,找到mod-openvino,把状态从"New"改成"已启用",然后重启 Audacity。

重启后,菜单里就会出现 OpenVINO 相关的效果、生成器和分析器,到这里插件就算安装完成了。

五个立刻能上手的AI实战

实战一:Audacity音乐分离,把一首歌拆成伴奏和人声

想做卡拉OK伴奏,或者想单独提取某首歌的贝斯线来练耳,用"OpenVINO Music Separation"就行。操作路径:效果 → OpenVINO AI Effects → OpenVINO Music Separation

弹出的窗口里,真正需要你关心的参数只有两个:

  • 分离模式:选"2-Stem"得到伴奏和人声两轨;选"4-Stem"则拆出鼓、贝斯、人声、其他乐器四轨。
  • 推理设备:有独立显卡就选GPU,处理速度会快上不少。

点击"应用"后,模型首次加载需要10到30秒(之后会走磁盘缓存),完成后工作区会多出几条分轨,名字自动带上-Drums-Vocals这样的后缀,一眼就能认出来。

💡 小提示:高级设置里的"Shifts"可以提升分离质量,但处理时间会按倍数增加,日常使用默认值就好。

实战二:本地AI降噪,把嘈杂录音"擦干净"

录制播客、配音或语音笔记时,背景噪音总是最扫兴的东西。效果 → OpenVINO Noise Suppression提供三种模型:

  • DeepFilterNet2:效果与速度均衡,日常首选。
  • DeepFilterNet3:算法最新,对老旧、复杂噪音的处理更干净。
  • DenseUNet:兼容性最好,仅作兜底。

选好模型后点击"应用",它会直接修改当前选中的音轨。最适合的场景包括:清掉会议录音里的空调声、去掉视频配音中的键盘敲击声、拯救老唱片里的嘶嘶声。

实战三:Whisper语音转文字,把会议录音变成时间轴字幕

采访、讲座、会议录音整理成文字稿,过去是逐句打字,现在交给分析 → OpenVINO Whisper Transcription。窗口里两个关键选择:

  • 模型base最快,日常够用;large最准,适合重要内容或非英语音频。
  • 模式:选"转写"输出原文语言,选"翻译"则统一输出英文。

处理完成后,Audacity 会新增一条标签轨,文字与波形精确对齐——点击任意一句,就能跳到对应的音频位置。

这类字幕可以直接导出,也能作为后期剪辑的定位索引,非常实用。

实战四:一句话生成背景音乐

给视频配乐、给播客找片头曲,不需要会作曲。生成 → OpenVINO Music Generation里输入一句描述,比如"轻快的钢琴曲,适合旅行视频",再设定时长,点击"生成"即可。

几个值得记的参数:

  • Seed(随机种子):留空则每次结果都不同,适合找灵感;填上固定值可以复现某次满意的生成。
  • Guidance Scale:数值越高越贴合你的文字描述,推荐2到4之间。
  • 音频续写:选中一段已有音频,插件会自动开启"续写"模式,用当前段落"接龙"出后续,适合把满意的片段无限延长。

生成的片段会自带一栏属性标签(种子、模型、设备等),想复现或调整时直接照抄即可。

实战五:音频超分辨率,让老录音更清晰

如果手头有音质一般的旧录音或低码率音频,效果 → OpenVINO Super Resolution可以把它们增强到24kHz频宽、48kHz采样率。模型分两种:Basic(通用)适合音乐和环境声,Speech针对纯人声优化。处理时长录音时记得勾选"按输入响度归一化",输出音量会更稳定。

第一次使用,你可能会遇到这3个问题

为什么菜单里找不到插件?先回到偏好设置的"模块"页,确认mod-openvino状态是"已启用"并且重启过 Audacity;再检查插件文件是否放在了正确的 Plug-Ins 目录。

为什么第一次处理特别慢?首次运行时,插件需要把模型针对你选择的设备(CPU/GPU/NPU)做一次编译,通常要10到30秒。编译结果会缓存到磁盘,之后再加载就快多了。

长音频跑不动怎么办?把音频切成5到10分钟的片段分别处理,完成后再拼接。另外,音乐生成和超分辨率的窗口里都有"Unload Models"按钮,用完点一下可以释放占用的内存。

今晚就能做的第一个AI音频任务

从最小的一步开始,比收藏任何教程都管用:

  1. 挑一首你最近常听的歌,用"2-Stem"模式拆出人声和伴奏。
  2. 用手机录一段环境嘈杂的语音,跑一遍降噪对比效果。
  3. 找一段英文演讲,用base模型转成文字,感受字幕与波形对齐的便利。

更多功能的详细说明都在 功能文档 里,想研究实现原理的可以翻一翻 mod-openvino/ 源码。折腾完这三个任务,你就已经超过了大多数只看不练的人——AI音频处理这件事,远没有想象中那么难。

【免费下载链接】openvino-plugins-ai-audacityA set of AI-enabled effects, generators, and analyzers for Audacity®.项目地址: https://gitcode.com/gh_mirrors/op/openvino-plugins-ai-audacity

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表