三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

语音转文字连续加班三周后,我用这个开源工具一次性搞定了全部音频

语音转文字连续加班三周后,我用这个开源工具一次性搞定了全部音频

语音转文字连续加班三周后,我用这个开源工具一次性搞定了全部音频

【免费下载链接】AsrTools✨ AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!项目地址: https://gitcode.com/gh_mirrors/as/AsrTools

去年做人物专访项目,我抱着录音笔跑了十几个受访者,攒下将近二十个小时的音频。原以为写稿是重头戏,没想到卡在最没技术含量的环节——转写。那段时间我每天下班就对着播放器,听一句暂停一句敲进文档,三周下来颈椎抗议、手腕酸疼,而录音还有三分之一没碰。后来一个做自媒体的朋友看不过眼,甩给我一个开源工具,说"把音频拖进去,喝杯咖啡再回来,字幕都给你排好了"。这就是我今天想认真安利的项目——AsrTools,一款基于 Python 的智能语音转文字工具,主打免GPU、批量处理、开箱即用,支持 SRT/TXT/ASS 字幕输出。

给声音请一位不知疲倦的速记员

先说说我一开始的疑问:识别语音,不都得装什么本地大模型、配显卡吗?AsrTools 彻底颠覆了这个印象。它不依赖本地推理,而是巧妙地对接了剪映、必剪、快手这些视频平台背后的语音识别能力,把你要转写的音频"借道"云端处理。

你可以把它想象成给声音请了一位速记员:你把录音递过去,它负责上传、排队、取回文字,最后按时间轴给你排好版。整个过程中,你的电脑只是个传话的,所以哪怕是一台老旧办公本,也照样跑得飞快。

更贴心的是它默认开启了缓存机制。同一个文件转写过一次,结果会按文件特征码缓存下来,下次直接秒出,不重复花时间也不重复消耗接口资源。

五分钟把它请进你的电脑

AsrTools 的使用门槛低到什么程度?Windows 用户直接下载打包好的 Release 版本,解压后双击AsrTools.exe就能用,环境都不需要你自己配。

习惯用命令行的朋友,三行命令也能搞定:

git clone https://gitcode.com/gh_mirrors/as/AsrTools cd AsrTools pip install -r requirements.txt

依赖清单非常克制——核心转写逻辑只需要requests,想用图形界面才额外装PyQt5PyQt-Fluent-Widgets。装完之后一句python asr_gui.py,漂亮的主窗口就弹出来了。

界面上手,比想象中还要简单

作为被各种丑界面荼毒过的人,我得夸一句 AsrTools 的颜值。基于 PyQt5 和 qfluentwidgets 打造的界面,布局清爽得像苹果系统自带的应用。整个窗口就分三个区域:顶部选接口和格式,中间拖文件,底部看任务列表。

看到截图里的绿色和橙色状态了吗?绿色代表"已处理",橙色代表"处理中",一眼就能掌握全部进度。右键任意任务还会弹出快捷菜单:识别效果不满意就"重新处理",加错了就"删除任务",想核对原文就"打开文件目录",不需要你去文件管理器里翻箱倒柜。

三个引擎怎么选,看这张表就够了

界面上的"选择接口"下拉框,藏着 AsrTools 的第二个杀手锏——它一口气内置了三种不同的语音识别引擎,分别对应 B、J、K 三个接口。遇到识别效果不理想的场景,换个引擎重试往往就有惊喜。

接口对应平台适合场景
B 接口必剪(Bcut)中规中矩的通用转写,日常采访、会议够用
J 接口剪映(JianYing)视频创作者的常用选项,支持更细的时间戳控制
K 接口快手(KuaiShou)另一个可用备胎,多引擎对比时很有价值

实际使用中我的经验是:同一个音频文件,A 引擎把专业术语听岔了,B 引擎反而能识别对。三选一不满意,就轮流试一遍,反正换引擎的成本只是多等几分钟。

批量处理,才是效率爆炸的地方

如果只是转写一个文件,手动操作也勉强能忍。但回到我开头的困境——二十个小时的素材,一个个文件来回折腾,那才叫灾难。

AsrTools 对这种情况简直是为我量身定做的。它支持把整个文件夹直接拖进窗口,自动识别里面所有音频批量加入列表;处理时默认开 3 个线程并发跑,多个文件同时进行。更省心的是,视频文件也能直接丢进去——程序会自动调用 ffmpeg 把视频里的音轨抽出来转成 mp3,转完顺手在原目录生成字幕文件,全程不需要你手动转换格式。

我后来把攒下的几十段录音一次性全拖进去,泡了杯茶的功夫回来,文件目录里整整齐齐躺着对应的字幕文件。那种感觉,就像攒了三周的脏衣服突然被洗衣机一次性洗完晾好。

输出格式:从记事本到视频字幕全覆盖

转写只是第一步,怎么用才是关键。AsrTools 在结果导出上也给了充足的选择自由,处理完成后会自动在原音频目录生成字幕文件:

  • TXT:纯文字版,适合整理成采访稿、会议纪要,不带时间轴,干净利落
  • SRT:带时间轴的标准字幕格式,丢进剪映、PR 就能直接挂到视频上
  • ASS:支持更多字幕样式定制,进阶玩家做特效字幕用得上

顺带一提,底层的数据处理模块做得相当规整,bk_asr/ASRData.py里封装了完整的格式转换逻辑,支持 flac、m4a、mp3、wav 等常见音频格式。

给爱折腾的人:三行代码调用命令行版

图形界面适合大多数人,但如果你喜欢把工具嵌进自己的工作流里,AsrTools 的核心库同样可以单独调用。参考项目自带的example.py,逻辑简洁得惊人:

from bk_asr import JianYingASR asr = JianYingASR("resources/test.mp3") result = asr.run() print(result.to_srt())

三行代码,一个音频文件就被转成了带时间轴的字幕文本。这意味着你可以把它接入自己的 Python 脚本,批量处理大批量音频、定时转写、甚至配合其他自动化流程,玩法全看你脑洞。bk_asr/目录下每个引擎一个文件,命名清晰,想研究底层调用细节也很方便。

避坑指南:这几个细节先替你踩过

用了一段时间,也摸出了一些需要注意的地方,提前告诉你省得走弯路:

  • 视频转音频依赖 ffmpeg,如果处理视频报错"音频转换失败",检查一下系统里装没装 ffmpeg
  • 处理依赖联网接口,网络不稳定时建议分批添加任务,别一口气塞太多
  • 接口属于共享型服务,高峰期偶尔会慢,耐心等一下或者换个接口都行
  • 中文路径偶尔会引发编码问题,遇到异常优先试试把文件放到英文路径下

别让转写吃掉你的创作时间

回头看那三周的加班,其实完全可以避免。转写本就不该是创作者的主业,它是流程里最机械、最不该占用脑力的环节。AsrTools 的价值,就在于把这段枯燥时间彻底压缩,让你把精力放回真正重要的分析、写作和表达上。

如果你也正被堆积如山的录音、会议、采访素材折磨,不妨试试它。克隆一份到本地,把音频拖进去,点一下"开始处理",然后安心去做你真正该做的事。省下来的时间,才是这款工具送你的最大礼物。🚀

【免费下载链接】AsrTools✨ AsrTools: Smart Voice-to-Text Tool | Efficient Batch Processing | User-Friendly Interface | No GPU Required | Supports SRT/TXT Output | Turn your audio into accurate text in an instant!项目地址: https://gitcode.com/gh_mirrors/as/AsrTools

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表