CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳
CrisperWhisper2.0_large实战教程:3分钟上手专业级语音识别,支持多语言与实时时间戳
【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large
CrisperWhisper2.0_large是一款专业级语音识别工具,能够提供精准的逐字记录和预期内容转录,支持多语言识别与实时时间戳功能,让你轻松应对各种语音转文本需求。
🌟 CrisperWhisper2.0_large核心优势
CrisperWhisper2.0_large作为一款先进的语音识别模型,具有以下突出特点:
✅ 双重转录模式,满足不同需求
- 逐字模式:精确记录说话内容,包括填充词、重复、口吃和 vocal 事件,例如:
[um] so we we need to, to reschedule the th- thursday meeting to [uh] march third at nine thirty [laughter] - 预期模式:生成清晰易读的版本,自动格式化数字、日期和电子邮件等内容,例如:
So we need to reschedule the Thursday meeting to March 3 at 9:30.
⏱️ 精准的词级时间戳
提供平均约30毫秒的词边界误差(朗读语音)和41毫秒(会话语音),是目前基准测试中最精确的词级时间戳系统。
🌍 多语言支持
支持多种语言的逐字和预期模式转录,在Nyra Verbatim Speech Benchmark基准测试中,跨十种语言的不流畅F1得分领先于所有测试的闭源替代方案。
🚀 生产级推理
采用CTranslate2运行时,结合推测解码技术,并内置缓解Whisper循环幻觉故障模式的机制,确保稳定高效的语音识别体验。
📊 性能对比
在Nyra Verbatim Speech Benchmark基准测试中,CrisperWhisper2.0_large表现出色:
| # | System | Disfluency F1 |
|---|---|---|
| 1 | CrisperWhisper 2.0 Pro | 93.5 |
| 2 | CrisperWhisper 2.0 | 87.8 |
| 3 | ElevenLabs Scribe v2 | 79.2 |
| 4 | Microsoft MAI-Transcribe-1.5 | 77.5 |
| 5 | CrisperWhisper 1.0* | 64.8 |
*CrisperWhisper 1.0仅支持英语/德语;其平均值涵盖这两种语言。英语和德语使用人工标记的评估集;其他八种语言使用合成逐字集。
在词定时准确性方面,CrisperWhisper2.0_large同样领先:
| # | System | Boundary error |
|---|---|---|
| 1 | CrisperWhisper 2.0 | 29.6 ms |
| 2 | xAI Grok Speech-to-Text | 37.1 ms |
| 3 | CTC-seg | 49.3 ms |
| 4 | ElevenLabs Scribe v2 | 51.3 ms |
| 5 | NeMo-FA | 60.0 ms |
📥 快速安装步骤
NVIDIA GPU(Linux)安装
这是最快的安装方式,包含推测解码功能。只需安装NVIDIA驱动,CUDA库将通过pip自动安装:
pip install "crisperwhisper[ct2]"纯PyTorch安装
可在任何支持torch的环境(macOS、Windows、CPU)上运行:
pip install "crisperwhisper[transformers]"🚀 3分钟快速上手
基本转录
from crisperwhisper import CrisperWhisperModel # 加载模型(默认加载nyralabs/CrisperWhisper2.0_large) model = CrisperWhisperModel() # 也可选择不同大小的模型:CrisperWhisperModel("turbo") # turbo / medium / small # 逐字转录(默认模式):包含所有填充词、重复、口吃和vocal事件 result = model.transcribe("meeting.wav", language="en") print(result.text) # 预期模式:生成清晰易读的版本 clean = model.transcribe("meeting.wav", language="en", mode="intended")获取词级时间戳
# 获取词级时间戳 result = model.transcribe("meeting.wav", language="en", word_timestamps=True) for w in result.words: print(f"{w.start:6.2f}-{w.end:6.2f} {w.word}")升级现有转录文本
# Verbatimize:将现有干净转录文本升级,添加音频中实际存在的不流畅表达 result = model.verbatimize("clip.wav", "I think we should ship it Friday.")更快的推理:推测解码(ct2)
使用小型草稿模型提出标记,主模型进行验证,输出相同但速度提升1.3至1.4倍:
model = CrisperWhisperModel("large", draft_model="turbo") result = model.transcribe("meeting.wav", language="en", speculative_decoding=True)🧩 可用模型
| Shorthand | HuggingFace ID | Notes |
|---|---|---|
| "large" (default) | nyralabs/CrisperWhisper2.0_large | 最佳开放质量 |
| "turbo" | nyralabs/CrisperWhisper2.0_turbo | 最快,质量略有下降;推荐作为推测草稿 |
| "medium" | nyralabs/CrisperWhisper2.0_medium | 接近large质量;尺寸和质量之间的最佳权衡 |
| "small" | nyralabs/CrisperWhisper2.0_small | 最小型 |
| "large_pro" / "turbo_pro" / "medium_pro" / "small_pro" | nyralabs/CrisperWhisper2.0_ _pro | Pro:我们最好的模型,性能提升,热词增强,在额外专有数据上训练 |
标准模型根据非商业研究许可证发布,可用于商业许可。Pro模型仅可通过商业许可获得。
📦 其他功能
CrisperWhisper2.0_large还提供以下实用功能:
| Option | What it does |
|---|---|
| mode="verbatim" / "intended" | 每次调用选择"所说内容"与"所指内容" |
| word_timestamps=True | 通过监督交叉注意力对齐获得每个词的开始/结束时间 |
| hotwords=[...] | 偏向识别名称和罕见术语(仅Pro模型) |
| model.transcribe_dual(...) | 一次传递中获得逐字和预期版本(ct2) |
| model.verbatimize(audio, transcript) | 将真实的不流畅表达插入可信的干净转录文本 |
| model.forced_align(audio, text) | 为已有转录文本生成时间戳 |
| Longform | 超过30秒的音频通过条件延续无缝转录,无块边界重复、丢失或拼接问题 |
| Hallucination mitigation | 默认开启:在解码过程中检测并抑制Whisper的循环重复故障模式 |
| compute_type="float16" / "int8_float16" | 量化 |
📜 许可证信息
CrisperWhisper 2.0根据组件的不同分布在两个单独的许可证下:
| Component | License |
|---|---|
| Software— 推理代码、预处理和后处理代码以及脚本 | MIT License— 宽松,包括商业使用 |
| Model— 模型权重、检查点、参数、配置文件、分词器/词汇表 —以及模型生成的任何输出 | nyra health Non-Commercial Research License— 仅非商业使用 |
简而言之:推理代码和其他软件采用MIT许可,可用于任何目的,包括商业用途。只有模型权重及其生成的输出被许可用于非商业用途;任何商业使用模型权重或输出都需要获得nyra health GmbH的单独商业许可。
📚 相关资源
- 完整文档
- 发布文章
- 论文
- 模型
- 基准测试
- 基准测试仓库
【免费下载链接】CrisperWhisper2.0_large项目地址: https://ai.gitcode.com/hf_mirrors/nyralabs/CrisperWhisper2.0_large
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考