三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

实测Audio8-ASR-0.1B语音识别效果:WER低至2.7%的技术突破

实测Audio8-ASR-0.1B语音识别效果:WER低至2.7%的技术突破

实测Audio8-ASR-0.1B语音识别效果:WER低至2.7%的技术突破

【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B

Audio8-ASR-0.1B是一款紧凑型自回归语音识别模型,其语言模型组件仅含0.1B参数,却支持中文、英文、法语、德语、日语、韩语及粤语等多语言语音识别,是LLM时代最小可用的高性能ASR模型之一。

语音识别技术的革命性突破

在语音识别领域,模型性能与体量往往难以兼得。Audio8-ASR-0.1B却以0.1B的语言模型参数,实现了令人惊叹的识别精度,为行业树立了新标杆。

低至2.7%的WER值

在Open ASR Leaderboard评测中,Audio8-ASR-0.1B展现出卓越性能。其中,在LibriSpeech test.clean数据集上,词错误率(WER)仅为2.70%。该模型在多个数据集上均有出色表现:

  • AMI Cleaned:WER 10.99%
  • Earnings22:WER 12.31%
  • GigaSpeech Cleaned:WER 8.48%
  • LibriSpeech test.other:WER 6.59%
  • SPGISpeech:WER 3.73%
  • VoxPopuli Cleaned AA:WER 4.39%

七项公开数据集的平均WER低至7.03%,充分彰显了其在语音识别任务上的强大能力。

模型架构解析

Audio8-ASR-0.1B的出色性能源于其精心设计的架构:

核心组件

  • 任务:自动语音识别
  • 解码器:8层Qwen风格因果语言模型
  • 音频前端:Qwen3-ASR音频编码器+MLP适配器/投影器
  • 语言模型参数:103,502,336(约0.104B)
  • 端到端唯一参数:323,990,528(约0.324B)
  • 运行时:Hugging Face Transformers

创新设计

该模型巧妙融合了高效的音频编码与紧凑的语言模型,在保证识别精度的同时,显著降低了参数量,为在资源受限设备上部署高性能语音识别模型开辟了新路径。

简单易用的部署与使用

快速开始

使用Transformer进行推理的代码示例简单直观,只需几行代码即可实现语音转文字功能:

import torch from transformers import AutoModelForCausalLM, AutoProcessor model_path = "AutoArk-AI/Audio8-ASR-0.1B" audio_path = "path/to/audio.wav" device = "cuda" if torch.cuda.is_available() else "cpu" torch_dtype = torch.bfloat16 if device == "cuda" else torch.float32 processor = AutoProcessor.from_pretrained(model_path, trust_remote_code=True) model = AutoModelForCausalLM.from_pretrained( model_path, trust_remote_code=True, torch_dtype=torch_dtype, attn_implementation="eager", ).to(device) model.eval() # 后续代码省略...

也可直接使用项目提供的示例脚本:

python examples/transcribe.py path/to/audio.wav --model AutoArk-AI/Audio8-ASR-0.1B

热词增强功能

Audio8-ASR-0.1B还支持解码时的热词增强功能,无需微调即可提升特定词汇的识别准确率:

python examples/transcribe_hotword.py path/to/audio.wav \ --model AutoArk-AI/Audio8-ASR-0.1B \ --hotwords "Audio8,AutoArk"

多场景部署方案

除基础模型外,项目还提供了面向不同场景的部署版本:

  • Audio8-ASR-0.1B-onnx-runtime:专为边缘设备部署设计,峰值内存占用约1.1GB
  • Audio8-ASR-0.1B-iOS-ANE:针对iPhone本地转录优化,峰值运行时内存占用约200MB

如何获取与使用

要开始使用Audio8-ASR-0.1B,可通过以下步骤克隆仓库:

git clone https://gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B

项目文件结构清晰,包含模型配置、代码实现及示例脚本等关键文件,如:

  • modeling_arkasr.py:模型实现代码
  • processing_arkasr.py:处理逻辑代码
  • examples/transcribe.py:转录示例脚本
  • hotword/:热词相关代码

总结

Audio8-ASR-0.1B以其0.1B的语言模型参数,实现了低至2.7%的WER值,在性能与效率之间取得了完美平衡。其多语言支持、简单易用的接口及多样化的部署方案,使其成为语音识别应用的理想选择,为开发者和用户带来了前所未有的语音识别体验。无论是在边缘设备还是移动平台,Audio8-ASR-0.1B都展现出了强大的潜力,无疑是语音识别技术领域的一项重要突破。

【免费下载链接】Audio8-ASR-0.1B项目地址: https://ai.gitcode.com/hf_mirrors/Audio8/Audio8-ASR-0.1B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

← 返回列表