5个可本地部署的语音转文本(ASR)模型

0
(0)

1. Confucius4-R2T2(网易有道子曰)

  • 参数:1.7B
  • 模型大小:GGUF Q8_0 量化包约 2.2GB
  • 核心特点:真流式 ASR,基于 Qwen3-ASR-1.7B 微调;最长稳定前缀(LSP)技术——只追加不回改;音频截断场景无幻觉
  • 部署方式:llama.cpp + Metal(Mac)或 vLLM(NVIDIA GPU)
  • 系统要求:16GB M2 Pro 即可本地推理
  • 使用场景:实时字幕、语音 Agent、直播字幕、会议实时转录
  • 原文:微博

2. MiMo-V2.5-ASR(小米)

  • 参数:未公开
  • 核心特点:中英混合识别、方言覆盖(吴语/粤语/闽南语/四川话等)、歌词转录、噪声与多人环境鲁棒
  • 官方测试:普通话 95.2%、英语 93.8%、方言混合 91.5%、嘈杂环境 89.7%
  • 部署方式:Python 3.12+,CUDA 12.0+,至少 4GB 显存(推荐 8GB+),Gradio 本地界面
  • 使用场景:会议录音转写、课堂字幕、播客整理、智能家居/车载语音输入
  • 原文:如何在本地快速跑通 MiMo-V2.5-ASR

3. Faster-Whisper(开源社区)

  • 参数:tiny (39MB) / base (74MB) / small (244MB) / medium (769MB) / large (1550MB)
  • 核心特点:基于 CTranslate2 对 Whisper 的重实现,比原始 Whisper 快 4-5 倍,内存占用降低 50-60%
  • 部署方式:pip install faster-whisper,100% 离线运行,支持 CPU/GPU
  • 模型质量:与原始 Whisper 质量一致
  • 使用场景:通用语音转写,生产环境推荐 small 或 medium
  • 原文:Faster-Whisper 对比文档

4. TMSpeech(Windows 离线工具)

  • 类型:免费开源 Windows 桌面工具(基于 Whisper)
  • 模型大小:中文模型约 300MB
  • 核心特点:捕获电脑正在播放的声音,识别全部在本地完成,结果实时显示为字幕,按日期存成日志文件
  • 部署方式:Windows exe,双击运行,无需联网、无需注册账号
  • 使用场景:会议纪要、在线课程字幕、视频补字幕、英语听力练习
  • 原文:TMSpeech 完整指南

5. LMSupply.Transcriber(.NET NuGet 包)

  • 类型:MIT 开源 NuGet 包(基于 Whisper + ONNX Runtime)
  • 核心特点:零配置自动从 HuggingFace 下载模型、自动 GPU 加速(CUDA/DirectML/CoreML)、支持 99+ 语言自动检测
  • 部署方式:dotnet add package LMSupply.Transcriber,支持 Windows/macOS,完全离线
  • 使用场景:.NET 应用的语音转文字集成、桌面应用、跨平台本地转录
  • 原文:NuGet 包页面

总结对比

模型/工具大小流式平台使用场景
Confucius4-R2T22.2GB是Mac/Win/Linux实时字幕、语音 Agent
MiMo-V2.5-ASR未公开否Win/Linux (GPU)会议转写、方言识别
Faster-Whisper39MB-1.5GB否Win/Mac/Linux通用转写、生产部署
TMSpeech300MB是Windows会议字幕、课程笔记
LMSupply.Transcriber自动下载否Win/Mac (.NET).NET 应用集成

选型建议:

  • Mac 本地、低延迟实时:Confucius4-R2T2
  • 中文方言覆盖:MiMo-V2.5-ASR
  • 通用跨平台、生产部署:Faster-Whisper
  • Windows 零门槛、实时字幕:TMSpeech
  • .NET 项目集成:LMSupply.Transcriber

这篇文章有用吗?

点击星号为它评分!

平均评分 0 / 5. 投票数: 0

到目前为止还没有投票!成为第一位评论此文章。

很抱歉,这篇文章对您没有用!

让我们改善这篇文章!

告诉我们我们如何改善这篇文章?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注