1. Confucius4-R2T2(网易有道子曰)
- 参数:1.7B
- 模型大小:GGUF Q8_0 量化包约 2.2GB
- 核心特点:真流式 ASR,基于 Qwen3-ASR-1.7B 微调;最长稳定前缀(LSP)技术——只追加不回改;音频截断场景无幻觉
- 部署方式:llama.cpp + Metal(Mac)或 vLLM(NVIDIA GPU)
- 系统要求:16GB M2 Pro 即可本地推理
- 使用场景:实时字幕、语音 Agent、直播字幕、会议实时转录
- 原文:微博
2. MiMo-V2.5-ASR(小米)
- 参数:未公开
- 核心特点:中英混合识别、方言覆盖(吴语/粤语/闽南语/四川话等)、歌词转录、噪声与多人环境鲁棒
- 官方测试:普通话 95.2%、英语 93.8%、方言混合 91.5%、嘈杂环境 89.7%
- 部署方式:Python 3.12+,CUDA 12.0+,至少 4GB 显存(推荐 8GB+),Gradio 本地界面
- 使用场景:会议录音转写、课堂字幕、播客整理、智能家居/车载语音输入
- 原文:如何在本地快速跑通 MiMo-V2.5-ASR
3. Faster-Whisper(开源社区)
- 参数:tiny (39MB) / base (74MB) / small (244MB) / medium (769MB) / large (1550MB)
- 核心特点:基于 CTranslate2 对 Whisper 的重实现,比原始 Whisper 快 4-5 倍,内存占用降低 50-60%
- 部署方式:
pip install faster-whisper,100% 离线运行,支持 CPU/GPU - 模型质量:与原始 Whisper 质量一致
- 使用场景:通用语音转写,生产环境推荐 small 或 medium
- 原文:Faster-Whisper 对比文档
4. TMSpeech(Windows 离线工具)
- 类型:免费开源 Windows 桌面工具(基于 Whisper)
- 模型大小:中文模型约 300MB
- 核心特点:捕获电脑正在播放的声音,识别全部在本地完成,结果实时显示为字幕,按日期存成日志文件
- 部署方式:Windows exe,双击运行,无需联网、无需注册账号
- 使用场景:会议纪要、在线课程字幕、视频补字幕、英语听力练习
- 原文:TMSpeech 完整指南
5. LMSupply.Transcriber(.NET NuGet 包)
- 类型:MIT 开源 NuGet 包(基于 Whisper + ONNX Runtime)
- 核心特点:零配置自动从 HuggingFace 下载模型、自动 GPU 加速(CUDA/DirectML/CoreML)、支持 99+ 语言自动检测
- 部署方式:
dotnet add package LMSupply.Transcriber,支持 Windows/macOS,完全离线 - 使用场景:.NET 应用的语音转文字集成、桌面应用、跨平台本地转录
- 原文:NuGet 包页面
总结对比
| 模型/工具 | 大小 | 流式 | 平台 | 使用场景 |
|---|---|---|---|---|
| Confucius4-R2T2 | 2.2GB | 是 | Mac/Win/Linux | 实时字幕、语音 Agent |
| MiMo-V2.5-ASR | 未公开 | 否 | Win/Linux (GPU) | 会议转写、方言识别 |
| Faster-Whisper | 39MB-1.5GB | 否 | Win/Mac/Linux | 通用转写、生产部署 |
| TMSpeech | 300MB | 是 | Windows | 会议字幕、课程笔记 |
| LMSupply.Transcriber | 自动下载 | 否 | Win/Mac (.NET) | .NET 应用集成 |
选型建议:
- Mac 本地、低延迟实时:Confucius4-R2T2
- 中文方言覆盖:MiMo-V2.5-ASR
- 通用跨平台、生产部署:Faster-Whisper
- Windows 零门槛、实时字幕:TMSpeech
- .NET 项目集成:LMSupply.Transcriber