whisper.cpp

Time : 2026-04-13

介绍

什么是 whisper.cpp?

whisper.cpp 是一个高效、轻量级的 自动语音识别(ASR) 库,由 ggml 张量库的作者 ggerganov 开发。它是 OpenAI 的 Whisper 语音识别模型的 C++ 移植版本。它的主要特点是在普通消费级 CPU 上就能高效运行语音识别,无需依赖昂贵的 GPU 或复杂的深度学习环境。

核心特点:

  1. 纯 CPU 推理:whisper.cpp 针对 CPU 进行了深度优化,支持 x86/ARM 架构,尤其对 Apple Silicon(M1/M2/M3)做了专门优化,运行速度非常快。

  2. 无额外依赖:项目使用纯 C/C++ 实现,不依赖 PyTorch、TensorFlow 等大型深度学习框架,编译和部署非常轻便。

  3. 支持多种模型:支持 OpenAI Whisper 的多种模型尺寸(tiny / base / small / medium / large),用户可以根据精度和速度需求自由选择。

  4. 高精度识别:在保持原版 Whisper 模型高识别准确率的同时,大幅降低了运行门槛,甚至在树莓派等嵌入式设备上也能流畅运行。

  5. 丰富的输出格式:支持输出纯文本、带时间戳的字幕(SRT、VTT)、JSON 等多种格式,方便集成到各类应用中。

  6. 实时推理支持:部分版本和衍生项目支持麦克风实时语音识别,可用于实时字幕、语音助手等场景。

典型应用场景:

  • 本地语音转文字(无需联网,保护隐私)
  • 视频自动生成字幕
  • 会议录音转写
  • 嵌入式设备(如树莓派、NAS)中的语音识别
  • 作为其他应用的语音识别后端

示例用法:

项目地址https://github.com/ggerganov/whisper.cpp

whisper.cpp 凭借其轻量、高效、跨平台的特性,已经成为本地离线语音识别领域的热门选择。

Generated by AI

获取

Github:https://github.com/ggml-org/whisper.cpp

Direct Download: bf065638-3417-4e90-a8bc-72aaf2eaf2b2

下载遇到问题?

如果你在下载过程中遇到任何问题,参考以下解决方案:

链接失效、错误 如何下载ed2k链接 如何下载magnet/torrent文件 其他问题

参考教程

whisper.cpp windows版本生成视频字幕的办法:

你需要将音频/视频转化成特定格式,使用ffmpeg进行转换

ffmpeg -i "input.mp4" -ar 16000 -ac 1 -c:a pcm_s16le audio.wav                                                                   

其中-i参数指定的是输入的视频路径

你需要到这里下载gguf格式的whisper模型:https://huggingface.co/ggerganov/whisper.cpp ,比如ggml-medium.en-q8_0.bin这个模型

下载,解压和切换到whisper.cpp目录,输入下面的命令生成srt格式的字幕文件:

whisper-cli.exe -m "/path/to/ggml-medium.en-q8_0.bin" -f "/path/to/audio.wav" -osrt  

其中-m参数指定了你下载的whisper模型位置,-f参数指定了识别的音频位置,-osrt表示输出srt字幕文件