whisper.cpp
介绍
什么是 whisper.cpp?
whisper.cpp 是一个高效、轻量级的 自动语音识别(ASR) 库,由 ggml 张量库的作者 ggerganov 开发。它是 OpenAI 的 Whisper 语音识别模型的 C++ 移植版本。它的主要特点是在普通消费级 CPU 上就能高效运行语音识别,无需依赖昂贵的 GPU 或复杂的深度学习环境。
核心特点:
纯 CPU 推理:whisper.cpp 针对 CPU 进行了深度优化,支持 x86/ARM 架构,尤其对 Apple Silicon(M1/M2/M3)做了专门优化,运行速度非常快。
无额外依赖:项目使用纯 C/C++ 实现,不依赖 PyTorch、TensorFlow 等大型深度学习框架,编译和部署非常轻便。
支持多种模型:支持 OpenAI Whisper 的多种模型尺寸(tiny / base / small / medium / large),用户可以根据精度和速度需求自由选择。
高精度识别:在保持原版 Whisper 模型高识别准确率的同时,大幅降低了运行门槛,甚至在树莓派等嵌入式设备上也能流畅运行。
丰富的输出格式:支持输出纯文本、带时间戳的字幕(SRT、VTT)、JSON 等多种格式,方便集成到各类应用中。
实时推理支持:部分版本和衍生项目支持麦克风实时语音识别,可用于实时字幕、语音助手等场景。
典型应用场景:
- 本地语音转文字(无需联网,保护隐私)
- 视频自动生成字幕
- 会议录音转写
- 嵌入式设备(如树莓派、NAS)中的语音识别
- 作为其他应用的语音识别后端
示例用法:
项目地址:https://github.com/ggerganov/whisper.cpp
whisper.cpp 凭借其轻量、高效、跨平台的特性,已经成为本地离线语音识别领域的热门选择。
Generated by AI
获取
Github:https://github.com/ggml-org/whisper.cpp
Direct Download: bf065638-3417-4e90-a8bc-72aaf2eaf2b2
参考教程
whisper.cpp windows版本生成视频字幕的办法:
你需要将音频/视频转化成特定格式,使用ffmpeg进行转换
ffmpeg -i "input.mp4" -ar 16000 -ac 1 -c:a pcm_s16le audio.wav
其中-i参数指定的是输入的视频路径
你需要到这里下载gguf格式的whisper模型:https://huggingface.co/ggerganov/whisper.cpp ,比如ggml-medium.en-q8_0.bin这个模型
下载,解压和切换到whisper.cpp目录,输入下面的命令生成srt格式的字幕文件:
whisper-cli.exe -m "/path/to/ggml-medium.en-q8_0.bin" -f "/path/to/audio.wav" -osrt
其中-m参数指定了你下载的whisper模型位置,-f参数指定了识别的音频位置,-osrt表示输出srt字幕文件