语音转文字不用出网:Buzz 本地音频转录实战笔记
语音转文字不用出网Buzz 本地音频转录实战笔记【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz会议录音、播客、课程视频想把语音变成文字又怕录音内容被上传到别人的服务器Buzz 是一个开源的本地音频转录工具底层跑 OpenAI 的 Whisper 模型识别全程在你的电脑里完成结果可以直接导出 TXT、SRT、VTT 字幕。这篇笔记按任务来写先让你跑通第一次离线转录再把最常用的三条工作流讲透最后讲模型选择和高频卡点的排查思路。不想把录音交给云端Buzz 能帮你做什么它解决的核心问题就一个音频进、文字出中间不经过任何服务器。能力大致覆盖这几块导入音频或视频文件做转录或翻译对着麦克风做实时录音转录还能开一个演示窗口把实时文字投到大屏上转录完成后提供带搜索、变速播放、字幕合并调整的查看器再加一个文件夹监控目录里放进新音频就自动转。更进阶的还有说话人识别、噪声分离、插件系统比如 AI 摘要、DOCX 导出这些后面按需提。 十分钟跑通第一次本地转录先装上一个能跑的版本三个系统都有现成安装包macOS 装.dmgWindows 是安装程序应用未签名弹窗时选更多信息→仍要运行即可Linux 走 Flatpak 或 Snap。图省事的话Linux 上执行一条命令flatpak install flathub io.github.chidiwilliams.Buzz开发者也可以走 PyPI 安装buzz-captions前提是装好 FFmpeg 并用 Python 3.12 环境。装完打开应用不用做任何配置就可以导入文件了。导入文件点运行在文件菜单里选 Import Media File或点工具栏的 图标快捷键 Ctrl/CmdO挑一个音频或视频文件。接下来三个选择任务选转录或翻译成英文语言直接手动指定别用自动检测——官方文档也推荐这么做指定语言后质量通常更稳模型先不管默认值就能转。点 Run状态列变成 Completed 后双击这一行就打开了转录查看器文字、时间轴、播放器都在里面。第一次转完你手里就已经有一份能用的文本了。后面的内容都是让这件事更快、更准、更顺手。三条最常用的工作流文件转录把参数调到够用就行文件导入这条线里真正值得碰的参数有三个。一是Export As决定导出成 TXT、SRT 还是 VTT二是 Word-Level Timings单词级时间戳勾上之后每个词都有独立时间轴后面做字幕合并时才玩得转三是 Advanced 里的 Initial prompt初始提示词把容易识别错的人名、专业术语写进去能明显减少错别字。背景很吵的音频可以再开 Extract speech它会先把人声分离出来再转录。实时录音麦克风进文字流式出主界面选一个录音任务设好语言、模型质量、麦克风点 Record 就开始。两个注意点默认 Whisper 后端比较吃资源实时场景建议换 Whisper.cpp 并用小模型另外录音模式里有Append and correct它会在追加新句子的同时回头修正上一句的误差效果最好但更耗算力机器吃紧就退回普通追加模式。开录之后会出现演示窗口的入口全屏一投观众能实时看到字幕开会做手语式展示、活动直播字幕都能用。细节见 实时录音文档。文件夹监控放进来就自动转如果你手上有一整个目录的待处理音频不想一个个导入可以在首选项里配 Folder Watch文件夹监控指定一个目录后新落地的音频文件会被自动识别并转录。配合插件系统里的Skip Already Transcribed重复导入的已转录文件会直接跳过不会白烧一遍算力。⚡ Buzz 模型怎么选才不踩坑Buzz 里的模型其实分两层先选后端Whisper 的几种实现再选规模tiny 到 large。新手最容易绕晕的是后端先看这张表后端特点适合谁Whisper原版准确但慢内存占用大有耐心、硬件好的用户Whisper.cpp快且省支持 Vulkan集显甚至纯 CPU 都能跑没有 N 卡、Mac 用户的首选Faster Whisper比原版快一个量级省内存N 卡且显存 6GB 以上HuggingFace支持大量第三方微调模型有特定语言优化需求规模上的经验值tiny/base 试水和实时够用small 是日常会议的主力medium 往上是正式交付的档位。Large 家族里 V2 更稳、V3 多数情况最准但偶尔会编出音频里没有的词Turbo 则是速度和准头的折中。没有标准答案拿同一段你的目标语言音频各试一次最靠谱。GPU 加速方面Linux 上 N 卡开箱即用Windows 安装包已内置 CUDA 12 支持旧版本 CUDA 会自动回落到 CPU。如果 GPU 反而拖慢速度可以用环境变量BUZZ_FORCE_CPU强制走 CPU。模型下载和管理都在 帮助 → 首选项 → Models 里还能给大模型挑 q_5 这类量化版本省显存。一个容易被忽略的用法模型缓存在本机Linux 在~/.cache/Buzz所以完全可以在有网的机器上把模型下好整个文件夹拷到无网的机器同一位置Buzz 就能纯离线工作。常见问题里有更完整的说明。转录完之后查看、搜索与字幕调整双击任务行打开查看器这是后续所有操作的基地。顶部可以切换时间戳表、纯文本、译文三种视图Ctrl/CmdF 打开搜索栏直接定位关键词播放面板支持 0.5 到 2 倍速还能勾选 Loop Segment 循环某一段、勾选 Follow Audio 让文字跟着音频滚动。导出菜单里 TXT、SRT、VTT、JSON 都能出。真正提效的是 Resize字幕调整功能文档在这里。前提是转录时开了单词级时间戳打开 Resize 后可以设定每行字幕最大长度、是否按标点断句Buzz 会把逐词结果重新合并成适合观看的字幕条如果源音频还在本地它甚至会分析静音间隙来校准边界。字幕一闪而过看不清还有个选项能给每条字幕统一延长显示时长。多人对话的录音可以点Identify speakers做说话人识别它给每句自动贴标签你能试听 10 秒样本、把标签改成真名保存时还能勾选把同一人的连续发言合并成一段。此功能在 Intel 芯片的 Mac 上不可用。三个场景的操作要点会议与访谈录音 说话人识别选 small 或 base 模型保证实时跟得上会议开始时点 Record 录全程用演示窗口给不方便看笔记的与会者实时投字幕。会后打开转录结果跑一遍说话人识别把标签改成人名再导 TXT 发群。录音文件本身留底这是双保险。给视频配字幕转录 调整 导出导入视频后 Buzz 会自动抽取音频。正式内容建议 medium 起步勾上单词级时间戳转完在 Resize 里按最大长度 按标点断句合并成字幕条需要的话给每条延长一两秒最后导 SRT直接拖进剪辑软件时间轴是对齐的不用手动卡点。批量音频文件夹监控 CLI一整个目录的待转文件配好 Folder Watch 让它自己跑想脚本化就用 CLI例如用 Whisper.cpp 的 small 模型转中文音频并直接出 SRTbuzz add -m whispercpp -s small -l zh --srt 音频文件.mp3插件里的 AI Summary 可以在转录完成后自动用 OpenAI 兼容 API 生成摘要存进备注批量处理访谈材料时很省心。 常见卡点按现象排查转得太慢→ 大概率是模型或后端选型问题。先换 Whisper.cpp再把规模降到 small 以下N 卡显存够 6GB 就换 Faster Whisper。实在慢还可以走 OpenAI API 把识别放到远端。识别结果不准→ 优先查三处语言是不是手动指对了音频噪声大不大开 Extract speech 或插件里的 DeepFilterNet 降噪专名是否在初始提示词里。模型越大不必然越准音频质量和语言设置的影响更大。提示PaErrorCode-9999或采不到麦克风→ 多半是系统权限拦了。Windows 去 设置 → 隐私 → 麦克风 里确认 Buzz 的权限杀毒软件的拦截规则也看一眼。启动崩溃→ 常见原因是模型下载不完整。到 Models 面板删掉对应模型重新下仍不行就去 帮助 → About Buzz → Show logs 看日志。另外注意 Buzz 要求 CPU 支持 AVX2非常老的机器跑不起来。离线机器没法用→ 在联网机器上下载好模型把模型缓存文件夹整体拷到离线机器的相同位置即可详见 FAQ。接下来从一条录音到一份对齐的字幕Buzz 全程离线就能走完闭环。想继续深入从 偏好设置 和 使用文档目录 开始看就行日常卡壳先翻 常见问题大多数现象都有现成答案。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考