Buzz 本地音频转录实用手册:一个下午,把语音变成文字和字幕

📅 发布时间:2026/8/14 9:20:35
Buzz 本地音频转录实用手册:一个下午,把语音变成文字和字幕 Buzz 本地音频转录实用手册一个下午把语音变成文字和字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款开源的本地音频转录工具基于 OpenAI Whisper 语音识别技术能在你个人电脑上完全离线地完成音频与视频的转写、翻译和字幕生成。适合需要处理会议录音、访谈素材、视频字幕的普通用户、内容创作者和职场人士。本文用问题驱动的方式带你从安装到进阶玩法完整上手。从一次崩溃的会议记录说起假设你刚开完一场 90 分钟的头脑风暴会。人手一份录音回到工位打开播放器开始 1.5 倍速回放边听边敲键盘。三小时后你发现会议是开完了但记录只完成了前二十分钟而且那段关于预算的数字还记错了。这不是你的错。人耳转写本来就是一件高能耗、低产出的苦差事——它同时占用了你的听力、打字速度和注意力。你应该把这件事交给工具把脑子留给思考。这正是 Buzz 想解决的场景。Buzz 是什么一个永远在线的本地听写员你可以把 Buzz 想象成一位不拿工资、不吃盒饭、永远在岗的速记员。你丢给它一个音频或视频文件它就闷头转写然后把带时间戳的文字交还给你。它最打动人的一点是全程离线运行。录音不需要上传到任何服务器隐私完全留在这台电脑里。对记者、律师、医疗从业者这类对数据敏感的人群来说这一点几乎是决定性的。用生活化的话说云转录工具像把文件寄给外包公司而 Buzz 是把打字机搬回家自己用。它适合的人️ 每周要整理会议纪要的职场人 需要把访谈、田野录音转成文字的研究者 给视频做字幕的内容创作者 在意数据隐私、希望本地处理的任何人核心概念一页纸Whisper 与模型大小Buzz 的大脑是 OpenAI 开源的Whisper 模型——一套经过海量多语言语音训练的神经网络。它跟声音指纹很像能听、能认字、还能顺带翻译成英文。理解 Buzz 只需抓住一个概念模型大小。Whisper 提供了 tiny、base、small、medium、large 等不同尺寸的模型就像相机镜头——大光圈进光多但机身重小镜头轻便但画质一般。模型大小速度准确率适合场景tiny⚡最快中等实时转录、短视频、快速粗转base快良好日常会议、语音笔记small中等优秀播客、采访、一般内容medium较慢极佳专业内容、课程large最慢顶级学术研究、高要求场景在 Buzz 界面里质量选项与模型大小是直接对应的极低tiny低base中small高medium。给新手的建议先拿 base 或 small 跑一遍确认准确率够用如果专业术语频繁出错再升级到 medium。别一上来就选 large——第一次下载模型就要好几个 GB转录十分钟音频可能要等半天。渐进上手路径 阶段一新手起步十分钟出第一条文字先装好 Buzz。三种方式任选平台方式备注Windows / macOS从 SourceForge 下载安装包Windows 版未签名安装时选更多信息→仍要运行Linuxflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzzPython 开发者pip install buzz-captions然后python -m buzz需要先装 ffmpeg建议 Python 3.12然后转录你的第一个文件打开 Buzz点击工具栏的按钮快捷键Ctrl/Cmd O选择一个音频或视频文件比如一段 mp3 录音、一段 mp4 课程在右侧配置任务类型转录保留原语言翻译转成英文、语言建议手动选择准确率更高、质量等级点击运行等待进度条走完完成后的状态列会显示Completed双击这一行就能看到带时间戳的完整文字稿。 阶段二日常使用把结果导出成你要的格式转录完成后Buzz 的查看器转录查看器会展示一个时间轴 文字的表格每一段文字都有开始和结束时间你可以点播放按钮边听边看当前播放到的文字会同步高亮。需要导出时点击Export按钮可选TXT纯文本适合直接复制分享SRT标准字幕格式能直接拖进剪映、PremiereVTT网页视频常用字幕格式JSON结构化数据方便程序二次处理 如果你常做字幕建议导出 SRT——这是视频编辑器通用的交换语言。 阶段三进阶玩法用命令行批量处理Buzz 内置了命令行接口适合批量场景。用法是buzz add 参数 文件列表# 转写单个音频指定中文、medium 模型 buzz add --task transcribe --language zh --model-size medium meeting.mp3 # 翻译法语音频到英语并导出 SRT 字幕 buzz add --task translate --language fr --model-type whispercpp --srt french_audio.mp3 # 一次批量处理所有 mp3输出到指定目录隐藏界面 buzz add --task transcribe --srt --vtt --txt --output-dir ./transcripts --hide-gui *.mp3关键参数速查--model-type选后端whisper、whispercpp、fasterwhisper、huggingface、openaiapi--prompt提供初始提示词提升准确率--word-timestamps生成单词级时间戳。亮点功能逐个击破1. 实时录音转录会议没开完稿子已生成点工具栏的麦克风图标选择输入设备Buzz 就会边录边转。配合演示窗口还能把实时转录结果全屏投影出来——讲座、会议现场直接投屏观众看到的字幕和你说的话同步滚动。有两个实用设置藏在偏好设置里实时转录导出开启后转录文本实时写入 txt 文件可以直接喂给 OBS Studio 做直播字幕实时识别模式下方追加新句子往底部加、上方追加新句子在顶部、追加并修正最省版面但吃性能⚠️ 提醒实时转录非常吃资源。用默认的大模型很难做到实时建议切到Whisper.cpp 后端 Tiny 模型这是官方文档明确推荐的实时组合。2. 说话人识别分清楚谁说了什么多人会议最头疼的就是这话是谁说的。Buzz 支持说话人识别转写后能区分不同发言者导出的文稿里会标出说话人整理会议纪要时直接省掉最费神的环节。3. 文件夹监控丢进文件夹它自己干活在偏好设置 → Folder Watch里设置一个监控目录之后只要往这个文件夹丢新音频Buzz 就自动开始转录。适合固定每周处理一批录音的团队或者要归档大量历史音频的人。配合跳过已转录文件插件重复导入也不会二次处理。4. 字幕调整让 SRT 真正能看Whisper 输出的句子切分不一定适合字幕阅读——有的太长有的太碎。Buzz 提供Resize字幕调整功能设定期望的字幕长度、按静默间隙合并短句、按标点分割长句、强制最大长度。调整完再导出 SRT字幕观感立刻上一个档次。避坑指南坑 1转录速度慢到怀疑人生原因模型太大或没用上 GPU。 对策换 tiny/base 小模型确认显卡支持 CUDANVIDIA或 Apple Silicon 原生加速桌面独显还能用 Whisper.cpp 的 Vulkan 加速连集成显卡都支持。坑 2识别准确率不稳定人名术语全是错的原因语言靠自动检测模型偏小。 对策手动指定语言这比自动检测更稳在初始提示里塞入人名、术语表必要时上 medium 模型。对嘈杂音频试试提取语音功能或 DeepFilterNet 降噪插件。坑 3想离线用但模型下不下来原因模型下载需要网络离线机器没有模型文件。 对策在联网电脑上通过偏好设置 → 模型下载点显示文件位置找到缓存目录Linux 在~/.cache/Buzz/models整个拷到离线电脑的相同位置即可。坑 4实时录音提示麦克风错误PaErrorCode-9999原因系统没给 Buzz 麦克风权限。 对策检查系统隐私设置里的麦克风授权Windows 用户看设置→隐私→麦克风。横向对比Buzz 适合什么场景场景推荐方案理由敏感数据、离线环境Buzz本地音频不出这台电脑追求顶级准确率、不差钱OpenAI API / 云服务云端大模型更强但按量计费、需上传数据实时会议直播字幕Buzz Whisper.cpp Tiny本地延迟低可投屏、可喂 OBS偶尔转录一两次任意在线网页工具不必安装软件但注意隐私与文件大小限制一句话想要隐私、离线、可批量、可自动化选 Buzz只求一次性最高准确率云服务更省心。行动清单与延伸开始行动吧按这个清单打勾按自己的平台安装 Buzz安装包 / Flatpak /pip install buzz-captions用 base 模型转录一段 5 分钟音频体验完整流程打开转录查看器试一次边听边看同步高亮导出一份 SRT 字幕拖进剪辑软件验证效果用 CLI 批量转写一个文件夹buzz add ... --hide-gui设置文件夹监控让转录自动化需要时再探索插件AI 摘要、DOCX 导出、降噪等想继续深入可以从这些入口入手官方使用指南与常见问题docs/命令行完整参数说明buzz/cli.py转录引擎与多后端实现buzz/transcriber/插件系统与内置插件buzz/plugins/若想自己开发可先克隆仓库https://gitcode.com/GitHub_Trending/buz/buzz再参考 CONTRIBUTING.md从今天起把转录这件苦差事交给 Buzz把时间还给自己。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考