Buzz离线语音转录指南:一条命令把录音转成带时间戳字幕
Buzz离线语音转录指南一条命令把录音转成带时间戳字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在个人电脑上离线转录和翻译音频的开源桌面工具底层使用 OpenAI Whisper 模型。它内置 4 个本地 Whisper 后端能处理音视频文件、YouTube 链接和麦克风实时输入。音频不上传任何服务器转录、翻译、导出全部在本地完成。适合要整理会议录音、做视频字幕、做访谈研究的人也适合对录音隐私敏感、不想按分钟付费给在线服务的团队。先判断值不值得装适合谁内容创作者需要批量生成 SRT/VTT 字幕研究员需要转录访谈、讲座并保留时间戳职场人士需要整理会议录音敏感内容不想上云系统要求macOSIntel 与 Apple Silicon、Windows、Linux 三平台都有官方安装渠道PyPI 安装需要 Python 3.12 环境和系统已装好 ffmpeg硬件加速覆盖较全NVIDIA 显卡走 CUDA苹果芯片直接跑集成显卡可通过 Vulkan 加速 whisper.cpp 后端两条局限先说清楚Windows 安装程序未签名安装时会弹出安全警告需手动选仍要运行PyPI 版本想用上 NVIDIA GPU要额外手动安装 CUDA 版 PyTorch不是开箱即用从零到出第一个结果普通用户直接下载对应系统的安装包即可macOS 拿 .dmgWindows 拿安装程序Linux 用 Flatpak 或 Snap。本文走 PyPI 路线两条命令pip install buzz-captions python -m buzz首次启动只需配置两处模型档位偏好设置里的模型面板可选 tiny 到 large-v3模型体积 72MB 到 2.9GB首次选用会自动下载。没有显卡的机器建议从 tiny 或 small 开始。语言留空则自动检测也可以直接指定语种检测出错时手动指定更稳。Buzz 任务管理主界面左侧队列管理多个转录任务右侧播放并核对转录结果功能讲解三个核心功能怎么操作多Whisper后端怎么选引擎与硬件加速能做什么Buzz 支持 5 种引擎——OpenAI Whisper、faster-whisper、whisper.cpp、Hugging Face 模型、OpenAI APINVIDIA 显卡可用 CUDAMac 支持 Apple Silicon多数 GPU含集显可用 Vulkan 加速 whisper.cpp。怎么操作在偏好设置的模型面板选择引擎类型和档位NVIDIA 用户确认 CUDA 环境可用。得到什么同一份录音可以在不同后端和模型档位间切换速度和准确率随硬件档位变化引擎与硬件的调度逻辑见buzz/transcriber/目录。转录查看器三步完成编辑与字幕导出能做什么查看器支持搜索、播放控制和倍速调节每一段文字和时间戳都能直接改。怎么操作转录完成后打开查看器 → 点播放器跳到目标位置核对文字 → 用字幕重排功能合并过短或过长的字幕行。得到什么可导出 TXT、SRT、VTT 三种格式的字幕或文稿文件编辑与导出入口在buzz/widgets/transcription_viewer/目录。转录查看器逐段文字带时间戳底部时间轴可定位、播放和逐段编辑文件夹监控与CLI批量转录怎么自动化能做什么把一个文件夹设为监控目录新放进来的音频自动排队转录也可以完全用命令行跑适合写进脚本。怎么操作偏好设置里开启文件夹监控并指定目录CLI 方式把文件路径传给buzz命令配合--model-type、--language、--srt、--word-timestamps等参数指定引擎、语言、输出格式和词级时间戳。得到什么新音频无需手动导入直接出结果命令行的完整参数定义见 buzz/cli.py。模型偏好设置面板选择 Whisper 引擎类型与模型档位首次使用会自动下载模型一次完整实操从法国语录音到SRT字幕以仓库 testdata 目录自带的 whisper-french.mp3 为输入走一遍完整流程打开 Buzz把 whisper-french.mp3 拖进任务列表。选 tiny 档模型72MB最省资源语言留空输出格式勾选 SRT。点击开始Buzz 自动检测出法语并在本地完成转录进度条走完即结束。在转录查看器里点播放头跳到任意位置核对文字与时间戳个别识别错的字直接选中修改。导出文件。最终得到两个文件SRT 字幕文件每段带序号、起止时间戳、逐行文字和 TXT 纯文本。同一份录音把输出格式改成 VTT 再跑一遍就是网页可用的字幕。踩坑与调优模型档位与体积tiny 72MB、small 460MB、medium 1.5GB、large 2.9GB数据来自buzz/model_loader.py卡顿就降一档。8GB 内存的机器建议 tiny/small 档并关闭语音分离16GB 可上 medium32GB 以上加独显再用 large。嘈杂录音先在转录前开启语音分离extract speech再转录准确率更稳。没有独显时优先 whisper.cpp 后端并开启 Vulkan对集显友好。专业术语识别不准就设置初始提示词initial prompt给模型做上下文引导。快速问答完全离线能用吗默认全离线。首次运行需联网下载一次模型之后断网可跑也可改用 OpenAI API 后端走云端。选多大的模型tiny 72MB 到 large-v3 2.9GB 共 10 个档位下载后本地缓存复用日常用 small追求准确率用 large-v3-turbo。支持说话人区分吗支持内置说话人识别功能可在转录后的媒体中区分不同发言者。会议直播怎么用开实时录音转录再启动演示窗口presentation window独立展示字幕适合现场演讲。可以贡献吗项目为 MIT 许可可提交代码、更新buzz/locale/下 13 种语言的翻译或补充docs/文档。Buzz 是一款本地离线语音转录工具4 个 Whisper 后端、TXT/SRT/VTT 导出、麦克风实时字幕一条pip install buzz-captions即可开始。仓库地址https://gitcode.com/GitHub_Trending/buz/buzz【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻