如何快速上手Voicebox:10分钟看懂本地AI语音I/O全流程
如何快速上手Voicebox10分钟看懂本地AI语音I/O全流程【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voiceboxVoicebox是一款开源、本地优先的 AI 语音工作台AI Voice Studio把语音输入 语音输出整个 I/O 闭环都跑在你自己的电脑上克隆任意声音、生成自然语音、全局听写输入、让 AI 智能体用你克隆的声音说话——全程无云、无账号、数据不出机器。这篇文章带你 10 分钟走完全流程从安装到克隆自己的声音再到生成语音和全局听写。一、为什么选择 VoiceboxVoicebox 相当于把ElevenLabs语音输出和WisprFlow语音输入两大云服务合并进一个免费开源应用并内置本地 LLM 做润色和声音人格能力说明 声音克隆只需 10–30 秒音频样本即可零样本克隆支持 23 种语言️ 7 个 TTS 引擎Qwen3-TTS、Qwen CustomVoice、LuxTTS、Chatterbox 系列、HumeAI TADA、Kokoro可按次切换️ 全局听写按住热键任意 App 里说话Whisper 本地转写后自动粘贴到焦点输入框 智能体语音内置 MCP 服务器让 Claude Code、Cursor 等智能体用你克隆的声音开口说话 完全隐私模型、声音样本、录音全部只存在本机支持 macOSApple Silicon / Intel、Windows、DockerGPU 加速覆盖 MLX、CUDA、ROCm、DirectML、Intel Arc纯 CPU 也能跑。二、一键安装步骤下载安装包macOS 用户下载对应芯片的.app.tar.gz解压后拖入应用程序Windows 用户直接双击 MSI 安装程序。首次启动自动就绪内置 Python 后端服务会自动启动无需手动配置环境。模型按需下载第一次生成时才会下载对应 TTS 模型Kokoro 约 350MBQwen 1.7B 约 3.5GB之后走本地缓存。 系统要求8GB 内存、5GB 空闲磁盘即可。更多细节见 installation.mdx。三、克隆你自己的声音3 分钟声音档案Voice Profile是 Voicebox 的地基点击侧边栏Voices标签选择 New Voice填写名称、语言然后添加样本——上传音频WAV/MP3/M4A10–30 秒清晰人声最佳或直接录音还可以截取系统声音点击Create Profile完成。小技巧样本越多、越干净克隆效果越好不想克隆Kokoro 和 Qwen CustomVoice 自带50 精选预设声音开箱即用档案可以导入/导出方便备份和分享。四、生成你的第一段语音进入Generate标签从下拉框选择刚创建的档案输入要朗读的文本上限 50,000 字符长文会自动分块 交叉淡入拼接无缝超长生成选择 TTS 引擎和语言点击Generate在线试听或下载生成记录自动进入History。两个让声音有戏的开关表情标签选择 Chatterbox Turbo 引擎后在文本里输入/打开插入器加入[laugh]、[sigh]、[gasp]等旁语言标签笑声叹息直接听得见后期效果链基于 Spotify 的 Pedalboard 库提供变调、混响、延迟、合唱、压缩、滤波等 8 种效果内置 Robotic、Radio、Echo Chamber、Deep Voice 四个预设。五、全局听写按住一个键文字自动出现在任何输入框这是 Voicebox 语音 I/O 的输入半边按住默认和弦macOS右 ⌘ 右 ⌥Windows右 Ctrl 右 Shift屏幕上浮现一个悬浮胶囊自然说话——胶囊显示Recording实时波形松开——自动进入TranscribingWhisper 转写→Refining可选本地 LLM 清除口头禅转写结果自动粘贴回你开始说话时聚焦的输入框剪贴板原子保存/恢复不被污染。 隐藏玩法按住期间轻点Space按住模式无缝升级为免手开关模式长篇幅口述不用一直按着键。macOS 首次使用会弹出权限引导按提示授权辅助功能和输入监控即可。六、Captures 标签所有录音的统一档案馆每次听写、应用内录音和上传的音频都会落在Captures标签——原始音频与转写文本成对保存换任意 Whisper 规格重新转写Turbo 比 Large 快约 8 倍用本地 LLM重新润色去口头禅 / 去自我修正 / 保留术语行内编辑转写文本一键把任意录音用克隆声音朗读或升级为声音样本挂到任意档案上。七、Stories 编辑器多轨时间线编排对话与播客想做多人对话、播客、有声书Stories 编辑器提供多轨时间线每个说话人一条轨道音频片段拖拽排列、拖边裁剪直接在时间线上生成新片段播放头同步自动播放整条故事一键Export Audio导出。八、进阶让 AI 智能体用你的声音说话Voicebox 内置MCP 服务器任何支持 MCP 的智能体只需一个工具调用voicebox.speak就能用你克隆的档案朗读任务完成通知、回答、游戏对话还可以设置声音人格让本地 LLM 先入戏改写再由 TTS 朗读。不玩 MCP 也能用 REST APIPOST /generate生成语音、POST /speak朗读、POST /transcribe转写、GET /profiles查档案完整接口文档在http://127.0.0.1:17493/docs。九、想深入关键文档路径速查主题文档路径快速上手docs/content/docs/overview/quick-start.mdx声音克隆docs/content/docs/overview/voice-cloning.mdx听写输入docs/content/docs/overview/dictation.mdx录音与转写docs/content/docs/overview/recording-transcription.mdxStories 编排docs/content/docs/overview/building-stories.mdxMCP 服务器docs/content/docs/overview/mcp-server.mdx项目介绍docs/content/docs/overview/introduction.mdx常见问题 FAQQ第一次生成很慢首次会下载并初始化模型之后走缓存速度会明显提升。Q没有独立显卡能用吗可以全部引擎都支持纯 CPU 运行Kokoro82M 参数在 CPU 上接近实时。Q支持中文吗支持。多个引擎覆盖中文Chatterbox Multilingual 更是支持 23 种语言。Q数据安全吗模型、样本、录音、转写全部存储在本机数据目录无任何云端回传。总结Voicebox 用一套本地化的完整语音 I/O 栈——克隆、生成、听写、转写、智能体语音——让你 10 分钟就能拥有一个私人的声音工作室。下载一个安装包克隆一个声音按住热键说一句你好你就已经上道了。【免费下载链接】voiceboxThe open-source AI voice studio. Clone, dictate, create.项目地址: https://gitcode.com/GitHub_Trending/voicebox1/voicebox创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

相关新闻

最新新闻

日新闻

周新闻

月新闻