Persona Voice 在本地替换助手语音,并以近实时速度播放。
Persona Voice 是一款桌面应用,可将 ChatGPT、Codex 或 Grok Bot 的语音输出替换为你选择的 声音。只需选择一次来源应用;对话和控制仍保留在原应用中,语音转换则在本设备上运行。 输出质量与时序会因硬件、输入音频和所选参考而异。
| Grok Bot | Codex |
|---|---|
Voice-changer-Grok-demo-40s-v3.mp4 |
demo.mp4 |
首次设置只需下载一个模型,之后可在 设置 → 语音模型 中安装另一个。 现有安装保留原来的选择;全新 Apple Silicon 安装默认推荐 Chatterbox。
| 模型 | 发布年份 | 语音与性能 |
|---|---|---|
| Seed-VC Tiny | 2024 | 在本应用的对比中最适合日语和中文。300 毫秒处理块,支持 Apple Silicon 和 x64 NVIDIA CUDA。 |
| Chatterbox | 2025 | 推荐用于英语和其他语言,英语已通过实时试听。Apple Silicon 上使用 640 毫秒处理块。 |
在 Apple M4 Pro 上处理同一段英语音频时,Chatterbox 的处理时间减少了29%。 质量因语言和声音而异。测量条件、启动延迟、磁盘要求和发布年份来源见 模型对比。
- 近实时转换。 两种模型都以固定长度的音频块处理语音,并在转换完成后立即流式输出。 实际延迟会因硬件和音频路由而异。
- 替换原声,而不是叠加播放。 Persona Voice 会抑制所选应用的原始播放, 并把转换后的声音发送到扬声器。
- 一条中继支持多个语音应用。 无需更换模型、声音或本地转换管线,即可在 ChatGPT (包括 Codex)与 Grok Bot 之间切换。
- 本地推理。 安装后的转换在你的设备上运行,不需要语音 API 密钥。
- 预设声音与私有参考音频。 内置目录包含标注来源的 VOICEVOX 角色,以及少量社区和 演示参考。你也可以添加自己有权使用的私有参考音频。
- 个性化。 选择内置音色、添加你有权使用的私有参考音频,并为每个声音搭配独立角色场景, 让声音与角色保持一致。
- 可控的本地历史。 历史记录默认关闭。启用后也只保存转换后的音频,并默认在六小时后 自动清理,也可立即清空。
ChatGPT / Codex 或 Grok Bot
│ 语音输出
▼
Persona Voice 音频路由
▼
所选本地模型:Chatterbox / Seed-VC
│
▼
扬声器
Persona Voice 会在所选应用、本地引擎和输出路由全部就绪后才替换原始播放。 如果无法安全建立路由,转换不会开始。
从 Releases 下载最新的 macOS、Windows 或 Linux 版本。 Windows 设置会打开官方 VB-CABLE 下载页面;请单独安装、重启 Windows,然后按应用内的音量合成器步骤操作。
- 启动 Persona Voice,选择 ChatGPT 或 Grok Bot,完成系统音频设置,并下载一个模型。
- 选择目标声音并点击 启动语音转换。
- 在所选应用中照常进入语音模式。
你需要:
- Git、Bun 1.3.14、Node.js 22.12+ 和
uv; - 以下任一合格主机配置:带 MPS/MLX 的 Apple Silicon macOS 14.2+、带受支持 NVIDIA CUDA 驱动的 x64 Linux,或 Windows build 20348+ x64 与受支持 NVIDIA CUDA 驱动;
- 平台原生工具链:macOS 上的 Xcode Command Line Tools,Linux 上的 C++20 编译器与
pkg-config/PipeWire 开发头文件,或 Windows 上的 MSVC/CMake/Windows SDK; - Chatterbox 在 macOS 上安装约 4 GiB,设置时需要 8 GiB 空闲空间。
- Seed-VC 空间:macOS 安装约 2.5 GiB且至少空闲 6 GiB;Windows 安装约 9 GiB且至少空闲 15 GiB;Linux 安装约 11 GiB且至少空闲 15 GiB。
- Windows 还需要单独安装 VB-Audio 官方 VB-CABLE 驱动。
git clone --recurse-submodules https://github.com/miuuyy/ChatGPT-Persona-Voice.git
cd ChatGPT-Persona-Voice
bun install --frozen-lockfile
bun run devLinux 源码运行还需要 PipeWire 和 WirePlumber。平台设置、原生构建命令与贡献者 验证步骤见开发指南。
| 平台 | 可用性 | 要求与当前限制 |
|---|---|---|
| Apple Silicon macOS 14.2+ | 提供预览包 | MPS/MLX;仍需生产签名/公证和全新设备验证 |
| Linux x64 + NVIDIA | 提供预览包 | CUDA 13.0、PipeWire 和 WirePlumber;仍需更广泛的发行版覆盖 |
| Windows x64 + NVIDIA,build 20348+ | 提供预览包 | CUDA 13.0 和单独安装的 VB-CABLE;欢迎提供实体 Windows 主机反馈 |
| 其他主机 | 不可用 | 不支持 |
内置目录目前包括四国めたん、ずんだもん、春日部つむぎ、冥鳴ひまり、九州そら、 WhiteCUL、櫻歌ミコ、小夜/SAYO、春歌ナナ、猫使アル、満別花丸、 琴詠ニア、社区 JARVIS 参考,以及未获官方关联的 Donald Trump 演示音色。
VOICEVOX 样本由官方展示音频构建,并保留必要署名。社区与公众人物参考继续受各自条款 约束,不得被描述为真实录音或官方背书。请只使用你有权使用的声音。详见 声音 manifest与单一的 第三方声明清单。
- 原始捕获 PCM 不会被有意保存或写入日志。
- 历史记录只接受已提交给输出会话的转换后帧。
- 只有在本地引擎和音频路由就绪后,才会开始语音替换。
- 设置、日志、模型、参考音频和可选历史在使用期间保留在本地工作区或应用数据中。
- 在 macOS 上,BlackHole 与 OBS 是独立信任边界。使用“仅转换音频”录制总线时,必须在 OBS 中静音 macOS Screen Capture 的音频,否则 OBS 也会录下原始系统音轨。
bun run test
bun run typecheck
bun run build:renderer
bun run check
bun run smoke:engine欢迎在当前实验性范围内贡献。请先阅读 CONTRIBUTING.md 和 行为准则。
启动器原创代码采用 MIT License。Seed-VC 继续采用 GPL-3.0;模型文件、声音 参考与依赖保留各自许可证和条款。参见第三方声明。
Persona Voice 是独立软件,与 OpenAI、xAI 或 Cursor 无隶属或背书关系。ChatGPT、Codex、 OpenAI、Grok、Grok Bot、xAI 与 Cursor 的名称和标志均归各自权利人所有。本项目不会绕过 身份验证、订阅、权限或访问控制。
