Skip to content

Latest commit

 

History

History
204 lines (155 loc) · 8.86 KB

File metadata and controls

204 lines (155 loc) · 8.86 KB

自定义 ChatGPT、Codex 和 Grok Bot 的输出声音

Persona Voice 在本地替换助手语音,并以近实时速度播放。

English · 简体中文 · 日本語

CI MIT license 桌面应用 Local inference Chatterbox and Seed-VC models

启用 Sayo 的 ChatGPT 语音聊天与 Persona Voice

ChatGPT、Codex 或 Grok Bot 音频通过所选本地语音模型路由到扬声器

Persona Voice 是一款桌面应用,可将 ChatGPT、Codex 或 Grok Bot 的语音输出替换为你选择的 声音。只需选择一次来源应用;对话和控制仍保留在原应用中,语音转换则在本设备上运行。 输出质量与时序会因硬件、输入音频和所选参考而异。

演示

Grok BotCodex
Voice-changer-Grok-demo-40s-v3.mp4
demo.mp4

语音模型

首次设置只需下载一个模型,之后可在 设置 → 语音模型 中安装另一个。 现有安装保留原来的选择;全新 Apple Silicon 安装默认推荐 Chatterbox。

模型 发布年份 语音与性能
Seed-VC Tiny 2024 在本应用的对比中最适合日语和中文。300 毫秒处理块,支持 Apple Silicon 和 x64 NVIDIA CUDA。
Chatterbox 2025 推荐用于英语和其他语言,英语已通过实时试听。Apple Silicon 上使用 640 毫秒处理块。

在 Apple M4 Pro 上处理同一段英语音频时,Chatterbox 的处理时间减少了29%。 质量因语言和声音而异。测量条件、启动延迟、磁盘要求和发布年份来源见 模型对比

为什么选择 Persona Voice

  • 近实时转换。 两种模型都以固定长度的音频块处理语音,并在转换完成后立即流式输出。 实际延迟会因硬件和音频路由而异。
  • 替换原声,而不是叠加播放。 Persona Voice 会抑制所选应用的原始播放, 并把转换后的声音发送到扬声器。
  • 一条中继支持多个语音应用。 无需更换模型、声音或本地转换管线,即可在 ChatGPT (包括 Codex)与 Grok Bot 之间切换。
  • 本地推理。 安装后的转换在你的设备上运行,不需要语音 API 密钥。
  • 预设声音与私有参考音频。 内置目录包含标注来源的 VOICEVOX 角色,以及少量社区和 演示参考。你也可以添加自己有权使用的私有参考音频。
  • 个性化。 选择内置音色、添加你有权使用的私有参考音频,并为每个声音搭配独立角色场景, 让声音与角色保持一致。
  • 可控的本地历史。 历史记录默认关闭。启用后也只保存转换后的音频,并默认在六小时后 自动清理,也可立即清空。

工作原理

ChatGPT / Codex 或 Grok Bot
        │ 语音输出
        ▼
Persona Voice 音频路由
        ▼
所选本地模型:Chatterbox / Seed-VC
        │
        ▼
扬声器

Persona Voice 会在所选应用、本地引擎和输出路由全部就绪后才替换原始播放。 如果无法安全建立路由,转换不会开始。

详细内容参见架构原生协议引擎契约

快速开始

下载并使用

Releases 下载最新的 macOS、Windows 或 Linux 版本。 Windows 设置会打开官方 VB-CABLE 下载页面;请单独安装、重启 Windows,然后按应用内的音量合成器步骤操作。

  1. 启动 Persona Voice,选择 ChatGPTGrok Bot,完成系统音频设置,并下载一个模型。
  2. 选择目标声音并点击 启动语音转换
  3. 在所选应用中照常进入语音模式。

要求见平台状态;如果设置受阻,请查看故障排除

从源码运行

你需要:

  • Git、Bun 1.3.14、Node.js 22.12+ 和 uv
  • 以下任一合格主机配置:带 MPS/MLX 的 Apple Silicon macOS 14.2+、带受支持 NVIDIA CUDA 驱动的 x64 Linux,或 Windows build 20348+ x64 与受支持 NVIDIA CUDA 驱动;
  • 平台原生工具链:macOS 上的 Xcode Command Line Tools,Linux 上的 C++20 编译器与 pkg-config/PipeWire 开发头文件,或 Windows 上的 MSVC/CMake/Windows SDK;
  • Chatterbox 在 macOS 上安装约 4 GiB,设置时需要 8 GiB 空闲空间。
  • Seed-VC 空间:macOS 安装约 2.5 GiB且至少空闲 6 GiB;Windows 安装约 9 GiB且至少空闲 15 GiB;Linux 安装约 11 GiB且至少空闲 15 GiB。
  • Windows 还需要单独安装 VB-Audio 官方 VB-CABLE 驱动。
git clone --recurse-submodules https://github.com/miuuyy/ChatGPT-Persona-Voice.git
cd ChatGPT-Persona-Voice
bun install --frozen-lockfile
bun run dev

Linux 源码运行还需要 PipeWire 和 WirePlumber。平台设置、原生构建命令与贡献者 验证步骤见开发指南

平台状态

平台 可用性 要求与当前限制
Apple Silicon macOS 14.2+ 提供预览包 MPS/MLX;仍需生产签名/公证和全新设备验证
Linux x64 + NVIDIA 提供预览包 CUDA 13.0、PipeWire 和 WirePlumber;仍需更广泛的发行版覆盖
Windows x64 + NVIDIA,build 20348+ 提供预览包 CUDA 13.0 和单独安装的 VB-CABLE;欢迎提供实体 Windows 主机反馈
其他主机 不可用 不支持

详见平台矩阵发布门槛

声音参考

内置目录目前包括四国めたん、ずんだもん、春日部つむぎ、冥鳴ひまり、九州そら、 WhiteCUL、櫻歌ミコ、小夜/SAYO、春歌ナナ、猫使アル、満別花丸、 琴詠ニア、社区 JARVIS 参考,以及未获官方关联的 Donald Trump 演示音色。

VOICEVOX 样本由官方展示音频构建,并保留必要署名。社区与公众人物参考继续受各自条款 约束,不得被描述为真实录音或官方背书。请只使用你有权使用的声音。详见 声音 manifest与单一的 第三方声明清单

安全与隐私

  • 原始捕获 PCM 不会被有意保存或写入日志。
  • 历史记录只接受已提交给输出会话的转换后帧。
  • 只有在本地引擎和音频路由就绪后,才会开始语音替换。
  • 设置、日志、模型、参考音频和可选历史在使用期间保留在本地工作区或应用数据中。
  • 在 macOS 上,BlackHole 与 OBS 是独立信任边界。使用“仅转换音频”录制总线时,必须在 OBS 中静音 macOS Screen Capture 的音频,否则 OBS 也会录下原始系统音轨。

处理敏感音频前,请阅读隐私安全故障排除

开发

bun run test
bun run typecheck
bun run build:renderer
bun run check
bun run smoke:engine

贡献与许可证

欢迎在当前实验性范围内贡献。请先阅读 CONTRIBUTING.md行为准则

启动器原创代码采用 MIT License。Seed-VC 继续采用 GPL-3.0;模型文件、声音 参考与依赖保留各自许可证和条款。参见第三方声明

免责声明

Persona Voice 是独立软件,与 OpenAI、xAI 或 Cursor 无隶属或背书关系。ChatGPT、Codex、 OpenAI、Grok、Grok Bot、xAI 与 Cursor 的名称和标志均归各自权利人所有。本项目不会绕过 身份验证、订阅、权限或访问控制。