On-device TTS · Kokoro-82M

自然文本转语音 就在浏览器中。

Kokoro-82M 驱动的端侧神经语音合成。支持英语与普通话共 128 种语音,零服务器。

检测 GPU 中…
128 neural voices
100% 隐私
为何选择 Voice Synth

神经语音。零上传。

工作室级 TTS 完全通过 Transformers.js 在设备上运行。

100% 隐私

文本永不离开浏览器。所有合成本地完成。

WebGPU 加速

有 GPU 时推理在 GPU 上运行,回退 WASM。

Kokoro-82M

Apache-2.0 开源神经 TTS:英语引擎 + 原生普通话音色引擎(v1.1-zh),中文音色可自然地中英混读。

128 种语音

28 个美式/英式英语音色(含 A-F 质量评级),以及 100 个普通话音色(女声/男声)。

工作原理

三步完成。零服务器。

  1. 01

    输入或粘贴文本

    输入要转为语音的文本。

  2. 02

    选择语音

    从 128 种英语或普通话音色中选择,按需调整语速。

  3. 03

    播放或下载

    在浏览器中试听或下载 WAV 音频文件。

完整指南

关于神经网络文本转语音工具

一个免费的文本转语音工具,用 Kokoro 神经语音模型完全在你的浏览器里生成听起来自然的语音。你可以用它做旁白草稿、视频配音、语言学习、无障碍朗读,或者把写好的内容读出来试听——不需要账号、不需要 API Key,也不按词计费。

工作原理

Kokoro 是一个紧凑、高质量的神经 TTS 模型,通过 Transformers.js 运行,并在浏览器支持时启用 WebGPU 加速。工具内置两套引擎:28 个美式与英式英语语音(按自然度评为 A–F 级),以及 100 个普通话音色,其中包含能自然朗读中英混合文本的 v1.1-zh 版本。文本在本地合成为音频,可即时播放并导出为 WAV。语音文件和模型权重下载一次后会被缓存,此后合成可离线完成。

限制与要求

首次运行需要下载模型和语音数据。每次生成最多支持 500 个字符,因此较长段落适合分段处理;模型缓存后,合成本身只需几秒。英语和普通话的效果最好——这正是本工具内置的两套引擎。

隐私

云端 TTS 服务会收到你输入的每一个字——其中常常包含机密的草稿内容。在这里,你的文本永远不会离开浏览器。你朗读的脚本、笔记和文档从设计上就是私密的。

支持

常见问题

不会。一切都在你的浏览器中运行。模型首次从 Hugging Face 下载后缓存在本地,之后的合成 100% 在设备上完成。