自然文本转语音 就在浏览器中。
Kokoro-82M 驱动的端侧神经语音合成。支持英语与普通话共 128 种语音,零服务器。
神经语音。零上传。
工作室级 TTS 完全通过 Transformers.js 在设备上运行。
100% 隐私
文本永不离开浏览器。所有合成本地完成。
WebGPU 加速
有 GPU 时推理在 GPU 上运行,回退 WASM。
Kokoro-82M
Apache-2.0 开源神经 TTS:英语引擎 + 原生普通话音色引擎(v1.1-zh),中文音色可自然地中英混读。
128 种语音
28 个美式/英式英语音色(含 A-F 质量评级),以及 100 个普通话音色(女声/男声)。
三步完成。零服务器。
- 01
输入或粘贴文本
输入要转为语音的文本。
- 02
选择语音
从 128 种英语或普通话音色中选择,按需调整语速。
- 03
播放或下载
在浏览器中试听或下载 WAV 音频文件。
关于神经网络文本转语音工具
一个免费的文本转语音工具,用 Kokoro 神经语音模型完全在你的浏览器里生成听起来自然的语音。你可以用它做旁白草稿、视频配音、语言学习、无障碍朗读,或者把写好的内容读出来试听——不需要账号、不需要 API Key,也不按词计费。
工作原理
Kokoro 是一个紧凑、高质量的神经 TTS 模型,通过 Transformers.js 运行,并在浏览器支持时启用 WebGPU 加速。工具内置两套引擎:28 个美式与英式英语语音(按自然度评为 A–F 级),以及 100 个普通话音色,其中包含能自然朗读中英混合文本的 v1.1-zh 版本。文本在本地合成为音频,可即时播放并导出为 WAV。语音文件和模型权重下载一次后会被缓存,此后合成可离线完成。
限制与要求
首次运行需要下载模型和语音数据。每次生成最多支持 500 个字符,因此较长段落适合分段处理;模型缓存后,合成本身只需几秒。英语和普通话的效果最好——这正是本工具内置的两套引擎。
隐私
云端 TTS 服务会收到你输入的每一个字——其中常常包含机密的草稿内容。在这里,你的文本永远不会离开浏览器。你朗读的脚本、笔记和文档从设计上就是私密的。