端侧 AI · WebGPU

转录音频 就在浏览器中。

Whisper 语音转文字,完全端侧。上传音频或实时录音 — 无服务器、无限制。

检测 GPU 中…
上传或录音
100% 隐私
为何选择 Speech-to-Text

Whisper 级转录。零上传。

OpenAI Whisper 模型通过 Transformers.js 在浏览器本地运行。

100% 隐私

音频永不离开你的设备。所有转录本地完成。

WebGPU 加速

有 GPU 时推理在 GPU 上运行,回退 WASM。

Whisper 模型

多语言语音识别,支持自动语言检测。

上传或录音

拖放音频文件(MP3、WAV、M4A)或从麦克风实时录音。

工作原理

三步完成。零服务器。

  1. 01

    上传或录音

    拖放音频文件或实时录音。支持 MP3、WAV、M4A 等。

  2. 02

    AI 转录

    Whisper 本地运行,将音频转录为带时间戳的文本。

  3. 03

    复制或下载

    复制转录文本或下载为文本文件。模型缓存以供复用。

完整指南

关于语音转文字工具

一个免费的语音转文字工具,在你自己的浏览器里本地转写音频和视频,由运行在你设备上的 Whisper 模型驱动。它面向会议、访谈、讲座、播客和语音备忘录——包括那些不应该上传到云端转写服务的敏感录音。

工作原理

音频先在浏览器中用 Web Audio API 解码,然后由 Whisper 模型(基于 Transformer 的语音识别)通过 Transformers.js 运行。在支持 WebGPU 的 Chrome 或 Edge 上,模型由你的 GPU 执行,一小时的音频只需实际时长的很小一部分即可转写完;在其他浏览器上,WebAssembly 路径保证功能一致。模型文件下载一次后会被缓存,之后可以离线转写。转写结果可以复制为纯文本,也可以带时间戳导出。

限制与要求

浏览器里运行的是轻量级的 Whisper 版本,主打快速与免费;它对清晰的语音表现很好,但在浓重口音或嘈杂的多人录音上,不如付费的大模型 API 宽容。数小时级的超长文件在低内存设备上可能触发浏览器内存上限,拆分成多段是可行的变通办法。

隐私

这正是它与云端服务的关键区别:你的录音永远不会被上传。访谈、机要通话和个人备忘都在你自己的机器上处理并留存,而且没有按分钟计费。

帮助

常见问题

不会。全部处理都在浏览器里完成。Whisper 模型从 Hugging Face 下载一次后会缓存在本地,之后转写 100% 在设备端进行。