生成字幕, 并在本地翻译。
把任意视频或音频变成带时间轴的 SRT、VTT 或 ASS 字幕——配词级编辑器与第二种语言,全部在浏览器里完成。
广播级字幕,零上传。
Whisper 转写、Marian 翻译与真正的字幕编辑器,全部本地运行。
100% 私密
你的素材永不离开设备。解码、转写与翻译都在本地完成。
WebGPU 加速
可用时转写在 GPU 上执行,并保留 WebAssembly 回退。
词级时间轴
带时间戳的 Whisper 模型提供逐词时间,字幕更紧凑,也支持卡拉 OK 导出。
双语输出
翻译成第二种语言,并以任意顺序双语堆叠导出。
从素材到字幕。
- 01
拖入视频或音频
拖入 MP4、WebM、MP3、WAV 或 M4A,在本地解码——不会上传。
- 02
Whisper 生成字幕
语音以重叠窗口转写,再按广播时间规范规整。
- 03
编辑、翻译、导出
在工作室里修订字幕、添加译文,然后下载 SRT、VTT、ASS、TXT 或 JSON。
关于字幕生成工具
一个免费的视频转字幕工具:用 Whisper 听懂你的音频,生成带时间轴的字幕,还能翻译成第二种语言——全部在浏览器里完成。它面向创作者、教师、记者,以及任何需要为访谈、讲座、录屏或 Vlog 配字幕、又不愿把原始素材交给云端服务的人。
工作原理
先用 Web Audio API 解码音轨并重采样为 16 kHz 单声道,再由通过 Transformers.js 运行的 Whisper 模型转写。文件以 30 秒、带重叠的窗口依次处理,所以长录音可以边跑边看到进度,词级时间戳在窗口边界处也能保持准确。因为工具使用的是带时间戳的 Whisper 构建,每条字幕都附带逐词时间,用于驱动卡拉 OK 预览与 ASS 卡拉 OK 导出。
翻译使用紧凑的 Marian(OPUS-MT)模型;当源语言与目标语言之间没有直接模型时,会以英语作为中轴。转写与翻译模型都只需下载一次并会被缓存,因此同一语言组合的第二次运行可以离线完成。
编辑与质量
生成的字幕并非定稿。工作室把实时预览——带广播风格的字幕叠加层和可拖动的波形时间轴——与字幕编辑器放在一起,支持行内改字、在播放头处切分、合并、复制、跨双轨的查找替换、整体时间平移,以及完整的撤销/重做。质量面板会标出所有时长、阅读速度、行长或重叠不符合常规字幕规范的条目,一键即可重新规整整份文档。
成品可导出为 SRT、WebVTT、ASS、纯文本或结构化 JSON,可选原文、译文,或以任意阅读顺序双语堆叠。
限制与要求
首次运行需要下载模型权重,这是最慢的一步,之后会被缓存。WebGPU(Chrome 或 Edge)能让转写快上数倍,Safari 与 Firefox 则回退到 WebAssembly。翻译使用紧凑的开源模型,处理日常对话与旁白很强,但不应托付法律、医疗等高风险措辞。超长录音在低内存设备上可能耗尽内存,拆分成多段是可行的变通办法。
隐私
云端字幕服务会收到你未经剪辑的素材和脚本。这里什么都不会上传:视频在你自己的机器上解码、转写、翻译,唯一离开标签页的文件,是你主动下载的那份字幕。