WebM
直接上传
无需手动提取音轨
从视频开始
在下方选择可播放的 WebM。处理前可设置口语语言、说话人识别、背景、关键词和转录样式。
WebM
无需手动提取音轨
99
选择语言或自动检测
5 GB
每次上传一个可播放视频
4
TXT、Markdown、SRT 和 VTT
四步完成转录
在同一个工作区内完成 WebM 直接上传、源视频复核和导出。
选择一个不超过 5 GB 的可播放 WebM,无需先提取音轨。
选择口语语言或自动检测,并按需添加说话人识别、背景或关键词。
登录并确认预计积分,让任务在后台继续处理。
对照视频检查初稿、编辑文字,并导出 TXT、Markdown、SRT 或 VTT。
观看、聆听、核对
将 WebM 源视频放在初稿旁边,回放不确定内容、跟随时间点、重命名说话人,并在导出前保存修正。


容器、音轨与语音
WebM 表示媒体容器,并不保证内部编码或转录质量。当前流程听取音轨而不是读取视频画面,因此清晰语音比分辨率或帧率更重要。
上传前播放视频并确认人声清楚可听。无声画面、幻灯片和屏幕文字不会自动成为转录内容。
WebM 可以包含不同的视频和音频编码。扩展名与媒体类型匹配后,文件仍需可播放且可读取。
人声音量、麦克风距离、背景音乐、噪声和多人重叠说话比分辨率更影响结果。
请将文件控制在 5 GB 内。更高分辨率会让 WebM 更大,却不会为语音转录增加有效信息。
从视频到可用文字
WebM 转录稿让视频中的口述内容更便于搜索、编辑、引用、整理和制作字幕,但不会声称分析画面。
把带讲解的操作流程与产品演示转成可搜索文字,并随时对照视频核实细节。
生成带说话人标签的可编辑转录稿,并可复核与重命名标签。
从讲课、网络研讨会和培训录像中整理笔记或带时间轴的字幕。
复用视频中实际说出的内容;没有说出的幻灯片文字不会自动进入转录稿,可按需手动补充。
WebM 转录常见问题
了解 WebM 音轨、容器、纯画面内容、积分、导出和源视频访问等常见问题。
可以。可播放且文件类型为受支持 video/webm 的 WebM 可以直接上传,无需先提取音频。
不会。当前流程只转录说出的语音,不会通过 OCR 或视觉分析读取幻灯片、屏幕文字、图表、手写内容、无声画面或烧录字幕。
不是。WebM 是媒体容器,扩展名本身不能保证内部视频或音频编码。文件需要能够播放,并通过类型、大小和时长校验。
没有清晰语音的视频可能只产生少量文字,也可能没有可用转录稿。系统不会用画面内容补写音轨中不存在的语音。
单文件上传上限为 5 GB,每次上传一个可播放视频。更高分辨率会增大文件,却不会自动改善语音识别。
服务支持 99 种语言。新账号可获得 10 个注册积分且无需信用卡,1 个积分可转录 1 分钟。
可以。在源媒体保留期内,你可以边播放视频边查看转录稿,复核不确定片段、重命名说话人并保存修改。
可导出 TXT 或 Markdown 作为可编辑文字,也可导出带转录时间轴的 SRT 和 VTT。这些导出不会提取内嵌字幕,也不会生成摘要或翻译视频。
源视频从任务创建起最多保留七天,也可以提前删除。已保存的文字仍可继续复核和导出。