要把一批录音、访谈、课程或视频里的说话内容整理成文字稿和字幕,逐条听写不现实。睿君音视频字幕识别提取工具(厂商版)批量把音频和视频送进云端语音识别,输出带时间轴或不带时间轴的 TXT、SRT 字幕或 Excel 表格。厂商版使用你自己的云账号,识别量和单价由你自己的云服务决定。
厂商版和网关版怎么选:厂商版填入你自己的百度云、腾讯云、阿里云或豆包语音账号,识别费用直接结算给云厂商,量大更划算、数据链路自己掌控;网关版不需要注册云账号,用授权码直接识别,适合用量不大或不想折腾密钥的用户。
支持的云厂商与识别参数
| 项目 | 可选内容 |
|---|---|
| 云厂商 | 百度云、腾讯云、阿里云、豆包语音,四选一,各自填写自己的密钥 |
| 豆包服务档位 | 极速版、标准版 |
| 识别语言 | 自动、中文、英文、日文、韩文、法语、德语、俄语、西语 |
| 模型 | 按厂商提供的模型选择,也可以填自定义模型 ID |
四种导出格式
- TXT(带时间轴):每句前带时间,便于定位原片位置。
- TXT(不带时间轴):纯文字稿,直接用于整理、改写、投稿。
- SRT:标准字幕文件,可直接导入剪辑软件。
- EXCEL:逐句成行的表格,适合校对、翻译和团队分工。
支持的音视频格式
- 音频:MP3、WAV、M4A、FLAC、AAC。
- 视频:MP4、MOV、MKV、AVI、WMV,自动取其中的声音识别。
- 可一次添加多个文件,也可以添加整个文件夹批量处理。
批量处理的细节
- 文件列表支持移除选中和清空,避免误加的文件浪费识别额度。
- 输出目录可自行指定,完成后一键打开。
- 处理过程有日志,逐个文件显示识别进度和结果。
- 可随时停止处理,不必等整批跑完。
- 密钥保存在本机配置文件里,下次打开自动带出,不用反复粘贴。
当前线上交付版:厂商版 V3 日志默认显示版(2026-05 打包)。识别由云端完成,需要你自己的云服务账号,识别费用按各家云厂商计费,软件不含识别额度。安装包内不含任何密钥。
软件界面与演示
常见问题
买了厂商版还需要另外付识别费吗?
需要。厂商版用的是你自己的百度云、腾讯云、阿里云或豆包语音账号,识别费用按各家云厂商的计费方式结算,软件本身不含识别额度。不想注册云账号的话可以选网关版。
厂商版和网关版有什么区别?
厂商版填自己的云密钥,费用直接结算给云厂商,量大更划算、数据链路自己掌控;网关版用授权码通过统一网关识别,不用注册云账号,适合用量不大的用户。
视频文件要先转成音频吗?
不用。直接添加 MP4、MOV、MKV、AVI、WMV 等视频,工具会取其中的声音去识别。
识别结果能直接当字幕用吗?
导出 SRT 即可直接导入剪辑软件。语音识别难免有错字和断句问题,正式发布前建议校对一遍;需要精细排版可再用睿君字幕格式转换工具转成带样式的 ASS。
能识别英文、日文等外语吗?
可以选择自动、中文、英文、日文、韩文、法语、德语、俄语、西语。实际支持范围以所选云厂商的能力为准。
