写好文案之后还要配音、对时间轴、做字幕,一条一条手工做太慢。睿君配音+字幕批量生成工具可以把一批 TXT 文稿直接转成 MP3 配音和同步的 SRT 字幕,需要的话还能一步生成带硬字幕的 MP4 成片,适合口播视频、有声内容、课程讲解和批量短视频的前期制作。
一份 TXT 能产出什么
- MP3 配音:按文稿分句合成,自动拼接成完整音频。
- SRT 字幕:时间轴与音频严格对应,可直接导入剪辑软件。
- MP4 成片(可选):纯色背景 + 音频 + 硬烧字幕,勾选即可一步出片。
支持的语音合成后端
| 后端 | 说明 |
|---|---|
| 火山引擎 / 豆包(默认) | 走单向流式接口,边合成边落盘;内置 12 个语音合成 2.0 音色,按音色自动匹配资源 |
| 阿里云 CosyVoice | 填入 API Key 与音色名即可使用 |
| 腾讯云 | 填入 SecretId / SecretKey 与音色编号 |
| 百度 | 填入 App ID / API Key / Secret Key |
| 微软 Edge | 免费后端,适合先试跑流程 |
逐句缓存:重跑不会重复扣额度
文稿按句合成,每成功一句立刻写入缓存。中途某句失败时只重试这一句;下次再跑同一份文稿,已经成功的句子直接复用缓存,不会从第一句重新消耗云服务额度。缓存身份包含后端、音色、语速和音量,改了参数会重新合成,不会拿旧音频糊弄你。
字幕样式与视频导出
- 字幕样式可调:字号、颜色、描边、描边色、底边距、对齐方式。
- 可开启背景框,并调整背景色、透明度和内边距。
- 可指定任意 .ttf 字体,安装包内已附带 15 款常用中文字体。
- 提供首帧预览图,所见即所得,确认效果再批量出片。
- 视频导出支持预设分辨率与纯色背景,字幕为硬字幕。
使用步骤
- 在设置里填入所选云服务的密钥,选择后端与音色。
- 选择存放 TXT 文稿的目录,确认输出目录。
- 调整语速、音量等参数,需要视频时勾选“同时生成带字幕的视频(MP4)”并设置字幕样式。
- 点击开始,日志区实时显示每句的合成情况。
- 完成后检查 MP3、SRT 与 MP4,直接用于剪辑或发布。
_internal 目录一起使用。导出 MP3 与合成视频建议本机安装 ffmpeg,视频硬字幕需要 ffmpeg 带 libass。安装包内的配置文件不含任何密钥,需要你自己填写。
软件界面与演示

常见问题
买了软件就能直接配音吗?还要不要另外花钱?
语音由云端 TTS 服务合成,需要你自己的 API 账号,合成费用按各家云服务的计费方式结算,软件不含额度。想先零成本试流程,可以选微软 Edge 免费后端。
中途失败重跑,前面已经合成的句子会重复扣费吗?
不会。每句成功后立即写缓存,重试只针对失败的那一句;重新运行同一份文稿时,已成功的句子直接复用缓存,不再调用云端接口。
字幕时间轴准不准?能直接导入剪辑软件吗?
字幕时间轴按每句实际合成出来的音频长度生成,与 MP3 严格对应,输出标准 SRT,可直接导入剪映、Premiere 等常见剪辑软件。
生成视频提示缺少 ffmpeg 怎么办?
MP3 导出和视频合成都依赖本机 ffmpeg,硬字幕还需要 ffmpeg 编译时带 libass。装好 ffmpeg 并加入系统 PATH 后重新运行即可,只要 MP3 和 SRT 的话可以不装。
文件夹版和单文件版有什么区别?
单文件版只有一个 EXE,启动稍慢;文件夹版启动快但必须连同 _internal 目录一起复制,缺了它无法运行。两个版本功能相同。
