前言
在 YouTube 视频制作过程中,除了视频内容本身,配音和多音轨制作也是影响观看体验的重要环节。对于一些没有配音条件,或者希望快速制作不同语言音频版本的创作者来说,将字幕转换成语音是一种非常实用的方式。
YouTube 支持多音轨(Multi-language Audio)功能,创作者可以在同一个视频中添加多个音频轨道,让观众根据需求选择不同语言或不同版本的配音。相比重新录制视频,多音轨可以让视频制作流程更加灵活。
本期教程将带大家使用 Docker 部署 ywsj-tts-studio 项目,搭建一个简单易用的字幕转语音工具。通过该项目,可以将字幕内容快速转换成语音文件,并应用到 YouTube 视频多音轨制作流程中。
相比其他在线字幕转语音服务,自建 ywsj-tts-studio 具有以下优势:
✅ Docker 一键部署,安装简单,方便维护
✅ 本地运行,数据更加可控
✅ 支持字幕快速转换语音
✅ 方便制作 YouTube 视频多音轨文件
✅ 提高视频后期制作效率
本教程将从 Docker 环境配置开始,详细介绍 ywsj-tts-studio 的部署方法、字幕转语音操作流程,以及如何将生成的音频应用到 YouTube 多音轨视频中。
通过这套方案,可以快速完成字幕到语音的转换,让视频后期制作更加简单高效。
我们看下世界第一网红MrBeast 野兽先生
每个视频都自带多钟语言的音频,更适合世界各国人观看


项目图示
web界面

生成中

完成语音转换

项目简介
字幕转语音工具 — 上传 SRT/VTT 字幕,自动生成多语言语音,支持 YouTube 多音轨制作
✨ 功能
- 📝 字幕转语音 — 上传 SRT/VTT 字幕,自动提取文字内容生成语音
- 🌍 322 个音色 — 支持 75 种语言(中文/英语/日语/韩语/法语…)
- 🔊 在线试听 — 每个音色可点击试听语音示例
- ⏱️ 时间轴对齐 — 语音按字幕时间戳精确排列,超长自动加速适配
- 🎚️ 语速/音量调节 — 实时滑块调整
- 🔐 用户认证 — 登录保护,防暴力破解(5次失败锁定5分钟)
- 📋 生成历史 — SQLite 数据库记录每次生成
- 🌗 明暗主题 — 默认亮色,一键切换暗色
- 🐳 Docker 部署 — 一键启动,支持 AMD64 + ARM64 双架构
| 平台 | 架构 | 适用场景 |
|---|---|---|
| linux/amd64 | x86_64 | VPS、PC服务器、Intel/AMD |
| linux/arm64 | ARM64 | 树莓派、Mac M系列、ARM 云服务器 |
🎤 常用中文音色
| 音色ID | 性别 | 风格 |
|---|---|---|
| zh-CN-YunxiNeural | 男声 | 云希(自然,推荐) |
| zh-CN-YunyangNeural | 男声 | 云扬(新闻播报) |
| zh-CN-XiaoxiaoNeural | 女声 | 晓晓(自然,推荐) |
| zh-CN-XiaoyiNeural | 女声 | 晓伊(温柔) |
| zh-CN-YunjianNeural | 男声 | 云健(激情/体育) |
| zh-CN-liaoning-XiaobeiNeural | 女声 | 晓北(东北话) |
| zh-CN-shaanxi-XiaoniNeural | 女声 | 晓妮(陕西话) |
| zh-HK-HiuGaaiNeural | 女声 | 粤语 |
| zh-TW-HsiaoChenNeural | 女声 | 台湾繁体 |
部署方法
使用Docker安装
本教程使用docker的方式安装部署,简单便捷

准备条件
1)一台服务器
我们使用莱卡云VPS来演示(各种NAS/Windows/MAC都可以部署)
需要vps的可以看以下信息,配置尽量选择大点的比如2核心4G内存
莱卡云官网
2)本教程使用到的项目
本教程使用的官方github地址
https://github.com/yyzq-cf/ywsj-tts-studio

项目刚创建,请帮忙点个stars
3)域名(可选)
根据自己的需求,web界面建议绑定域名
VPS部署
一、Docker环境部署
在vps安装docker和docker-compose
Docker官方安装文档(英文)
https://duan.yyzq.eu.org/docker-001
Docker-Compose官方安装文档(英文)
https://duan.yyzq.eu.org/docker-002
Centos安装Docker和Docker-compose(中文)
https://duan.yyzq.eu.org//03
Ubuntu安装Docker和Docker-compose(中文)
https://duan.yyzq.eu.org//04
推荐直接用一键脚本
docker安装脚本
bash <(curl -sSL https://cdn.jsdelivr.net/gh/SuperManito/LinuxMirrors@main/DockerInstallation.sh)
docker-compose安装脚本
curl -L "https://github.com/docker/compose/releases/latest/download/docker-compose-$(uname -s)-$(uname -m)" -o /usr/local/bin/docker-compose && chmod +x /usr/local/bin/docker-compose
二、部署命令
登录服务器使用root账户执行以下步骤
docker-compose命令
创建一个目录,并进入此目录
mkdir ywsj-tts-studio ;cd ywsj-tts-studio
请自行安装vim编辑器
然后再新建docker-compose.yml
vim docker-compose.yml
services: # 定义 Docker Compose 服务
tts-studio: # 服务名称
image: ywsj/tts-studio:latest # 使用 ywsj-tts-studio 最新版 Docker 镜像
container_name: tts-studio # 指定容器名称为 tts-studio
restart: always # 容器退出后自动重启,保证服务持续运行
ports:
- "5100:5100" # 映射宿主机 5100 端口到容器 5100 端口
environment: # 设置容器运行环境变量
- ADMIN_USERNAME=${ADMIN_USERNAME:-admin} # 设置后台登录用户名,默认用户名为 admin
- ADMIN_PASSWORD=${ADMIN_PASSWORD:-admin123} # 设置后台登录密码,默认密码为 admin123
- SECRET_KEY=${SECRET_KEY:-tts-web-secret-key-change-me} # 设置 Web 安全密钥,建议修改为自定义随机字符串
volumes:
- ./output:/app/output # 将当前目录 output 文件夹挂载到容器内 /app/output,用于保存生成的语音文件
注意端口如有冲突自行修改
默认用户名密码
admin
admin123
三、执行容器运行命令
docker-compose up -d #运行容器
docker-compose ps #查看是否启动成功
正常启动如下所示
docker-compose ps
NAME IMAGE COMMAND SERVICE CREATED STATUS PORTS
ywsj-tts-studio ywsj/tts-studio:latest "python -u app.py" ywsj-tts-studio 10 minutes ago Up 10 minutes 0.0.0.0:5100->5100/tcp, [::]:5100->5100/tcp
四、web界面
打开web页面使用
成功以后需要打开自己相应的端口5100)防火墙就可以web端访问了
主界面
http://ip:5100

默认用户名密码
admin
admin123

输入用户名密码即可登录使用
注意
如果你想生成英文语音就使用纯英文字幕
如果你想生成日语语音就使用纯日语字幕
依次类推
各种语言的字幕大家可以让AI翻译下或者使用我之前分享的
卡卡字幕助手

YouTube多音轨添加
选择需要添加的视频-语言

添加语言-根据提示添加即可

等待YouTube官方处理完成即可

其他功能自行探索
绑定域名
VPS上的建议绑定下域名,方便管理。
绑定域名的教程参考以下内容
绑定域名视频教程
B站
YouTube
绑定域名可以参考
NginxProxyManager
https://duan.yyzq.eu.org//npm-ch
有任何问题可以直接留言或者问我
有任何问题可以直接留言或者问我
有任何问题可以直接留言或者问我
欢迎关注我们的微信公众号!


评论区