上周三晚上十点多,一个做短视频的朋友给我发消息,说文案写好了,但自己录音总卡壳——重录了七八遍,不是念错字就是语气不对。她问我:有没有办法直接把文字变成语音文件,然后发出去?
还真有。
这事儿现在一点都不难。下面把我自己用过、也帮别人折腾过的几种法子整理出来。
汇帮AI语音识别软件
双击打开软件,首页就能看到功能入口。点【文字转语音】进去。
文本框里可以直接打字,也可以从别处复制粘贴过来。我一般是在Word里写好文案,检查一遍错别字,再整段贴进去。长文本也没问题,几千字都吃得下。
然后呢,就是调参数。语音类型有好几种可选——男声女声、不同风格,挑一个跟你内容调性搭的。背景音乐可以加也可以不加,看用途。语速和音量都能拖,建议先试听一小段,觉得不对劲马上改。别嫌麻烦,这一步花三十秒,能省掉后面重新合成的功夫。
输出目录记得选一下。默认路径也行,但回头找文件可能得多翻两下。我习惯单独建个文件夹放。
最后点右下角【开始合成】。等进度条走完,音频文件就出来了。
### 会写代码的话,这条路更自由
Python方案
适合开发者,或者愿意折腾的人。两个库比较常用。
pyttsx3 是离线的,不依赖网络。装好之后几行代码就能跑:
import pyttsx3
engine = pyttsx3.init()
engine.setProperty('rate', 150)
engine.setProperty('volume', 0.9)
engine.say("Hello, 这是中文测试")
engine.runAndWait()
语速那个150,你可以改成自己舒服的值。音量范围是0到1之间。
另一个是 gTTS,调用的是Google的接口,音质相对自然一些,但需要联网:
from gtts import gTTS
import os
tts = gTTS(text='这是中文语音合成示例', lang='zh-cn')
tts.save("output.mp3")
os.system("start output.mp3")
生成的是mp3文件,拿去用就行。缺点嘛——网络不好的时候会卡。而且Google的服务,你懂的。
WPS也能凑合用
把文字打进Word文档,找到【审阅】选项卡,里面有个【朗读】按钮。点开之后可以选全文朗读或者只读选中的部分。声音通过系统扬声器放出来。
搜狗听写手机版
这玩意本来是做语音输入转文字的,反过来用也行——你对着它说话,它转成文字。但我们要的是文字转语音对吧?那就得换个思路:用它把文字识别出来之后,再用系统自带的TTS朗读。
偶尔用一次,WPS或者在线工具就能对付。要批量处理、对音质有要求、或者不想把内容传到别人服务器上,本地软件更稳妥。会编程的话Python方案最灵活,想怎么调就怎么调。
关键是先搞清楚自己的使用场景。是发个语音消息?还是做短视频配音?还是给课件加旁白?需求不同,选的工具也不一样。
别在工具选择上纠结太久。随便挑一个先跑通流程,用着不顺手再换,比反复比较参数要实在得多。