客户需求
部分客户要求AI说话的时候要能和真人说话一样,比如说长句子有换气的声音,尽可能以假乱真,让用户以为电话里面说话的是真人。
Minimax Speech 2.8 模型支持自然语气标签,可以TTS文字里面插入语气词标签来实现换气、咳嗽等效果。
语气词标签:
仅当模型选择 speech-2.8-hd 或 speech-2.8-turbo 时,支持在文本中插入语气词标签。支持的语气词:
(laughs)(笑声)、(chuckle)(轻笑)、(coughs)(咳嗽)、(clear-throat)(清嗓子)、(groans)(呻吟)、(breath)(正常换气)、(pant)(喘气)、(inhale)(吸气)、(exhale)(呼气)、(gasps)(倒吸气)、(sniffs)(吸鼻子)、(sighs)(叹气)、(snorts)(喷鼻息)、(burps)(打嗝)、(lip-smacking)(咂嘴)、(humming)(哼唱)、(hissing)(嘶嘶声)、(emm)(嗯)、(sneezes)(喷嚏)
TTS配置
模型选择 speech-2.8-hd 或 speech-2.8-turbo
{
//"url": "wss://api.minimaxi.com", 如果需要wss调用打开这个,默认ws调用
/*
"pronunciation_dict": {
"tone": [
"处理/(chu3)(li3)",
"危险/dangerous"
]
},
*/
"type": "minimax",
/* engine 列表
speech-2.6-hd 最新的 HD 模型,韵律表现出色,极致音质与韵律表现,生成更快更自然
speech-2.6-turbo 最新的 Turbo 模型,音质优异,超低时延,响应更灵敏
speech-02-hd 拥有出色的韵律、稳定性和复刻相似度,音质表现突出
speech-02-turbo 拥有出色的韵律和稳定性,小语种能力加强,性能表现出色
*/
"engine": "speech-2.8-turbo",
"filterparenthesis": false, //不要过滤括号内容,如果这个不配置为false,会把语气标识给过滤了。
"text_normalization": true, //是否启用中文、英语文本规范化,开启后可提升数字阅读场景的性能,但会略微增加延迟,默认值为 false
"language_boost": "auto", //是否增强对指定的小语种和方言的识别能力。默认值为 null,可设置为 auto 让模型自主判断。可用选项: Chinese, Chinese,Yue, English, 等
"key": "", //获取API密钥 请看 https://platform.minimaxi.com/user-center/basic-information/interface-key
}大模型流式输出改为启用【不能用自动】
大模型全局配置流式输出改成启用,节点配置就自动改过来了。不要一个一个节点去修改。
注意大模型流式输出自动模式下,minimax 合成的声音会出现一个字一个字读,需要改成启用,让大模型输出标点的时候再发给minimax 去合成。具体可以看流式输出说明
大模型提示词配置示例
开场白固定话术 ,在文本中添加语气词标签。
例子:
你好,我是上海这边法律咨询中心的(breath),近期我们针对个人和企业用户开放了免费的法律咨询服务,不管是欠款追讨,消费维权,劳动还是其他法律问题,都可以免费咨询(breath)。请问您近期有遇到相关的法律困扰吗?
让大模型主动添加语气词标签。
在大模型提示词添加下面内容,可以根据实际情况优化和修改。
##输出要求##
因为输出的文本,需要通过tts朗读,为了更像真人,需要再合适的地方添加TTS换气标识“(breath)”。推荐的做法是句末添加(breath),如果超过10个字,逗号后面也添加(breath)。 注意输出的末尾不要添加(breath)
标签使用规则
标签必须用英文半角括号包裹:
(exhale)、(breath)标签插入位置:句末、分句之间,模拟真人换气节奏
避免连续使用多个标签,防止语音卡顿
录音示范
下面例子一个插入了换气标识,一个没有插入,可以试听一下效果。
注意:如果复刻的音频里面有换气声音,那么复刻出来的发音人,不需要添加换气标识,也会有换气效果。建议是把复刻音频里面的换气声音清除,然后再去复刻,通过大模型来插入换气标识。
律所咨询女声|带呼吸声:
https://sip.ddrj.com/#/queueDialeronlineextra?shareId=3c6aad82-e7d5-45cc-a388-10b831f60baf
律所咨询女声|无呼吸声:
https://sip.ddrj.com/#/queueDialeronlineextra?shareId=eac0e7bd-bde0-409b-8553-ad066c5021a3
官方后台复刻方法:
注册、登录、 实名认证后打开下面的浏览器
https://solutions.minimaxi.com/voices
【音色管理】-【音色复刻】
首先输入右上角的 【API KEY】
其他的按文内的图填, Voice ID 就是顶顶通系统的发音人。
点【开始复刻】, 复刻成功后 下面可以试听 也可以下载试听音频
请注意:若对这个声音不满意, 请一定不要放到顶顶通系统去试听更多文本, 一旦放到顶顶通TTS 配置上, 就要收费;
若对这个声音满意,请打开顶顶通的TTS 配置,修改 minimax配置,添加发音人, 把Voice ID 复制进去
配置就完成。