对接MiniMax Speech 2.8 语气词标签 教程

客户需求

部分客户要求AI说话的时候要能和真人说话一样,比如说长句子有换气的声音,尽可能以假乱真,让用户以为电话里面说话的是真人。

Minimax Speech 2.8 模型支持自然语气标签,可以TTS文字里面插入语气词标签来实现换气、咳嗽等效果。

语气词标签:

MiniMax speech 2.8官网介绍

仅当模型选择 speech-2.8-hdspeech-2.8-turbo 时,支持在文本中插入语气词标签。支持的语气词:

(laughs)(笑声)、(chuckle)(轻笑)、(coughs)(咳嗽)、(clear-throat)(清嗓子)、(groans)(呻吟)、(breath)(正常换气)、(pant)(喘气)、(inhale)(吸气)、(exhale)(呼气)、(gasps)(倒吸气)、(sniffs)(吸鼻子)、(sighs)(叹气)、(snorts)(喷鼻息)、(burps)(打嗝)、(lip-smacking)(咂嘴)、(humming)(哼唱)、(hissing)(嘶嘶声)、(emm)(嗯)、(sneezes)(喷嚏)

TTS配置

模型选择 speech-2.8-hdspeech-2.8-turbo

{
        //"url": "wss://api.minimaxi.com", 如果需要wss调用打开这个,默认ws调用
        /*
        "pronunciation_dict": {
          "tone": [
            "处理/(chu3)(li3)",
            "危险/dangerous"
          ]
        },
        */
        "type": "minimax",
        /* engine 列表
            speech-2.6-hd        最新的 HD 模型,韵律表现出色,极致音质与韵律表现,生成更快更自然
            speech-2.6-turbo        最新的 Turbo 模型,音质优异,超低时延,响应更灵敏
            speech-02-hd        拥有出色的韵律、稳定性和复刻相似度,音质表现突出
            speech-02-turbo        拥有出色的韵律和稳定性,小语种能力加强,性能表现出色
        */
        "engine": "speech-2.8-turbo",
        "filterparenthesis": false,  //不要过滤括号内容,如果这个不配置为false,会把语气标识给过滤了。
        "text_normalization": true, //是否启用中文、英语文本规范化,开启后可提升数字阅读场景的性能,但会略微增加延迟,默认值为 false
        "language_boost": "auto", //是否增强对指定的小语种和方言的识别能力。默认值为 null,可设置为 auto 让模型自主判断。可用选项: Chinese, Chinese,Yue, English, 等
        "key": "", //获取API密钥 请看 https://platform.minimaxi.com/user-center/basic-information/interface-key
}

大模型流式输出改为启用【不能用自动】

大模型全局配置流式输出改成启用,节点配置就自动改过来了。不要一个一个节点去修改。

注意大模型流式输出自动模式下,minimax 合成的声音会出现一个字一个字读,需要改成启用,让大模型输出标点的时候再发给minimax 去合成。具体可以看流式输出说明

大模型提示词配置示例

  1. 开场白固定话术 ,在文本中添加语气词标签。

    1.   例子:你好,我是上海这边法律咨询中心的(breath),近期我们针对个人和企业用户开放了免费的法律咨询服务,不管是欠款追讨,消费维权,劳动还是其他法律问题,都可以免费咨询(breath)。请问您近期有遇到相关的法律困扰吗?

  2. 让大模型主动添加语气词标签。

在大模型提示词添加下面内容,可以根据实际情况优化和修改。

##输出要求##
因为输出的文本,需要通过tts朗读,为了更像真人,需要再合适的地方添加TTS换气标识“(breath)”。推荐的做法是句末添加(breath),如果超过10个字,逗号后面也添加(breath)。 注意输出的末尾不要添加(breath)

标签使用规则

  • 标签必须用英文半角括号包裹:(exhale)(breath)

  • 标签插入位置:句末、分句之间,模拟真人换气节奏

  • 避免连续使用多个标签,防止语音卡顿

录音示范

下面例子一个插入了换气标识,一个没有插入,可以试听一下效果。

注意:如果复刻的音频里面有换气声音,那么复刻出来的发音人,不需要添加换气标识,也会有换气效果。建议是把复刻音频里面的换气声音清除,然后再去复刻,通过大模型来插入换气标识。

律所咨询女声|带呼吸声:

https://sip.ddrj.com/#/queueDialeronlineextra?shareId=3c6aad82-e7d5-45cc-a388-10b831f60baf

律所咨询女声|无呼吸声:

https://sip.ddrj.com/#/queueDialeronlineextra?shareId=eac0e7bd-bde0-409b-8553-ad066c5021a3

官方后台复刻方法:

  1. 注册、登录、 实名认证后打开下面的浏览器

https://solutions.minimaxi.com/voices

  1. 【音色管理】-【音色复刻】

  • 首先输入右上角的 【API KEY】

  • 其他的按文内的图填, Voice ID 就是顶顶通系统的发音人。

  • 点【开始复刻】, 复刻成功后 下面可以试听 也可以下载试听音频

  1. 请注意:若对这个声音不满意, 请一定不要放到顶顶通系统去试听更多文本, 一旦放到顶顶通TTS 配置上, 就要收费;

若对这个声音满意,请打开顶顶通的TTS 配置,修改 minimax配置,添加发音人, 把Voice ID 复制进去

  1. 配置就完成。

cdevelop@qq.com
电子邮箱
cdevelop
技术顾问微信
13660705017
销售顾问电话