语音能力接入
目前云开发提供的语音能力包括语音转文本(ASR),文本转语音(TTS),均基于腾讯云提供的语音相关 API 实现。
语音识别介绍
提供语音转文字的产品功能,目前支持一句话识别场景(对60秒之内的短音频文件进行识别)(API参考)
限制:
- 音频时长不能超过60s,音频文件大小不能超过3MB
- 语音输入识别场景类型: 中文通用/中英粤/中文医疗/英语/粤语
语音合成介绍
提供文字转语音的产品功能,目前支持长文本语音合成场景(适合阅读,播报场景,支持文本长度灵活)(API参考)
限制:
- 支持对10万字符以内的文本进行语音合成,异步返回音频结果
- 语音音色类型:通用男声/通用女声/咨询男声/咨询女声/通用男声(大模型)/通用女声(大模型)/聊天男声/聊天女声/阅读男声/阅读女声
如何使用
1. 开通
在云开发平台 AI+ 选择「云开发 Agent 模板」,在 bot-config.yaml 中开启 voiceSettings: true
注意事项
需要云开发标准版及以上才支持开启此功能


测试
配置后在右侧预览区可实时体验,语音识别&文本转语音入口如图所示: