语音能力接入
目前云开发提供的语音能力包括语音转文本(ASR),文本转语音(TTS),均基于腾讯云提供的语音相关 API 实现。
语音识别介绍
提供语音转文字的产品功能,目前支持一句话识别场景(对60秒之内的短音频文件进行识别)(API参考)
限制:
- 音频时长不能超过60s,音频文件大小不能超过3MB
- 语音输入识别场景类型:中文通用/中英粤/中文医疗/英语/粤语
语音合成介绍
提供文字转语音的产品功能,目前支持长文本语音合成场景(适合阅读,播报场景,支持文本长度灵活)(API参考)
限制:
- 支持对10万字符以内的文本进行语音合成,异步返回音频结果
- 语音音色类型:通用男声/通用女声/咨询男声/咨询女声/通用男声(大模型)/通用女声(大模型)/聊天男声/聊天女声/阅读男声/阅读女声