科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型

摘要 · 36氪获悉,9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。据了解,Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台。
阅读原文 · 36氪

36氪获悉,9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。据了解,Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台。

原文:https://36kr.com/newsflashes/3985852436282116?f=rss

0 条评论 · 观点来自社区

评论区 0 条讨论

的身份发言⌘/Ctrl+Enter 发送
还没有评论,来抢沙发。