讯飞上线全国产语音基座大模型Spark-Audio-1.0-Preview 支持99种语言识别

观点新媒体
 来自广东省

观点网讯:9月16日,讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线。该模型是基于全国产化算力训练的语音基座大模型,目前已正式开放体验,API后续将上线讯飞开放平台。

据讯飞星火方面消息,Spark-Audio-1.0-Preview采用0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成。

该模型在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。

在语言能力方面,Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。

与过去先把语音转成文字、再交给大模型理解的级联方案不同,语音基座大模型直接理解语音,可一次性听懂人声、环境音、音乐等,并理解声音里的语义、情绪和场景。

免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

“特别声明:以上作品内容(包括在内的视频、图片或音频)为凤凰网旗下自媒体平台“大风号”用户上传并发布,本平台仅提供信息存储空间服务。

Notice: The content above (including the videos, pictures and audios if any) is uploaded and posted by the user of Dafeng Hao, which is a social media platform and merely provides information storage space services.”

热点新闻