
观点网讯:9月16日,讯飞星火全国产语音基座大模型Spark-Audio-1.0-Preview上线。该模型是基于全国产化算力训练的语音基座大模型,目前已正式开放体验,API后续将上线讯飞开放平台。
据讯飞星火方面消息,Spark-Audio-1.0-Preview采用0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成。
该模型在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务。
在语言能力方面,Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。
与过去先把语音转成文字、再交给大模型理解的级联方案不同,语音基座大模型直接理解语音,可一次性听懂人声、环境音、音乐等,并理解声音里的语义、情绪和场景。
免责声明:本文内容与数据由观点根据公开信息整理,不构成投资建议,使用前请核实。

