检索规则说明:AND代表“并且”;OR代表“或者”;NOT代表“不包含”;(注意必须大写,运算符两边需空一格)
检 索 范 例 :范例一: (K=图书馆学 OR K=情报学) AND A=范并思 范例二:J=计算机应用与软件 AND (U=C++ OR U=Basic) NOT M=Visual
机构地区:[1]解放军信息工程大学信息工程学院,郑州450002
出 处:《数据采集与处理》2009年第5期594-599,共6页Journal of Data Acquisition and Processing
基 金:国家"八六三"高技术研究发展计划(2006AA01Z146)资助项目
摘 要:压缩域说话人识别算法(Compressed-domain automatic speaker recognition,CD-ASR)即从压缩语音数据中直接提取压缩参数进行说话人识别,无需参数译码和波形合成。本文提出了基于概率统计直方图的VoIP压缩域说话人识别算法,包括矢量量化统计直方图和高斯混合模型统计直方图两种方法。在给出了G.729,G.723.1(6.3 kb/s),G.723.1(5.3 kb/s)压缩码流的压缩域特征提取方案后,分别以矢量量化统计直方图和高斯混合模型统计直方图作为识别模型进行说话人识别。实验结果表明,概率统计直方图法比在压缩码流中提取同样识别参数的GMM模型,识别率有很大提高。Compressed-domain automatic speaker recognition (CD-ASR) extracts features directly from the coded speech bit-stream to avoid decoding the parameters and resynthesizing the speech waveform. In this paper, a compressed-domain speaker recognition approach is pro- posed based on the probabilistic stochastic histogram. Firstly, the compressed-domain feature extraction schemes of G. 729,G. 723.1 (6.3 kb/s), G723.1(5.3 kb/s) compressed bit streams are described. Then, the speaker recognition algorithms are presented based on vector quantization probabilistic stochastic histogram (VQPSH) and Gaussian mixture model probabilistic stochastic histogram(GMMPSH). Experimental results show that the probabilistic stochastic histogram algorithm is superior to classical GMM when using the same compressed-domain feature extraction algorithms.
关 键 词:压缩域说话人识别 矢量量化概率统计直方图 高斯混合模型概率统计直方图
分 类 号:TN912.3[电子电信—通信与信息系统]
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在载入数据...
正在链接到云南高校图书馆文献保障联盟下载...
云南高校图书馆联盟文献共享服务平台 版权所有©
您的IP:216.73.216.222