{"doi":"10.3724/sp.j.1146.2010.00977","title":"Speaker Diarization and Localization Technology Research Based on NIST Evaluation","abstract":null,"journal":"Journal of Electronics &amp; Information Technology","year":2011,"id":655494,"datarank":0.0,"base_score":0.0,"endowment":0.0,"self_citation_contribution":0.0,"citation_network_contribution":0.0,"self_endowment_contribution":0.0,"citer_contribution":0.0,"corpus_percentile":null,"corpus_rank":null,"citation_count":0,"citer_count":0,"citers_with_citation_signal":0,"citers_with_endowment":0,"datacite_reuse_total":0,"is_dataset":false,"is_dataset_confidence":null,"is_data_producer":false,"deposit_databanks":null,"is_oa":false,"file_count":0,"downloads":0,"has_version_chain":false,"published_date":null,"fair_score":null,"fair_percentile":null,"algorithm_id":"datarank_citation_only_1hop_v6","ranking_scope":"data_only","authors":[{"id":1137569,"name":"Hui Song","orcid":"0000-0003-2642-1850","position":1,"is_corresponding":false},{"id":334282,"name":"Jia Liu","orcid":"0000-0001-9522-6624","position":2,"is_corresponding":false},{"id":506999,"name":"Yi Yang","orcid":"0000-0002-1958-7249","position":0,"is_corresponding":false}],"reference_count":0,"raw_metadata":{"has_enrichment":true,"resolved":true,"title":"Speaker Diarization and Localization Technology Research Based on NIST Evaluation","abstract":"该文针对美国国家标准与技术研究院(NIST)的 NIST评测，构建了一套多距离麦克风说话人分类及定位语音处理系统，针对NIST富标注评测中提出的说话人分类问题，提出改进的结合时延估计和聚类的说话人分类方法，在保证稳定性的前提下降低说话人分类的复杂度并提高准确率；提出一种新的相邻阵元间时延构造矩阵方程算法，可得到多个说话人的方向角。实验在标准会议环境下采集真实语音数据进行算法验证，说话人分类算法的正确率接近目前主要说话人分类系统的正确率，定位方向角误差在3以内。实验结果说明，适当条件下多距离麦克风系统可作为合适的语音信号输入设备应用于多人多方会议环境。","is_dataset_classified":null,"base_score":0.0,"endowment":0.0,"datacite_reuse_total":0,"file_count":0,"downloads":0,"views":0,"has_version_chain":false,"is_dataset":false,"is_oa":false,"pmid":"19162232","pmcid":null,"openalex_id":"https://openalex.org/W2320042380","authors":[],"funders":[],"total_grants":0,"fwci":0.0,"citation_percentile":0.23743535,"influential_citations":0,"citation_trend":[],"oa_status":"hybrid","license":"cc-by","oa_locations":[{"url":"https://doi.org/10.3724/sp.j.1146.2010.00977","host_type":"journal"},{"url":"https://doi.org/10.3724/sp.j.1146.2010.00977","host_type":"publisher"},{"url":"https://jeit.ac.cn/article/exportPdf?id=3a763f22-b69b-42b2-9546-08d1d2a368a9","host_type":"publisher"},{"url":"https://jglobal.jst.go.jp/en/detail?JGLOBAL_ID=201202273952029871","host_type":"journal"}],"fields_of_study":["Speech and Audio Processing","Speech Recognition and Synthesis","Music and Audio Processing"],"mesh_terms":[],"keywords":["NIST","Computer science","Speech recognition","Natural language processing"],"sdg_mappings":[],"linked_datasets":[],"clinical_trials":[],"software_tools":[],"database_accessions":[],"source":"live","citation_network_status":"fetched"},"created_at":"2026-08-11T12:01:20.088409Z","pmid":null,"pmcid":null,"fwci":null,"citation_percentile":null,"influential_citations":0,"oa_status":null,"license":null,"views":0,"total_file_size_bytes":0,"version_count":0,"fair_f":null,"fair_a":null,"fair_i":null,"fair_r":null,"fair_zscore":null,"fair_rationale":null,"fair_model":null,"fair_agent_version":null,"fair_fulltext_source":null,"fair_has_llm":null,"fair_computed_at":null,"clinical_trials":[],"software_tools":[],"db_accessions":[],"linked_datasets":[],"topics":[]}