赛事简介
近年来,语音识别技术在标准普通话场景中取得了显著进展,并已广泛应用于智能语音助手、会议转写、智能客服和语音交互等实际场景。然而,真实中文语音输入往往并不局限于标准普通话,而是广泛包含多种区域性方言,以及带有地域特征的口音表达。
中文方言具有地域分布广、语音差异大、词汇表达多样、标注成本高和资源建设不均衡等特点。相比普通话语音数据,方言语音数据普遍存在资源稀缺、覆盖不足和标注规模有限等问题,是典型的低资源语音识别场景。
ChinaVoices Challenge 2026 以 NCMMSC 2026 为平台,围绕中文多方言语音识别与中文多方言种类识别任务,构建统一的评测数据、评价指标和竞赛流程,为学术界和工业界提供公开、公平、可复现的中文多方言语音处理评测平台。
覆盖多方言
覆盖十余种方言及区域口音的人工标注语音数据,支撑低资源方言建模与跨地域泛化评估。
双任务设置
设置中文多方言种类识别与中文多方言语音识别两个核心任务,分别评估方言类别判别能力与语音内容转写能力。
双排行榜机制
设置“限定数据方案”排行榜和“开放数据方案”排行榜,兼顾正式排名公平性与技术探索价值。
最新动态
- 2026 年 7 月 26 日:竞赛最终结果已更新,点击查看赛事结果。
- 2026 年 7 月 22 日:竞赛提交截止,排行榜冻结,进入成绩复核阶段,核实成绩后发布最终排行榜。
- 2026 年 7 月 15 日:竞赛排行榜发布。
- 2026 年 7 月 12 日:公开评测集(Open Evaluation Set)发布,竞赛报名截止。
- 2026 年 7 月 8 日:Baseline 系统已正式发布并开源,相关代码与使用说明请见 GitHub 仓库。
- 2026 年 6 月 29 日:开源数据清单停止更新数据:
- 2026 年 6 月 25 日:参考数据集(Reference Set)发布。
- 2026 年 6 月 22 日:挑战赛官网发布,报名开放,开源数据表公布。
任务与赛道
任务一:中文多方言种类识别
任务目标:参赛者需要根据输入语音判断其所属的方言类别或地域口音类别。
任务重点:关注系统对不同方言种类的区分能力,尤其关注相近方言混淆、地域口音差异和低资源方言种类识别等问题。
初步评价指标:准确率 Accuracy。
任务二:中文多方言语音识别
任务目标:构建面向中文多方言语音的自动语音识别系统,将输入语音准确转写为对应文本。
任务重点:评估模型在不同方言类别、地域口音、说话人和声学条件下的转写能力,重点关注多方言场景中的识别准确率。
初步评价指标:字符错误率 CER。
数据集说明
本挑战赛计划基于组织方整理和构建的中文多方言语音数据开展统一评测。数据将覆盖十余种方言及区域口音。
数据划分包括参考数据集(Reference Set)、公开评测集(Open Evaluation Set)和隐藏评测集(Hidden Evaluation Set),并提供统一的数据划分方式、标注规范、提交格式和评测脚本。
覆盖范围
方言及区域口音类别包括:安徽、粤语、长沙、潮汕、东北、河南、客家、闽南、南昌、南京、山西、陕西、山东、四川、吴语、武汉。
参考与公开评测
参考数据集计划为每个语种/方言提供约 3 小时语音数据;公开评测集用于参赛系统离线推理、结果提交和排行榜评测。
隐藏评测
隐藏评测集不公开发布,仅用于组委会对参赛系统进行独立复核与能力验证,以检查系统提交结果的有效性、稳定性和泛化表现。
评测与提交
评测指标
- 中文多方言种类识别:准确率 Accuracy。
- 中文多方言语音识别:字符错误率 CER。
- 阶段性评测:基于公开评测集(Open Evaluation Set)进行提交与反馈。
- 最终评测:以隐藏评测集(Hidden Evaluation Set)为依据对参赛系统进行复核,该集合不公开发布。
论文与系统说明
参赛队伍可提交挑战赛系统描述论文或相关研究论文,内容可包括系统方案、数据使用策略、模型结构、训练方法、推理流程、实验结果、错误分析和消融实验等。
评审将优先考量成果的方案创新性与技术贡献,所有进入特殊议题展示、拟收录的论文均需经过同行评审,其中优秀论文与参赛系统将在 NCMMSC 2026 特殊议题论坛进行口头汇报或海报展示。
报名与资源
报名系统
报名已开放,请填写 挑战赛报名表 提交参赛队伍信息。
数据与工具
- 数据下载地址:通过邮箱发送数据下载链接。
- 数据使用协议:查看数据使用协议
- 开源数据清单:
- 公共数据登记表:提交公开数据登记申请
- 排行榜地址: “限定数据方案”排行榜: 中文多方言种类识别、 中文多方言语音识别; “开放数据方案”排行榜: 中文多方言种类识别、 中文多方言语音识别。
- 代码仓库:ChinaVoices Challenge GitHub 仓库 已发布。
重要日期
以下为挑战赛初步时间安排,后续将根据竞赛筹备进度进行适度调整。
- 2026 年 6 月 22 日:挑战赛官网发布,报名开放,开源数据表公布,参考数据集(Reference Set)发布。
- 2026 年 6 月 29 日:开源数据表停止更新数据。
- 2026 年 7 月 12 日:公开评测集(Open Evaluation Set)发布,竞赛报名截止。
- 2026 年 7 月 22 日:基于隐藏评测集(Hidden Evaluation Set)为依据对参赛系统进行复核,排行榜冻结,核实成绩后发布最终排行榜。
- 2026 年 7 月 31 日:竞赛相关论文投稿截止。
- 2026 年 11 月 5-8 日:NCMMSC 2026 将于珠海横琴举行,挑战赛专题报告和优秀队伍交流活动计划在会议期间举行。
排行榜
参赛队伍在提交评测集结果时需选择对应排行榜;参加“限定数据方案”排行榜的队伍可同时参加“开放数据方案”排行榜,参加“开放数据方案”排行榜的队伍不可转入“限定数据方案”排行榜。两个排行榜均分别设置中文多方言种类识别和中文多方言语音识别两个任务。
“限定数据方案”排行榜中的优秀队伍将受邀提交挑战赛系统描述论文至全国人机语音通讯学术会议相关专题,经同行评审录用后,可在会议期间进行展示交流;“开放数据方案”排行榜主要用于展示不同数据条件下的系统性能,仅作为榜单展示参考,不作为论文邀请与正式评奖依据。
赛事结果
ChinaVoices Challenge 最终结果已完成复核并正式发布。本届赛事分别设置“限定数据方案”和“开放数据方案”两类结果,其中,“限定数据方案”用于确定竞赛正式排名及奖项,“开放数据方案”用于展示不同数据条件下的系统性能。两类方案均包含中文多方言种类识别和中文多方言语音识别两个任务,点击下方对应任务即可查看完整结果。
“限定数据方案”结果
最终正式排名与奖项评定。
“开放数据方案”结果
展示不同数据条件下的系统性能上限,不用于竞赛正式排名和奖项评定。
常见问题
Q:可以只参加一个任务吗?
A:可以。参赛队伍可根据自身研究方向选择参加中文多方言种类识别任务、中文多方言语音识别任务,或同时参加两个任务。
Q:中文多方言种类识别和中文多方言语音识别可以使用不同的模型吗?还是必须提交一个同时支持两个任务的模型?
A:中文多方言种类识别和中文多方言语音识别可以分别使用不同的模型,也可以使用一个统一模型同时完成两个任务。参赛队伍可根据自身技术方案进行选择,但各任务的系统均须符合相应的竞赛规则和提交要求。
Q:“限定数据方案”排行榜和“开放数据方案”排行榜有什么区别?
A:“限定数据方案”排行榜用于正式排名和奖项评定,数据与模型使用范围受限;“开放数据方案”排行榜主要用于探索性能上限,允许使用更多合法数据资源,但需要披露来源和使用方式。
Q:是否可以使用公开预训练模型?
A:可以。“限定数据方案”排行榜中允许使用公开可获得、可复现的预训练模型;所有外部资源、数据增强方法和后处理策略均需在系统说明中明确列出。
Q:参考数据集、公开评测集和隐藏评测集有什么区别?
A:参考数据集(Reference Set)将按语种/方言类别发布,计划每类约 3 小时,用于参赛队伍训练和开发;公开评测集(Open Evaluation Set)将按时间线发布,用于参赛系统离线推理、结果提交与排行榜评测;隐藏评测集(Hidden Evaluation Set)不公开发布,仅用于组委会对参赛系统进行独立复核与能力验证,以检查系统提交结果的有效性、稳定性和泛化表现。
Q:可以使用评测集进行训练吗?
A:不可以。评测集仅用于模型推理和结果评测,禁止以任何形式将评测集用于模型训练、微调或参数优化。
参赛队伍不得对评测集进行人工标注、伪标签生成或其他形式的标签补充后,再将其加入训练数据;也不得根据评测集内容进行针对性数据构造或模型调优。违反该规定的提交将被视为不合规。
Q:评测结果如何提交并进行评分?
A:组织方已发布在线排行榜平台及对应提交入口。参赛队伍需要使用自己的模型对公开评测集进行离线推理,并按照规定格式生成结果文件,随后在对应排行榜平台提交。
平台将根据赛事规定的评价指标对提交结果进行自动评测,并更新对应排行榜成绩。具体的文件格式、提交次数限制和操作流程请以各排行榜平台页面说明为准。
Q:对于参加“限定数据方案”排行榜的参赛队伍,竞赛的完整提交流程是什么?
A:竞赛提交与复核流程主要包括以下阶段:
- 评测结果提交:竞赛期间,参赛队伍使用参赛系统对公开评测集进行推理,并按照组织方规定的格式,在对应排行榜平台提交结果文件。平台将自动完成评测并更新排行榜成绩。
- 参赛系统方案信息登记:所有参加“限定数据方案”排行榜的队伍,均须提交《ChinaVoices Challenge 参赛系统方案信息登记表》。登记表主要用于说明参赛队伍所使用的系统方案相关信息。未按时提交参赛系统方案信息登记表的队伍,其提交结果将不具备正式排名资格。
- 排行榜冻结与队伍通知:排行榜冻结后,请各参赛队伍密切关注报名时填写的联系人邮箱。组织方将通过邮件通知“限定数据方案”排行榜中排名前列的队伍提交补充材料。
- 成果包提交与官方复核:收到通知的队伍须在指定时间内提交一套完整、可独立运行的最终成果包,供组织方进行数据与方案合规性检查、系统部署、结果复现和推理测试。
- 最终成果包要求:最终成果包应至少包含可复现的 Docker 容器文件及完整的运行环境配置、一键运行脚本
run.sh、模型权重及运行所需的相关文件、模型补充说明文档readme.md,以及组织方要求提交的其他数据使用说明和合规性材料。其中readme.md应说明系统组成、运行方式、复现步骤、输入输出格式及必要的注意事项。 - 论文邀请与投稿:竞赛结束后,组织方将综合考虑排行榜成绩、方法创新性、系统完整性和结果可复现性,邀请优秀参赛队伍按照全国人机语音通讯学术会议(NCMMSC)的论文格式要求提交系统描述论文。所提交论文须经过会议同行评审,评审通过后方可正式录用,并在会议期间进行展示与交流。
最终正式排名、奖项评定将以排行榜成绩为主要依据,并结合系统合规性和结果可复现性进行综合确认。
Q:对于仅参加“开放数据方案”排行榜的参赛队伍,竞赛的完整提交流程是什么?
A:仅参加“开放数据方案”排行榜的参赛队伍,需要按照组织方发布的提交格式,使用参赛系统对公开评测集进行推理,并在对应排行榜平台提交评测结果。
所有参加“开放数据方案”排行榜的队伍,均须提交《ChinaVoices Challenge 参赛系统方案信息登记表》,说明所使用的系统方案相关信息。对于企业内部数据、实验室自建数据或其他不便公开的数据,参赛队伍无需上传原始数据,但须说明其大致来源、规模、类别覆盖和使用方式。未按时提交参赛系统方案信息登记表的队伍,其结果将不予保留在最终开放数据方案排行榜中。
仅参加“开放数据方案”排行榜的队伍无需提交 Docker 容器、模型权重、run.sh、readme.md 等最终成果包,也不参与“限定数据方案”排行榜的官方复核流程。需要说明的是,“开放数据方案”排行榜主要用于展示不同数据条件下参赛系统在统一评测集上的性能上限,不用于竞赛正式排名、奖项评定。
Q:参赛队伍可以同时参加“限定数据方案”和“开放数据方案”两个排行榜吗?
A:可以。参加“限定数据方案”排行榜的队伍,可以同时参加“开放数据方案”排行榜。
同时参加两个排行榜的队伍,其成果包提交与官方复核要求按照“限定数据方案”排行榜的流程执行。排行榜冻结后,仅当队伍收到组织方通知时,才需要提交完整成果包。
仅参加“开放数据方案”排行榜的队伍,不可在竞赛过程中提交“限定数据方案”排行榜。因此,请各参赛队伍在提交前,根据所使用的数据资源和技术方案确认所参加的排行榜类别。
Q:同时参加中文多方言种类识别和中文多方言语音识别两个任务的队伍,如何填写参赛系统方案信息登记表?
A:同时参加两个任务的队伍,应根据两个任务实际使用的系统方案填写登记表。
如果两个任务使用的数据、基础模型、训练方法或整体系统方案不同,应分别填写对应的参赛系统方案信息登记表,以便组织方准确统计和审核各任务的技术方案。
如果两个任务由同一个统一系统完成,并且使用的数据、模型和训练方案基本一致,参赛队伍可以按照表单说明在同一份登记表中同时选择两个任务,并分别说明两个任务的输出形式、解码方式及其他差异。
Q:可以申请多个账号向排行榜提交结果吗?
A:不可以。每支参赛队伍仅允许使用报名时填写的队伍联系人邮箱注册排行榜账号,且队伍、联系人邮箱与排行榜账号应保持一一对应。每支队伍最多拥有 10 次结果提交机会,不得通过注册小号、使用其他成员邮箱或申请多个账号等方式增加提交次数。若发现同一队伍使用多个账号提交,组织方有权取消相关提交成绩或参赛资格。
Q:是否只有取得较好名次的队伍才可以投稿挑战赛论文?挑战赛专题报告论文是否属于 CCF C 类论文?
A:优秀参赛队伍将受邀提交挑战赛系统报告或论文,但取得名次并不代表论文会被直接录用。一般流程是:根据参赛成绩以及系统方案的创新性,优秀队伍可以提交挑战赛系统报告/论文;投稿后还需要经过会议审稿人的同行评审。评审通过并被会议录用后,这篇论文才算正式发表,也就是 CCF C 类会议论文。
Q:每支队伍最多可以有多少名成员?
A:本次赛事对队伍成员数量无强制限制,建议合理控制队伍规模,避免人员过多造成沟通与任务分配不便。
Q:中文多方言种类识别和中文多方言语音识别使用的是同一套数据吗?
A:是的。两个任务是基于同一套中文多方言语音数据组织。
Q:组委会会向参赛者提供基线系统吗?
A:会提供。组委会将发布基线系统及相关说明。具体发布时间、代码地址和使用说明请以官网后续通知为准。
数据使用规则
参赛队伍在下载、访问或使用挑战赛数据前,请阅读并遵守 数据使用协议。
公开数据清单与数据登记机制
组织方将建立“中文方言语音开源数据公共清单”,列出参赛者可以使用的公开数据资源,包括数据名称、语种/方言类别、数据规模、许可协议、下载地址和适用任务等信息。
若参赛队伍使用未在公共清单中的公开数据,可向组织方提交 公共数据登记表。经确认该数据为公开可获得、合法可使用且符合竞赛规则后,该数据将被补充到公共清单中,供其他参赛队伍参考。
提交材料与合规检查
所有参赛队伍在提交系统结果时,均需提交数据使用声明,说明所使用的训练数据、外部数据、预训练模型、数据增强方法和后处理策略。对于“限定数据方案”排行榜,组织方将对数据使用情况进行合规性检查;对于“开放数据方案”排行榜,参赛队伍需尽可能披露数据来源、规模和类别覆盖情况,以便后续进行公平分析和结果解释。
