昨日,在2026世界人工智能大会的“人工智能高质量语料生态论坛”上,由广州大学、广州市社科联共建的粤语语料库建设与大模型评测重点实验室发布两项原创成果——AI-DIMSUM粤语语料库搜索平台2.0和粤语真实语音上下文交互能力评测基准CRS-Bench。
两项成果听起来很“高深”,其实并不难理解。前者相当于地道粤语的“专搜引擎”,让海量粤语语料“找得准、信得过”。后者则是检测大模型学粤语的“评测仪”,“看它有没有胡说八道”。而支撑它们的,正是“粤语语料库”。
何为粤语语料库?简单来说,它是为粤语建立的一套“数字家底”。现实生活中的粤语文本、语音、视频以及背后的场景和文化知识,只有经过采集、清洗、标注、确权、评测,才能成为可供模型训练和应用的数据资源。而语料库不只是收集语言资料的“仓库”,更是服务粤语AI创新的数据“基建”。
为何要建?首先是让人工智能真正“懂粤语”。大模型“表面会说,不等于真正懂得”。真正的粤语能力,不仅在于理解词汇和句意,还要听得出语气和情感,辨得清使用场景,读得懂语言背后的文化内涵。比如眼下不少AI模型生成的粤语,“意思都对但听起来怪怪的”。因此,要让模型从“会说”走向“真懂”,既需要高质量、大规模、可持续增强的粤语训练数据,也需要科学、权威的评测标准。
其次,是为岭南文化筑牢数字根基。语言是文化最鲜活的载体。粤语有古汉语“活化石”之称,既古老雅致,又生猛新潮。比如,“畀”“几多”“得闲”等日常用语,既留存着古汉语的音韵,又沿袭了古汉语的句法。与此同时,粤语本身也是一种开放且鲜活的语言。“摩登”“模特”“马达”这些音译词早已融入日常表达,成为地道的粤语词汇;而“饮茶”“点心”“叉烧”这类词语更是漂洋过海,成为世界认识岭南文化的窗口。
可以说,粤语记录着岭南社会的发展演变,承载着广府人的思维方式和生活方式,也是连接粤港澳大湾区及海内外广府人的情感纽带。建设高质量的粤语语料库,正是为了让AI真正读懂粤语的韵味、理解岭南文化的灵魂,实现前沿技术与本土文化的深度融合。
当然,语料库的生命力,最终还要落到应用上。目前,语料平台已汇聚1TB以上多模态语料,孵化出粤语内容安全检测“保险箍”、智能配音、学习工具等10余款应用。此次发布的新成果,还将为教育、文创、媒体和人工智能企业提供更加可信的数据和评测服务。这不仅把鲜活的粤语资源转化为可用的数据资产,也为广州以“场景驱动、垂直深耕”建设“垂类模型之都”增添了硬核底座。
“话须通俗方传远,语必关风始动人。”守护粤语,不只是把它传承下来,还要让这门古老而鲜活的语言在新的技术环境中继续生长。让粤语在人工智能时代声声不息,让岭南文脉在数字世界生生不息。
广州日报评论员陈文杰












































