上周末,AI训练数据服务龙头企业海天瑞声公布了一项多语言情感TTS(Text To Speech的缩写,即“从文本到语音”)应用案例。这项案例的特别之处在于覆盖了阿拉伯语、瑞士德语、南非英语、比利时荷兰语等14个语种或口音的情感语音数据,可提升语音合成系统在不同语言环境和情感表达场景下的应用效果。
多语言情感TTS需要围绕语言覆盖、表达真实性和数据合规等多方面要求,建立符合应用需求的高质量数据体系。该项目完成了客户14个语种或口音情感语音数据构建与交付,不仅满足了客户在多语言情感TTS训练中的数据需求,也验证了复杂多语言场景下高质量语音数据体系的构建能力。
在此案例中,海天瑞声通过系统化的数据设计、资源组织与质量控制流程,帮助客户将分散的语言资源转化为结构化、高质量的训练数据,提升语音合成系统在不同语言环境和情感表达场景下的适应能力,为更自然、更丰富的语音交互应用提供稳定的数据基础。
案例的成功,建基于海天瑞声所拥有的覆盖语音、文本、图像、视频等多模态的自有产权数据集,该公司在多语种、多场景、多任务数据方面已有相当的产品积累,可满足大模型、多模态模型及各行业AI应用的数据需求,可面向不同模型、训练阶段及应用场景提供数据支持,助力模型提升对语言、知识、图像和动态环境的理解能力。
在此前的2026世界人工智能大会上,海天瑞声副总裁、云计算与智驾事业部总经理曹德翊表示,当前国内人工智能产业正从“造模型”加速转向“用模型”,行业关注点也从模型参数竞争转向技术落地。随着算法不断开源、算力成本持续下降,高质量、专业化、合规的数据正成为人工智能规模化应用的关键要素。
另外,面向具身智能研发及应用需求,海天瑞声重点展示覆盖数据采集和数据标注两大核心环节的全流程一体化数据服务能力。在数据采集方面,可提供真机遥操数据、第一人称视角数据、UMI数据、动作捕捉及外骨骼数据采集等服务;在数据标注方面,具备多模态VLA标注、动作行为分类、2D/3D关键点标注、6D物体位姿标注,以及语义分割、实例分割和点云分割等数据处理能力。依托一体化采集标注服务体系,该公司为具身智能模型学习动作技能、理解空间关系、识别环境信息及适应复杂任务提供数据支持,推动具身智能从技术研发走向更多真实应用场景。
文/广州日报新花城记者:钟达文
广州日报新花城编辑:李光曼














































