

Poseidon 语音 AI 数据集通过全球激励式众包,在短时间内构建了覆盖多种低资源语言、规模超过 33,000 小时、权属清晰的高质量语音语料,为多语言语音识别、语音合成及真实环境下的语音模型训练提供了坚实的数据基础。
现有的公开语音数据集长期存在结构性失衡问题。多数数据集以西方语言为核心,对真实世界声学环境的覆盖有限,同时往往缺乏透明、统一的质量控制标准。因此,语音识别(STT)和语音合成(TTS)系统在面对非英语用户,或处于远非录音棚条件的嘈杂环境中时,性能常常显著下降。事实上,全球绝大多数用户并不以英语为母语,也并非在理想环境中交流。要弥补这一差距,亟需在大规模、权属清晰的前提下,构建能够真实反映语言、文化与声学多样性的语音语料库。

Poseidon 语音 AI 数据集在约三周内,通过来自全球各地的数千名贡献者,采集了超过 33,000 小时的提示式语音数据。所覆盖语言包括印地语、乌尔都语、印尼语、越南语、韩语、普通话,以及多种现有训练数据极为有限的低资源语言。在其中若干语言上,我们的数据规模已超过许多历经多年建设的公开数据集。图 1 展示了 Poseidon 在语言覆盖规模上相较于主要公开数据集的对比情况。

图 1:Poseidon 各语言录音小时数与 Common Voice、FLEURS、MLS 和 VoxPopuli 的对比。可以看到,Poseidon 在多个低资源语言上实现了数量级的提升,而数据采集时间仅为其一小部分。

图 2:诸如 Mozilla Common Voice 等标准语音数据集往往需要数年时间才能完成采集,而 Poseidon 的众包式方法在数周内即实现了全球规模的快速扩展,如上图所示。
通过去中心化、激励驱动的方式进行数据采集,带来了三方面优势。首先,全球用户均可参与,使数据规模能够迅速扩张。其次,真实世界的声学环境(如背景噪声、不同录音设备、自然说话习惯)得以自然保留,而非被人工过滤。第三,通过安全的数据溯源基础设施对贡献行为进行追踪,可实现透明的数据来源管理,从而支持合规的 AI 训练授权流程。
开放式参与不可避免地引入声学质量上的多样性。一些贡献者可能提交不完整的转录、使用错误的语言,或上传受到严重背景干扰的录音。因此,识别并过滤这些异常样本,需要一套严格的多阶段验证流程。
贡献者通过 Poseidon 应用朗读其母语中的标准文本,每段录音时长为 30–60 秒。身份验证通过与每位贡献者安全账户绑定的唯一助记短语完成,从而建立持久的语音锚点。用户在明确同意其数据可用于 AI 工作流的前提下,围绕银行业务、客户支持、体育以及日常对话等主题提交录音。通过与 World(一个“真人证明”协议)的集成,Poseidon 成为 World 应用商店中最热门的 AI 应用。同时,平台也支持基于网页的录音上传方式。

图 3:Poseidon 语音采集应用界面示例,以及韩语采集活动中的转录样本。
我们的首轮采集活动(“第一季”)共生成超过 33,000 小时的原始音频数据,并配套提供转录文本、元数据和身份验证样本。所有数据均已完成权属清理,其溯源信息通过 Story 的知识产权(IP)框架进行锚定,以支持后续科研与企业级应用。
我们关注的核心问题是:“在允许少量口误的情况下,用户上传的语音是否忠实地对应了指定文本?”
为判断语音是否与其分配的转录文本高度一致,我们计算了一个综合性的 Poseidon Score,该评分结合了字符错误率、词错误率以及语义相似度指标。其结果呈现出明显的双峰分布,可有效区分完整、准确的朗读与不完整或错误的样本,并支持按语言设置差异化的筛选阈值。

图 4:四种语言(印地语、韩语、普通话和乌尔都语)的 Poseidon Score 分布情况。双峰结构清晰地区分了高保真朗读与低质量提交,后者通常受到背景噪声等因素影响。
针对部分语言,我们为每条样本引入了三位母语标注者,并围绕七个维度进行人工标注,包括转录准确性、语言确认以及口音特征等。这些标注用于校准自动评分机制,识别模糊或对抗性样本,同时揭示人类与自动检测模型均存在不确定性的边缘案例。

图 5:基于 HuBERT 的嵌入在印地语、韩语、普通话和乌尔都语上的投影结果。中心密集区域代表典型、干净的语音样本,而边缘聚类则对应高噪声或非母语发音等异常情况。

图 6:乌尔都语的 HuBERT 嵌入投影示例。
Poseidon 数据集可应用于多语言 STT 与 TTS 模型开发、抗噪语音识别系统优化以及说话人验证等场景。未来的采集活动将扩展至每种语言数十万小时的规模,并涵盖带说话人区分的多方对话以及特定领域语音(如医疗、金融、客户支持等)。同时,年龄、性别、方言、母语等人口统计学元数据也将进一步丰富下游建模能力。
数据发布内容包括音频文件、转录文本、嵌入向量、Poseidon Score 以及人工标注信息,均采用统一的数据结构。同时提供示例加载器和模型训练工具,方便在 PyTorch 或其他框架中直接使用。
如需进行科研合作、商业授权,或获取数据集样本,请联系 Poseidon 团队。