由Appen Inc.和DataoceanAI提供的高质量ASR数据集
Appen Inc. 和 DataoceanAI 已经提供了新的高质量英文ASR数据集,涵盖多种口音的剧本式和对话式语音,引发了关于模型评估和基准测试潜在风险的疑问。
Appen Inc. 和 DataoceanAI 已经提供了新的高质量英文ASR数据集,涵盖多种口音的剧本式和对话式语音,引发了关于模型评估和基准测试潜在风险的疑问。
New high-quality, private datasets How can I evaluate my model on this data? Do models trained on the data providers have an advantage?
TLDR : Appen Inc. and DataoceanAI have provided high-quality English ASR datasets covering scripted and conversational speech over multiple accents. To prevent potential risks of benchmaxxing or test-set contamination, we will keep these datasets private for a high-quality measu…
To this end, we have worked with Appen Inc. and DataoceanAI to curate high-quality datasets for ASR benchmarking.