High-Quality ASR Datasets Provided by Appen Inc. and DataoceanAI
Appen Inc. と DataoceanAI は、複数のアクセントをカバーしたスクリプトと会話的なスピーチ向けの新しい高品質な英語のASRデータセットを提供しました。これにより、モデル評価に関する疑問やベンチマークリスクが浮き彫りになりました。
Appen Inc. と DataoceanAI は、複数のアクセントをカバーしたスクリプトと会話的なスピーチ向けの新しい高品質な英語のASRデータセットを提供しました。これにより、モデル評価に関する疑問やベンチマークリスクが浮き彫りになりました。
New high-quality, private datasets How can I evaluate my model on this data? Do models trained on the data providers have an advantage?
TLDR : Appen Inc. and DataoceanAI have provided high-quality English ASR datasets covering scripted and conversational speech over multiple accents. To prevent potential risks of benchmaxxing or test-set contamination, we will keep these datasets private for a high-quality measu…
To this end, we have worked with Appen Inc. and DataoceanAI to curate high-quality datasets for ASR benchmarking.