Datasets
Curated speech and text datasets covering hundreds of African languages. All datasets are freely available on HuggingFace.
Africa Corpus
Monolingual and parallel text data for 693 African languages. The largest African language corpus on HuggingFace.
African Speech IPA
Audio paired with IPA phoneme transcriptions for 934 African languages. Used for training CTC phoneme recognisers.
African Speech Public v1
Public release of African speech data covering multiple languages and recording conditions.
GRN African Speech
Speech data from GRN (Global Recordings Network) covering over 1,000 African language communities.
Open Bible Speech African
Bible audio recordings in African languages from YouVersion. Widely used for ASR and TTS training.
African Transcribed Speech (Monolingual)
Transcribed speech data in monolingual format for training speech recognition models.
African Transcribed Speech (Parallel)
Parallel transcribed speech data for multilingual and cross-lingual speech research.
YouVersion African Speech
Speech data extracted from YouVersion Bible audio across African languages.
All Datasets on HuggingFace
Browse all 8 AfriSpeech datasets directly on HuggingFace.
View on HuggingFace