Datasets

Curated speech and text datasets covering hundreds of African languages. All datasets are freely available on HuggingFace.

Africa Corpus

285

Monolingual and parallel text data for 693 African languages. The largest African language corpus on HuggingFace.

16.6M rows 276 languages
ParallelMonolingualText
View Dataset →

African Speech IPA

723

Audio paired with IPA phoneme transcriptions for 934 African languages. Used for training CTC phoneme recognisers.

776K rows 934 languages
SpeechIPAPhonemes
View Dataset →

African Speech Public v1

227

Public release of African speech data covering multiple languages and recording conditions.

779K rows 195 languages
SpeechPublic
View Dataset →

GRN African Speech

84

Speech data from GRN (Global Recordings Network) covering over 1,000 African language communities.

739K rows 86 languages
SpeechGRNReligious
View Dataset →

Open Bible Speech African

1,495

Bible audio recordings in African languages from YouVersion. Widely used for ASR and TTS training.

553K rows 1.09K languages
SpeechBibleYouVersion
View Dataset →

African Transcribed Speech (Monolingual)

116

Transcribed speech data in monolingual format for training speech recognition models.

552K rows 113 languages
SpeechTranscribedASR
View Dataset →

African Transcribed Speech (Parallel)

55

Parallel transcribed speech data for multilingual and cross-lingual speech research.

53 rows Multiple languages
SpeechParallelMultilingual
View Dataset →

YouVersion African Speech

103

Speech data extracted from YouVersion Bible audio across African languages.

98.9K rows 104 languages
SpeechYouVersionBible
View Dataset →

All Datasets on HuggingFace

Browse all 8 AfriSpeech datasets directly on HuggingFace.

View on HuggingFace