Tasks/Machine Translation

Machine Translation

যন্ত্রানুবাদ

Bangla↔English and multilingual translation, parallel corpora and paraphrase generation.

8 datasets·69 papers
DatasetSizeLicenseYearSource paperLink
BanglaRegionalTextCorpus
Regional sentences from Rangpur, Barisal, Narail, and Khulna with standard Bangla and English translations.
4,653 sentencesCC BY 4.02026BanglaRegionalTextCorpus (Data in Brief 2026)
✓ verified 2026-07-26
Kothon
Parallel Chittagonian-Bangla and Sylheti-Bangla corpora with 8,000 and 9,300 sentence pairs.
17,300 sentence pairsCC BY 4.02026Kothon (Data in Brief 2026)
✓ verified 2026-07-26
BanglaTLit
Benchmark for back-transliteration of romanized Bangla to Bangla script.
42,705 pairsMIT2024BanglaTLit (Findings EMNLP 2024)
✓ verified 2026-07-19
Vashantor
Translation benchmark from five Bangla regional dialects to standard Bangla.
32,500 sentencesCC BY 4.02023Vashantor (2023)
✓ verified 2026-07-19
FLORES-200 (bn)
Bengali ben_Beng evaluation data with 997 dev and 1,012 devtest sentences; excludes the hidden test split.
2,009 public sentencesCC BY-SA 4.02022No Language Left Behind (2022)
✓ verified 2026-09-08
BanglaParaphrase
High-quality synthetic paraphrase pairs.
466,630 pairsCC BY-NC-SA 4.02022BanglaParaphrase (AACL 2022)
✓ verified 2026-07-19
Samanantar (bn–en)
Largest publicly available bn–en parallel collection.
8.6M pairsCC02022Samanantar (TACL 2022)
✓ verified 2026-07-19
BanglaNMT Parallel Corpus
High-quality Bangla–English parallel corpus built with aligner ensembling.
2.75M pairsResearch only2020Not Low-Resource Anymore (EMNLP 2020)
✓ verified 2026-06-28