Tasks/LLM Benchmarks

LLM Benchmarks

বৃহৎ ভাষা মডেল মূল্যায়ন

Evaluating large language models on Bangla knowledge, reasoning, and generation.

8 datasets·92 papersTop listed · Claude-3.5-Sonnet — 68.53 Accuracy (answer-only) (2025)
DatasetSizeLicenseYearSource paperLink
BanglaSocialBench
Sociopragmatic LLM benchmark over Bangla address terms, kinship reasoning, and social customs.
1,719 instancesCC BY 4.02026BanglaSocialBench (ACL SRW 2026)
✓ verified 2026-08-23
B-REASO
Bengali multiple-choice evaluation suite over 50 subjects at four difficulty levels, plus the harder B-REASO HEAVY subset.
13,497 questionsMIT2025B-REASO (Findings EMNLP 2025)
✓ verified 2026-07-19
BnMMLU
Bengali massive multitask language understanding benchmark spanning 23 domains.
134,375 question-option pairsCC BY-SA 4.02025BnMMLU (2025)
✓ verified 2026-07-19
BanglaMATH
Bangla grade 6-8 math word problems for testing LLM mathematical reasoning.
~1,700 problemsResearch only2025BanglaMATH (MathNLP 2025)
✓ verified 2026-07-19
SOMADHAN
Bengali math word problems with step-by-step solutions adapted from the GSM8K train and test sets.
8,792 problemsCC BY 4.02025SOMADHAN (2025)
✓ verified 2026-07-26
BEnQA
Parallel Bangla–English science exam questions for LLM evaluation.
5,161 questionsCC BY-NC-SA 4.02024BEnQA (2024)
✓ verified 2026-07-19
Global-MMLU (bn)
Culturally adapted MMLU; Bengali split.
14,327 questionsApache 2.02024Global-MMLU (2024)
✓ verified 2026-07-19
MEGAVERSE (bn subset)
Multilingual LLM evaluation suite including Bangla tasks.
22 datasetsMixed2024MEGAVERSE (NAACL 2024)
✓ verified 2026-08-23