GLUE: A Multi-Task Benchmark for NLU¶
Authors: Wang et al. Year: 2018 ArXiv/Link: https://arxiv.org/abs/1804.07461
Summary¶
Foundational benchmark suite for natural language understanding tasks enabling standardized evaluation.
Key Concepts¶
- NLU benchmark
- Multi-task evaluation
- Standardized metrics
- Task diversity
- Transfer learning evaluation
Impact¶
Became standard benchmark for NLP progress
Category¶
Benchmark Papers