AI & ML ecosystem
Benchmark
HELM
A framework / living leaderboard rather than a single test.
Stanford's Holistic Evaluation of Language Models — multi-metric framework.
- Category
- Knowledge
- Creator
- Stanford CRFM