AI & ML ecosystem

Benchmark

HELM

A framework / living leaderboard rather than a single test.

Stanford's Holistic Evaluation of Language Models — multi-metric framework.

Category
Knowledge
Creator
Stanford CRFM

Links