The shelf
Every model trained here
Same tokenizer, same corpus, same context length for everyone — so the losses below compare directly. Open any model and generate text from it.
Models—finished runs
Training now—on workers
Trainers—people
Tokens burned—all time