The shelf

Every model trained here

Same tokenizer, same corpus, same context length for everyone — so the losses below compare directly. Open any model and generate text from it.

Modelsfinished runs
Training nowon workers
Trainerspeople
Tokens burnedall time

Best loss by size

lower is better

All models

Trainers