r/LocalLLaMA
· Communities
Built and released BetterGPT-150M – A compact 150M parameter completion model (+ live HF Space demo)
Hey everyone, I recently finished pre-training BetterGPT-150M, a small, lightweight causal language model with ~152 million parameters.Trained on 15B tokens. Dataset & Training: Trained across stable and annealing phases using curated datasets (including FineWeb-Edu, fine maths, cosmopedia, starcode-python), ensuring