Sounds about right. Not even shocking. We know of open models with similar compute footprint and >40T pretraining tokens (gpt-oss, MiMo). This approac…
Sounds about right. Not even shocking. We know of open models with similar compute footprint and >40T pretraining tokens (gpt-oss, MiMo). This approach is also why…