Skip to content
r/LocalLLaMA · Communities

Flash-MSA: Accelerating Million-Token Training With Sparse Attention Kernels

submitted by /u/nullc [link] [comments]