r/LocalLLaMA
· Communities
[R] Deterministic attention-transformer with measured energy savings on H100 (0.63 J/token)
I’ve been working on a custom Rust + CUDA attention-transformer engine (GAE + ATE + WNSM + reversible training) aimed at determinism and real energy efficiency. Latest sustained numbers on H100 NVL (28-layer 7B-class stack, continuous batch): Throughput: ~403 tokens/second Energy: 0.63 J/token Power: ~254 W median boar