r/LocalLLaMA
· Communities
i tried ternary decomposition instead of quantization. it works as good at q4km but takes slightly more vram. while being completly ternary. and completly PTQ (no QAT)
https://arxiv.org/pdf/2607.13511 submitted by /u/LMTLS5 [link] [comments]