Skip to content
r/LocalLLaMA · Communities

i tried ternary decomposition instead of quantization. it works as good at q4km but takes slightly more vram. while being completly ternary. and completly PTQ (no QAT)

https://arxiv.org/pdf/2607.13511 submitted by /u/LMTLS5 [link] [comments]