arXiv AI

From Sweep to Seam: Interleaved Cross-Block Post-Training Quantization

arXiv:2608. 09595v1 Announce Type: new Abstract: Compressing large language models to two bits or fewer is increasingly feasible through block-wise post-training quantization; cross-block variants reconstruct neighboring Transformer blocks within a moving window.