📅 2026-08-29
👁️ 1215
LLM Quantization: AWQ, GPTQ ve GGUF ile 4-Bit Model Sıkıştırma ve GPU VRAM Tasarrufu
Büyük dil modellerinin ağırlık matrislerini FP16/BF16 yerine INT4/INT8 formatına indirgeyerek doğruluk kaybı olmadan bellek tüketimini 4 kat azaltan nicemleme algoritmaları.