model quantization
entry 475
4-bit veya 8-bit sıkıştırma ile modellerin kalitesinden neredeyse hiç ödün vermeden çalıştırabiliyoruz.
model quantization başlığındaki diğer entryler
llama.cpp projesi olmasa bu kadar yaygınlaşmazdı.
ekran kartı vram'i yetmeyenlerin kurtarıcısı.