Die Quantisierung von großen Sprachmodellen (LLMs) reduziert die Genauigkeit gespeicherter Gewichte, ohne die Ausgabequalität erheblich zu beeinträchtigen. Neueste Modelle wie Kimi K3, das 2,8 Billionen Parameter umfasst, werden bereits mit 4-Bit-Gewichten trainiert und ausgeliefert, was die Effizienz steigert. Größere Modelle zeigen geringere Qualitätseinbußen bei der Quantisierung, was ihre Nutzung auf Consumer-Hardware, einschließlich Smartphones, erleichtert.