探索索引返回术语

模型量化

模型量化(Model Quantization)将大模型的权重矩阵或激活张量从高精度浮点数(如 FP32、FP16、BF16)转换为低位宽定点数表示(如 INT8、INT4、AWQ、GPTQ 或 GGUF),在保持可接受下游任务精度的前提下成倍压缩显存占用并提升计算吞吐。量化后的模型必须在目标任务与工具调用准确率上重新进行全面评测。

暂时没有与该实体关联的公开内容。