用GGUF和Llama.cpp量化Llama模型

王莽v2

已于 2024-03-01 14:29:17 修改

阅读量5.2k

点赞数 22

分类专栏： LLM 文章标签： llama

于 2024-02-26 14:26:00 首次发布

本文链接：https://blog.csdn.net/wangyifan123456zz/article/details/136297489

版权

用GGUF和Llama .cpp量化Llama模型

什么是GGML
如何用GGML量化llm
使用GGML进行量化
NF4 vs. GGML vs. GPTQ
结论

由于大型语言模型（LLMS）的庞大规模，量化已成为有效运行它们的必要技术。通过降低其权重的精度，您可以节省内存并加快推理，同时保留大部分模型性能。最近，8-bit和4-bit量化解锁了在消费者硬件上运行LLM的可能性。加上Llama模型和参数有效技术以微调它们（Lora，Qlora）的释放，这创建了一个丰富的本地LLM生态系统，该生态系统现在正在与OpenAI的GPT-3.5和GPT-4竞争。

目前，主要有三种量化技术：NF4、GPTQ和GGML。NF4是QLoRA使用的静态方法，用于以4位精度加载模型以执行微调。在上一篇文章中，我们探讨了GPTQ方法，并量化了我们自己的模型，以便在消费者GPU上运行它。在本文中，我们将介绍GGML技术，了解如何量化Llama模型，并提供实现最佳结果的提示和技巧。

什么是GGML

GGML是一个专注于机器学习的C语言库。它是由Georgi Gerganov创建的，这是GG的首字母缩写。这个库不仅提供了机器学习的基本元素，如张量，而且还提供了一种独特的二进制格式来分发llm。

该格式最近更改为GGUF。这种新格式被设计为可扩展的，因此新特性不会破坏与现有模型的兼容性。它还将所有元数据集中在一个文件中，例如特殊 tokens、RoPE缩放参数等。简而言之，它解决了历史上的一些痛点，而且应该经得起未来的考验。欲了解更多信息，您可以在此地址阅读规范。在本文的其余部分，我们将称使用GGUF或以前格式的所有模型为GGML模型。

GGML设计为与Georgi Gerganov创建的Llama.CPP库一起使用。该库用C/C ++编写，以有效地推理 Llama模型。它可以加载GGML型号并将其运行在CPU上。最初，这是与GPTQ模型的主要区别，该模型已加载并在GPU上运行。但是，您现在可以使用Llama.cpp将LLM的一些LLM层卸载到GPU。为了给您一个例子，有35层用于7B参数模型。这大大加快了推理，并使您可以运行不适合VRAM的LLM。
在这里插入图片描述
如果您喜欢命令行工具，那么llama.cpp和GGUF支持已经集成到许多gui中，例如oobabooga的文本生成web-ui、koboldcpp、LM Studio或ctransformers。您可以简单地用这些工具加载您的GGML模型，并以类似chatgpt的方式与它们交互。幸运的是，许多量化模型可以直接在Hugging Face Hub 上使用。您很快就会注意到，它们中的大多数都是由LLM社区的知名人物TheBloke量化的。

在下一节中，我们将看到如何量化我们自己的模型并在消费级GPU上运行它们。

如何用GGML量化llm

让我们看一下 thebloke/Llama-2-13b-chat-ggml repo内部的文件。我们可以看到14种不同的GGML模型，与不同类型的量化相对应。他们遵循特定的命名约定：“ Q” +用于存储权重（精度） +特定变体的位数。这是根据TheBloke制作的型号卡的所有可能定量方法及其相应用例的列表：
在这里插入图片描述
根据经验，我建议使用Q5_K_M，因为它保留了该型号的大部分性能。另外，如果想节省一些内存，也可以使用 Q4_K_M。一般来说，K_M版本优于 K_S 版本。我不推荐 Q2_K 或 Q3 *版本，因为它们会大大降低模型的性能。

现在我们了解了更多可用的量化类型，让我们看看如何在实际模型中使用它们。您可以在Google Colab上的免费T4 GPU上执行以下代码。第一步包括编译llama.cpp并在Python环境中安装所需的库。

# Install llama.cpp
!git clone https://github.com/ggerganov/llama.cpp
!cd llama.cpp && git pull && make clean && LLAMA_CUBLAS=1 make
!pip install -r llama.cpp/requirements.txt