Llama-2-7B-Chat-GGML量化版本完整清单:14个文件2~8位精度如何快速选对

发布时间:2026/8/23 15:39:16
Llama-2-7B-Chat-GGML量化版本完整清单:14个文件2~8位精度如何快速选对 Llama-2-7B-Chat-GGML量化版本完整清单14个文件2~8位精度如何快速选对【免费下载链接】Llama-2-7B-Chat-GGML项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Llama-2-7B-Chat-GGML本仓库是Llama-2-7B-Chat-GGML的官方量化模型镜像由 TheBloke 基于 Meta 的 Llama 2 7B Chat 模型制作提供14 个 GGML 格式量化文件覆盖 2~8 位精度可配合 llama.cpp 及各类本地 UI 在 CPUGPU 上跑对话推理。本文带你看完全部文件清单并根据内存大小快速选出最合适的版本。什么是 GGML 量化模型GGML 是一种专为本地推理设计的模型文件格式把原始 fp16 权重约 13.5 GB压缩成 2~8 位的小文件普通笔记本也能跑 7B 对话模型。不同量化方式的核心区别只有一个——压缩强度与精度的平衡位数越低如 q2_K文件越小、速度越快但回答质量损失越多位数越高如 q8_0越接近原始模型但吃内存、推理更慢。14 个量化文件完整清单下表整理了仓库内全部 14 个模型文件来源见 README.md 的 Provided files 部分。最大内存指纯 CPU 推理时的内存需求使用 GPU 卸载后可显著降低。文件名精度文件大小最大内存适用场景llama-2-7b-chat.ggmlv3.q2_K.bin2位2.87 GB5.37 GB内存紧张时的极限选择llama-2-7b-chat.ggmlv3.q3_K_S.bin3位2.95 GB5.45 GB小内存设备日常使用llama-2-7b-chat.ggmlv3.q3_K_M.bin3位3.28 GB5.78 GB3位档中质量更高llama-2-7b-chat.ggmlv3.q3_K_L.bin3位3.60 GB6.10 GB3位档旗舰最接近4位llama-2-7b-chat.ggmlv3.q4_0.bin4位3.79 GB6.29 GB经典4位兼容性最好llama-2-7b-chat.ggmlv3.q4_K_S.bin4位3.83 GB6.33 GBk-quant 4位基础版llama-2-7b-chat.ggmlv3.q4_K_M.bin4位4.08 GB6.58 GB综合性价比首选llama-2-7b-chat.ggmlv3.q4_1.bin4位4.21 GB6.71 GB比q4_0更准速度略快llama-2-7b-chat.ggmlv3.q5_0.bin5位4.63 GB7.13 GB更高精度更高开销llama-2-7b-chat.ggmlv3.q5_K_S.bin5位4.65 GB7.15 GBk-quant 5位基础版llama-2-7b-chat.ggmlv3.q5_K_M.bin5位4.78 GB7.28 GB5位档质量天花板llama-2-7b-chat.ggmlv3.q5_1.bin5位5.06 GB7.56 GB5位中精度最高llama-2-7b-chat.ggmlv3.q6_K.bin6位5.53 GB8.03 GB接近原始模型质量llama-2-7b-chat.ggmlv3.q8_0.bin8位7.16 GB9.66 GB几乎无损不推荐日常用按内存一键选对版本最快配置方法不确定选哪个对照你的可用内存三秒定档8 GB 内存q2_K或q3_K_S跑得动优先16 GB 内存q4_K_M4位质量/体积黄金平衡点绝大多数人的最优解32 GB 内存q5_K_M或q6_K质量大幅提升显存卸载场景把部分层放到 GPU 后内存占用会换成显存可再往上选一档 记忆口诀S M L 代表同一位数内的三档Small/Medium/Large位数越高越准、越慢。为什么要关注 k-quant文件里带_K后缀如 q4_K_M的是新一代k-quant量化方法相比传统 q4_0/q5_0采用超级块结构对不同张量采用不同精度混合量化例如 q4_K_M 对一半的attention.wv和feed_forward.w2张量用 q6_K其余用 q4_K同等体积下精度更高实际有效比特数如 q2_K 为 2.5625 bpw、q4_K 为 4.5 bpw推荐优先选择带_K后缀的版本而非同位数的传统版本。支持哪些本地 UI 工具这些 GGML 文件兼容所有支持该格式的推理工具常见的有llama.cpp—— 命令行推理基准工具text-generation-webui—— 最流行的网页 UI支持 NVIDIA CUDA 加速KoboldCpp—— 全平台 GPU 加速的网页 UI适合写故事LM Studio—— Windows/macOS 全功能本地图形界面ctransformers / llama-cpp-python—— Python 库支持 GPU 加速与 OpenAI 兼容 API⚠️ GGML 与 GGUF重要兼容提醒请注意GGML 格式已被GGUF取代。自 2023 年 8 月 21 日起新版 llama.cpp 不再支持 GGML 模型。本仓库文件仅兼容 2023-06-06commit2d43387至 2023-08-21 之间的 llama.cpp 版本。如果你使用最新的 llama.cpp建议直接寻找对应模型的GGUF 版本精度命名完全一致。获取与运行方式需要克隆仓库时地址为git clone https://gitcode.com/hf_mirrors/ai-gitcode/Llama-2-7B-Chat-GGML在兼容版本的 llama.cpp 中加载即可例如指定q4_K_M文件、10 个 CPU 线程、32 层 GPU 卸载、2048 上下文、温度 0.7。对话模式建议按 README.md 中的 Prompt template 填入INST/SYS系统提示以获得最佳对话效果。许可与合规资料使用本模型前请阅读仓库内的合规文件LICENSE—— 自定义商业许可条款Notice—— 版权声明USE_POLICY.md—— Llama 2 可接受使用政策禁止用于违法、欺诈、恶意代码等场景config.json—— 模型类型标识llama总结3 步选对量化版本定位数内存 8G 选 2~3 位16G 选 4 位32G 选 5~6 位定后缀同位数优先选 k-quant_K的M档如 q4_K_M确认格式新版工具请改用同名 GGUF 文件本仓库 GGML 文件仅用于兼容旧版 llama.cpp 的存档与测试场景。【免费下载链接】Llama-2-7B-Chat-GGML项目地址: https://ai.gitcode.com/hf_mirrors/ai-gitcode/Llama-2-7B-Chat-GGML创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考