与Apple Silicon MLX版本完全指南)
【免费下载链接】NeoHorseNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.项目地址https://gitcode.com/gh_mirrors/ne/NeoHorse点击查看免费下载想在本地硬件免费运行 NeoHorse-1这份指南将带你走完全部流程从下载仓库开始教你如何选择GGUF 量化4-bit / 5-bit / 8-bit与 16-bit 权重以及在Apple Silicon上使用MLX 版本部署这台开源推理引擎。NeoHorse-1 是 TokenRhythm 开源的 Agent 原生语言模型家族4B 与 9B 两款基于 Qwen3.5 后训练以Apache 2.0 协议发布个人与商用都免费无需任何 API 费用。为什么值得本地部署 NeoHorse-1NeoHorse-1 最大的卖点是为 Agent 场景专门后训练工具调用、任务路由、指令遵循都是它的强项。十项基准平均分上4B 版本拿到 64.87 分超越多个更大参数量的开源模型9B 版本达到 69.04 分属于小模型干大活的典型。 上图NeoHorse-1-4B 与同级开源模型在 Agentic / Coding / Instruction Following 三大类 10 项基准上的对比橙色为 NeoHorse-1-4B。特性NeoHorse-1-4BNeoHorse-1-9B定位轻量级本地部署更高能力上限上下文原生 262,144 tokens原生 262,144 tokens接口文本进 / 文本出文本进 / 文本出许可Apache 2.0免费商用Apache 2.0免费商用量化版本GGUF 16/8/5/4-bit MLXGGUF 16/8/5/4-bit MLX快速开始克隆仓库并验证环境整个流程只需要三步克隆仓库 → 下载对应量化权重 → 本地加载运行。git clone https://gitcode.com/gh_mirrors/ne/NeoHorse cd NeoHorse仓库内自带两个可直接运行的示例脚本建议先跑通它们验证部署对话示例examples/chat.py —— 发送一条提示并打印模型回复自动开启思考模式工具调用示例examples/tool_call.py —— 发送天气查询打印模型生成的 tool call用法都很简单指向你的本地推理服务地址即可python examples/chat.py --url http://127.0.0.1:8000 --model neohorse-1-4B python examples/tool_call.py --url http://127.0.0.1:8000 --model neohorse-1-4B详细的部署说明含 SGLang / vLLM 启动参数见 README.md。GGUF 量化版本怎么选4/5/8-bit 对比指南官方同时发布了 NeoHorse-1-4B-GGUF 与 NeoHorse-1-9B-GGUF 仓库每款都包含16-bitBF16完整权重和8-bit、5-bit、4-bit 三个量化档——量化版占用更少磁盘空间与内存是消费级硬件本地跑 NeoHorse-1 的关键。各量化档位速查表量化档位4B 模型体积约9B 模型体积约适用场景16-bit (BF16)~8 GB~18 GB显存充足、追求最高精度8-bit~4.5 GB~9.5 GB性价比之选精度损失很小5-bit~3 GB~6.5 GB中端配置日常对话/工具调用4-bit~2.5 GB~5.5 GB低显存 / 纯 CPU 也能跑⚠️ 体积为按参数量的估算值以实际下载为准另外请为 KV Cache 预留 1~2 GB 余量。按硬件对号入座️8~12 GB 显存如 RTX 4060/3060 12G首选 4B 的 8-bit或 9B 的 4-bit️16~24 GB 显存如 RTX 40909B 的 8-bit 可全量上显存体验最佳纯 CPU / 16 GB 统一内存的轻薄本4B 的 4-bit 即可流畅使用磁盘紧张时只下载一个量化档即可4B9B 各留一份 5-bit 约 10 GB 就够用 上图NeoHorse-1-4B 与同级开源模型的全量对比总览——量化部署后这些能力基本都能保留到 95% 以上。Apple Silicon 用户MLX 版本部署如果你是 Mac / MacBook 用户强烈建议直接使用 MLX 版本——MLX 框架专为 Apple Silicon 设计充分利用统一内存与 Metal GPU 加速推理速度明显优于通用 GGUF 加载方案。MLX 版本使用要点从官方模型集合中选择对应参数量的 MLX 仓库下载仓库 README.md 的 News 一节有入口用支持 MLX 的推理前端加载即可享受 Apple Silicon 原生加速无需 CUDA 环境、无需编译macOS 上开箱即用对比项GGUF 方案MLX 方案Apple Silicon适用平台全平台CPU/CUDA/Metal仅 Apple Silicon加载框架llama.cpp 等通用运行时MLX 专用运行时速度良好在 Mac 上更快、延迟更稳量化选择16/8/5/4-bit 全档位官方发布的 MLX 版本一句话总结Mac 用户闭眼选 MLXNVIDIA/其他平台选 GGUF。 上图9B 版本的十项基准对比。若你的硬件能喂饱 9B如 9B 8-bit 16GB 显存在 Agentic 与 Coding 上的收益非常可观。部署后自检三步确认模型正常对话测试运行 examples/chat.py模型应能正常回答并展示思考内容工具调用测试运行 examples/tool_call.py应返回结构化的 tool call而非纯文本长上下文抽查NeoHorse-1 原生支持 262,144 token 上下文但实际可用长度取决于你的内存配置建议先用几万字文档试跑一次若服务以 vLLM/SGLang 方式部署注意启动时保留--reasoning-parser qwen3与--tool-call-parser qwen3_coder参数否则思考模式和工具调用解析会异常。完整启动命令可参考 README.md 的 Deployment 章节。常见问题FAQQ1本地跑 NeoHorse-1 需要付费吗完全免费。模型为 Apache 2.0 许可见 LICENSE权重与量化版本均可直接下载使用商用也无需授权费。Q24B 和 9B 该选哪个看内存16 GB 以内选 4B8/5-bit 都能跑24 GB 以上选 9B 能明显更强。两款接口与用法完全一致切换零成本。Q34-bit 量化会不会明显掉能力对 Agent 任务工具调用、指令遵循几乎无感。官方量化档的设计目标就是用更少内存跑同一套能力若追求极限精度再上 8/16-bit。Q4想深入了解训练原理怎么办仓库自带完整技术报告TechnicalReport_Neohorse_v1.pdf涵盖路由 Harness、Agentic 后训练与评测协议。写在最后资源路径项目说明与部署文档README.md对话示例脚本examples/chat.py工具调用示例脚本examples/tool_call.py技术报告TechnicalReport_Neohorse_v1.pdf开源许可LICENSE至此你已经掌握了本地免费运行 NeoHorse-1的完整方法普通显卡走 GGUF 量化按显存选 4/5/8-bitApple Silicon 走 MLX 版本再用仓库自带的两个示例脚本完成自检。今天就能在自己的硬件上零成本跑起这台为 Agent 而生的开源模型 赞分享【免费下载链接】NeoHorseNeoHorse-1: Towards Recursive Self-Improvement via Agentic Post-Training with Routing Harness.项目地址https://gitcode.com/gh_mirrors/ne/NeoHorse点击查看免费下载相关推荐Ternary-Bonsai-2-27B-mlx-2bit快速上手教程5步在Apple Silicon笔记本跑起27B本地大模型Ternary Bonsai 2 27B mlx 2bit快速上手教程5步在Apple Silicon笔记本跑起27B本地大模型 Ternary Bonsai网页爬虫数据分析Hugging Face Transformers 的 Metal 量化在 Apple Silicon MPS 上以 2/4/8-bit 精度运行大模型Hugging Face Transformers 的 Metal 量化在 Apple Silicon MPS 上以 2/4/8 bit 精度运行大模型 Me人工智能大模型深度学习NLP预训练微调模型推理服务mlx-lm 完全指南在 Apple Silicon 上运行、量化与微调大模型mlx lm 完全指南在 Apple Silicon 上运行、量化与微调大模型 本指南以仓库根目录 README.md https://link.gitcod大模型模型推理服务本地部署微调创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考