NeoHorse 家族矩阵:9B / 4B / 1.9B 三箭齐发,一张图看懂基元律动的多尺寸布局

发布时间:2026/10/10 21:15:48
NeoHorse 家族矩阵:9B / 4B / 1.9B 三箭齐发,一张图看懂基元律动的多尺寸布局 NeoHorse 家族矩阵9B / 4B / 1.9B 三箭齐发一张图看懂基元律动的多尺寸布局【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B9B / 4B / 1.9B 三箭齐发一张图看懂 NeoHorse 家族矩阵2026 年 9 月由前华为诺亚方舟实验室主任、盘古大模型负责人王云鹤创办的基元律动TokenRhythm联合无问芯穹、清华大学、北京大学、阿里巴巴等机构正式发布首个 Agent-Native 模型 NeoHorse-1。这并非一次孤立的单点发布——围绕 NeoHorse 品牌基元律动同时铺开了 9B、4B、1.9B 三个参数量档位的模型矩阵覆盖从通用 Agent 主力、结构化决策引擎到边缘轻量推理的完整任务光谱。本次发布的另一个标志性意义在于它把Routing Harness 的执行经验转化为模型能力这条技术路线第一次落到了参数里——训练语料以基元律动此前开源的多模型路由系统 OpenSquilla 产生的 Agent 执行轨迹为核心辅以公开数据。本文基于本仓库的完整源码与权重元数据拆解 NeoHorse 家族三个档位的定位差异、共用的技术底座以及这套多尺寸矩阵背后的市场卡位逻辑。家族图谱三个型号三种任务光谱NeoHorse 家族目前可以清晰划分为两条产品线以NeoHorse-1为名的通用 Agent 语言模型9B / 4B 两档以及面向结构化决策任务的 Jev 系列4B / 1.9B 两档。两者共享Agent-Native 强结构化输出的基因但目标场景截然不同。先看本仓库对应的旗舰档——NeoHorse-1-9B。根据 README.md 中的模型卡信息它是在 Qwen3.5-9B 基础上经 Routing-guided Agentic Post-Training 得到的 9B 因果语言模型原生上下文长度 262,144 token、可扩展至 1,010,000 token权重以 BF16 Safetensors 格式发布model.safetensors.index.json 中记录总权重体积约 17.9 GB协议为 Apache-2.0。三档型号的定位差异可以归纳如下型号参数量底座与训练路线核心定位目标场景NeoHorse-1-9B约 9BQwen3.5-9B Routing-guided Agentic Post-Training通用 Agent 主力工具调用、编码、推理、指令遵循复杂多步任务、Harness 代理、高难度 Agent 工作流NeoHorse-1-4B约 4BQwen3.5-4B 同路线后训练效率与能力的平衡点同规模 SOTA高频标准 Agent 任务、成本敏感的自托管部署NeoHorse-Jev-4B / 1.9B约 4B / 约 1.9B决策模型系列结构化决策微调确定性决策引擎约束遵守、可解释推理、多目标权衡工单分派、风控判断、推荐排序、调度等结构化任务评测数据上9B 档的优势集中在 Agent 能力在 README.md 公布的十项基准对比中NeoHorse-1-9B 的宏平均得分为69.04较底座 Qwen3.5-9B 的 65.60 提升3.44在五个开源基线Granite-4.2-8B、Qwen3.5-9B、Ornith-1.5-9B、Gemma-4-12B-it、Muse-Glimmer-30B中位列第一甚至超过了参数量三倍有余的 30B 级基线。细分看Agent 类基准是最大增益来源tau²-Bench 达 90.822.78、PinchBench 82.257.70、VitaBench 42.2511.00、QwenClawBench 48.73、BFCL v4 工具调用 67.432.55。社区对 4B 档的验证同样值得注意公开报道与评测显示经过 Agentic Post-Training 后NeoHorse-1-4B 的宏平均得分从 58.94 提升至 64.87达到同规模 SOTA综合表现已经达到甚至略超 9B 基础模型——这组数据直接支撑了4B 能承接一部分原本由更大模型负责的任务的效率叙事。而在 Jev 决策系列上社区实测普遍将其与通用对话模型区分开决策模型的价值不在聊得多好而在输出约束性、确定性推理与格式稳定性评估也应聚焦任务完成率、格式合规率与边界样本准确率而非对话榜单。共用技术底座从边缘推理到决策输出三档同源设计把三个型号放在一起看会发现它们共享一套相当一致的技术底座——这正是家族矩阵得以成立的结构性原因。第一层强约束的结构化输出协议。这是 NeoHorse 家族区别于通用模型最明显的特征。chat_template.jinja 完整定义了 Agent 交互协议工具调用必须遵循tool_callfunction名称parameter键值/parameter/function/tool_call的嵌套 XML 格式工具结果包裹在tool_response/tool_response中推理过程通过think标记显式输出且模板内置了multi_step_tool检测逻辑来判定多步工具调用是否以真实用户查询收尾。tokenizer_config.json 中同样能看到全套配套特殊 tokentool_call、tool_response、think、|im_start|等均注册为词表条目。这套协议在 Jev 决策系列中进一步强化为语法约束驱动——社区实践普遍采用 GBNF / JSON Schema 对解码过程做硬约束vLLM guided decoding并以temperature0或temperature0.1的低采样参数换取决策输出的一致性与 9B 档评测协议中temperature1.0的探索性设置形成鲜明对照通用 Agent 需要发散探索决策引擎需要收敛确定。第二层面向长上下文与低资源推理的架构选型。本仓库的 config.json 揭示了 9B 档的底层架构细节32 层 Transformer 中layer_types以linear_attention与full_attention按full_attention_interval: 4的周期交替排布——即每 4 层中仅第 4 层使用标准全注意力其余 3 层为线性注意力配合 GQA 配置16 注意力头 / 4 KV 头、head_dim: 256以及linear_conv_kernel_dim: 4的卷积核在 262K 超长上下文下显著压缩 KV 缓存开销。model.safetensors.index.json 的权重映射表与之一一对应model.layers.*.linear_attn.*含in_proj_qkv、conv1d、A_log、dt_bias等类 Mamba 风格参数与model.layers.*.self_attn.*并存。这套混合注意力 超长上下文 量化适配的组合正是社区讨论中9B 在 4GB 显存稳定推理、GGUF 量化后经 llama.cpp 部署的硬件基础——线性注意力层几乎不随序列长度增长缓存让 9B 档能在消费级显卡上跑出可用的 Agent 吞吐。Jev 系列的 4B / 1.9B 档则更进一步社区实测 Q4_K_M 与 Q8_0 两种 GGUF 量化在格式合规率上的差异以及 Ollama / llama.cpp / vLLM 三套部署路径的取舍本质上都是同一套结构化输出 量化推理底座的延续。第三层统一的 OpenAI 兼容服务化接口。无论哪一档型号部署出口都是标准化的。以本仓库的 9B 为例README.md 提供了 SGLang 与 vLLM 两套一键启动方案两者均显式启用推理解析器与工具调用解析器python3 -m sglang.launch_server \ --model-path $MODEL_PATH \ --served-model-name neohorse-1-9b \ --host 0.0.0.0 --port 30000 \ --context-length 262144 \ --reasoning-parser qwen3 \ --tool-call-parser qwen3_codervllm serve $MODEL_PATH \ --served-model-name neohorse-1-9b \ --host 0.0.0.0 --port 8000 \ --max-model-len 262144 \ --reasoning-parser qwen3 \ --enable-auto-tool-choice \ --tool-call-parser qwen3_coder启动后即暴露/v1/chat/completionsOpenAI 兼容端点可直接用 curl 验证推理。这套接口约定在 Jev 决策系列中被社区无缝复用同样的 OpenAI 兼容 API 既支撑 FastAPI 封装接入 Codex 等 Agent 工具也支撑企业内部将决策模型嵌入工单自动分派等数据系统。从 9B 到 1.9B下同一份配置就能跑起来是家族矩阵降低迁移成本的关键设计。第四层Apache-2.0 与自托管友好。三个档位均以 Apache-2.0 协议开源本仓库 LICENSE 保留上游 Qwen 版权声明并附 TokenRhythm 的修改声明无商用限制。对决策类企业场景而言这意味着模型可以私有化部署在 16GB 显存单卡乃至纯 CPU 环境配合 LoRA 做面向业务规则的轻量微调——社区多篇实战指南正是在这一协议前提下展开的。家族战略多尺寸矩阵背后基元律动的市场卡位三档齐发并非简单的参数堆砌它与基元律动的商业模式互为表里。理解这一点需要回到这家公司的核心判断模型不归一将是 AI 产业长期存在的结构。模型越多、分工越细、价格与能力差异越明显就越需要一套系统回答这一步用哪个模型、哪一步可以降级、哪条路径受阻后换谁接手——这正是 Routing Harness 与 OpenSquilla 的定位。NeoHorse 家族矩阵的战略意义可以从三个维度拆解其一以自研模型填补 Harness 的能力供给空白。基元律动此前的业务是帮 Agent 挑模型——聚合各家模型、按需路由。但调度系统持续运行后会沉淀一类独特资产什么任务需要什么能力、哪个模型在哪一步容易失败、哪条修复路径有效、怎样的结果能通过环境验证。NeoHorse 做的正是把这些横跨多模型的执行经验练进参数4B 档承接高频、标准明确的 Agent 任务减少对更大规模模型的调用9B 档覆盖高难度工作流Jev 决策档则专门卡位那些需要确定性输出的结构化任务。模型池越大、自研模型越多路由系统可调度的能力档位就越细推理成本与响应速度的优化空间也就越大。其二把执行—评估—选择—更新闭环作为通往 RSI 的工程原型。README 明确将 NeoHorse-1 定位为递归自我改进RSI路径上的初始原型Routing Harness 把任务分配给异构模型池记录工具交互与结果估计能力需求再用能力级反馈塑造下一轮训练数据混合更新后的模型回到 Harness 继续执行从而闭合评估—选择—更新循环。公开报道进一步将其拆为 Data-RSI 与 Model-RSI 两层前者让训练数据不必完全依赖人工准备随系统持续使用而增长后者让模型从执行经验中学习更新后的模型又为下一轮训练产生新反馈。当然就当前公开信息而言这仍是单轮工程验证——信号设计、奖励设计与训练流程仍由人类设定多代迭代能否持续获得增益仍需实验确认这一点技术报告并未回避。其三用开源自托管反哺生态形成模型供给—路由调度—经验回流的飞轮。9B / 4B / 1.9B 三档 Apache-2.0 GGUF 量化 多框架部署的组合本质上是在降低开发者的接入门槛开源版 OpenSquilla 连接开发者与任务入口API 层承接模型调用需求Harness 组织执行并积累轨迹筛选后的轨迹进入模型训练更新后的模型返回 Harness 参与适配任务。每一次 Agent 任务执行Harness 就多获得一次关于能力边界的观察任务积累越多路由判断越准筛选出的训练轨迹越贴近真实任务模型越适合任务API 服务的成本与体验也就越好。当然这条路径也面临现实挑战开源生态能否持续转化为 API 使用与收入、系统能否持续获得足够高质量的 Agent 轨迹、头部模型厂商向 Agent 基础设施垂直整合是否会压缩中间层空间——这些都是家族矩阵能否长期成立的关键变量。但至少从技术层面看NeoHorse 已经完成了一次关键的连接验证Harness 执行过程中产生的有效经验经过筛选与训练确实有机会转化为模型自身的参数能力。用王云鹤团队的话说这家公司过去证明自己会用模型现在开始尝试证明长期使用模型积累下来的数据也能沉淀成自己的模型能力。小结回到那张家族图谱9B 负责深度与广度是 Agent 工作流里的主力引擎4B 负责效率与性价比是同规模 SOTA 的成本型选手1.9B 与 4B 的 Jev 决策档则负责确定性与合规性卡位工单、风控、调度等结构化决策场景。三者共享同一套结构化输出协议、混合注意力架构取向、量化部署路径与 OpenAI 兼容接口构成一张从边缘推理到决策输出的完整能力矩阵——这既是工程上的复用也是基元律动多模型协作 经验回流 递归自我改进战略在模型层面的第一次完整落地。【免费下载链接】NeoHorse-1-9B项目地址: https://ai.gitcode.com/hf_mirrors/TokenRhythm/NeoHorse-1-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询