10B规模最强空间推理VLM:ZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶

发布时间:2026/10/4 13:26:01
10B规模最强空间推理VLM:ZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶 10B规模最强空间推理VLMZDTaichu5.0-9B凭什么在ViewSpatial、MindCube榜单登顶【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9BZDTaichu5.0-9B 是一个面向通用视觉理解、空间推理与具身智能的多模态基础模型VLM结合 Qwen3.5-9B 语言骨干与 C-RADIOv4-H 视觉编码器支持文本、图像和视频输入。在本发布对比的 10B 规模通用 VLM 中它以 62.50 分登顶 ViewSpatial、以 78.27 分登顶 MindCube-tiny甚至超过 Gemini 3 Pro 与 GPT-5.2成为 10B 空间推理VLM中当之无愧的头部选手。为什么空间推理能力值得单独关注多数视觉语言模型认识物体但想不清物体基础感知判断左右、远近、遮挡关系复杂推理多视角关联、3D 场景理解、视角转换与心智变换比如想象自己站在对面看同一张桌子具身交互机器人要抓东西、避障碍依赖可供性affordance理解和空间规划。这类任务正是具身智能Embodied AI和 VLA视觉—语言—动作系统的底座。ZDTaichu5.0-9B 的卖点在于不牺牲通用视觉能力把空间、具身、Agent 三大能力叠满。空间推理榜单ZDTaichu5.0-9B 登顶多项评测先看官方基准测试的核心成绩对比对象包括开源与闭源旗舰模型能力维度基准测试ZDTaichu5.0-9BQwen3.5-9BGemini 3 ProGPT-5.2基础空间感知3DSRBench60.9656.7868.9260.20基础空间感知SparBench51.8250.7948.7444.76复杂空间推理ViewSpatial62.5048.2050.3647.30复杂空间推理MMSI-Bench47.2038.7045.2041.30复杂空间推理MindCube-tiny78.2757.6070.8760.38具身交互VSI-Bench59.6955.6852.5154.49具身交互ERQA48.0041.5066.0059.80几个关键看点ViewSpatial62.50与 MindCube-tiny78.27为全场最高领先第二名 10 分以上属于断崖式领先复杂空间推理四项ViewSpatial、MMSI-Bench、MindCube-tiny、VSI-Bench全部包揽最高分且多数领先 Gemini 3 Pro、GPT-5.2 等闭源旗舰 518 分通用视觉能力同样保持第一梯队MathVista Mini 84.5、OCRBench 85.5、AI2D 91.48说明它是全面型选手而非偏科生。下图是一个典型的空间推理题样例模型需要从两个视角的 3D 渲染图中推断几何体的俯视形状——这类多视角 心智变换正是 ViewSpatial 的核心考点。更多对比演示素材可在 docs/assets/demos/comparisons/ 目录中查看。凭什么强架构与熵门控自适应循环推理两大支柱支柱一Qwen3.5-9B 语言骨干 C-RADIOv4-H 视觉编码器语言侧继承 Qwen3.5-9B 的强推理与工具调用能力视觉侧采用 C-RADIOv4-H 编码器支持任意分辨率图像与视频输入9B 参数规模即可跑在单卡部署成本远低于闭源 API。支柱二EARR——只让难 token多算一会儿ZDTaichu5.0-9B 内置了熵门控自适应循环推理Entropy-Gated Adaptive Recurrent ReasoningEARR一次标准前向传播后模型用输出分布的熵衡量不确定性——低熵的 token 直接输出高熵的难 token则在潜空间里重复计算一个中间层块对隐藏表示做进一步细化最后由轨迹读出机制择优并支持回滚。可以理解为模型遇到简单的词秒答遇到空间关系这类难点会再想一想且思考发生在模型内部不需要额外发起外部调用。启用 EARR 后实测成绩进一步上涨基准测试基础版启用 EARRViewSpatial0.5410.5427MMSI-Bench0.3680.374MindCube-tiny0.74040.75RoboSpatial0.680.70实现代码见 recurrent_reasoning/recurrent_reasoning.py 与 recurrent_reasoning/modeling.py使用方式与超参数说明在 recurrent_reasoning/README_zh.md。从榜单到真实场景具身仿真与 Agent 能力分数之外ZDTaichu5.0-9B 在真实仿真场景中同样能打。下图是 LIBERO 仿真中的汤罐与奶酪入篮任务模型同时接入斜俯视、外部相机与腕部相机三路画面输出select_object等直接工具控制指令并完成抓取、放置、松爪撤退的完整闭环。在 Agent 任务上它在 TAU2-Bench87.7与 Claw-Eval71.4的对比中也是 10B 规模最强IFEval 达 93.7。下图展示其调用网络搜索、Bash 等工具自主求解阻尼振子轨迹的完整过程快速上手如何部署 ZDTaichu5.0-9B部署有 Docker 与源码两种方式官方推荐 Dockerdocker run -d \ --gpus all -p 18050:8000 \ registry-dx.wair.ac.cn/taichu-public/vllm-openai:v0.26.0.zdtaichu_5_0 \ TaichuAI/ZDTaichu5.0-9B --max-model-len 220000 --served-model-name zdtaichu服务启动后暴露 OpenAI 兼容接口/v1/chat/completions文本、图片、视频输入方式与主流 Chat 模型一致。几个实用提示空间推理与定位任务temperature 设为 0top_p 0.95、top_k 20其他任务temperature 1.0需要思考输出与工具调用时启动参数追加--reasoning-parser qwen3 --enable-auto-tool-choice --tool-call-parser qwen3_coder。完整安装与调用示例见 README_zh.md。适合谁用具身智能研究者直接用它做 VLA 的空间感知与规划底座Agent 开发者多步工具调用 强指令遵循适合做复杂 Agent 的大脑自部署用户9B 规模单卡可跑OpenAI 兼容接口迁移成本低多模态应用团队文档、图表、OCR、视觉数学等通用任务不掉队。延伸资料完整模型介绍与基准测试README_zh.md中文/ README.md英文EARR 循环推理详解recurrent_reasoning/README_zh.md仿真演示素材docs/assets/simulation/模型权重协议LICENSENVIDIA 开放模型许可 Qwen3.5 Apache-2.0一句话总结10B 参数、单卡可跑、空间推理登顶、具身 Agent 全能——这就是 ZDTaichu5.0-9B 在 ViewSpatial 与 MindCube 登顶的底气。【免费下载链接】ZDTaichu5.0-9B项目地址: https://gitcode.com/gh_mirrors/zd/ZDTaichu5.0-9B创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询