InternLM2.5-1.8B 全解析:轻量级基座与 Chat 模型的推理能力、工具调用与部署实战

发布时间:2026/10/6 2:03:58
InternLM2.5-1.8B 全解析:轻量级基座与 Chat 模型的推理能力、工具调用与部署实战 大模型人工智能基础模型AI Agent【免费下载链接】InternLMOfficial release of InternLM series (InternLM, InternLM2, InternLM2.5, InternLM3).项目地址https://gitcode.com/gh_mirrors/in/InternLM点击查看免费下载本文以官方模型卡 model_cards/internlm2.5_1.8b.md 为骨架结合当前仓库中的 README、测试用例与配套文档系统讲解 InternLM2.5-1.8B 基座模型与 InternLM2.5-1.8B-Chat 对话模型的定位、核心能力、基准评测结果以及从 Transformers 加载、LMDeploy 服务到 Agent 工具调用的完整落地路径。读完本文你将掌握这款 18 亿参数轻量级模型的选型依据、评测口径以及可直接复制运行的推理与部署方案。一、模型概览InternLM2.5 家族中的轻量级选手InternLM2.5 是 InternLM 系列的第二代第五个版本。与 7B、20B 版本一同开源时1.8B 尺度同样面向贴近实际场景设计为方便用户与研究者使用每个尺度开源了两种版本README.md 中明确记录了 1.8B、7B、20B 三个尺度的发布关系InternLM2.5-1.8B基座模型在通用领域数据与领域增强语料上进一步预训练Further pretrain在评测中取得较好的综合成绩并具备良好的语言能力。官方建议大多数应用优先考虑 InternLM2.5 系列基座模型。InternLM2.5-1.8B-Chat对话模型在 InternLM2.5 基座之上依次经过监督微调SFT与在线 RLHF 对齐。官方明确指出Chat 版本在指令遵循instruction following、对话体验与函数调用function calling上表现更好适合直接用于下游应用。从 README.md 的模型 Zoo 说明可以更完整地理解该系列的角色分工InternLM2.5 是预训练基座适合作为多数应用的基础InternLM2.5-Chat 面向指令遵循、对话与函数调用优化推荐用于下游业务而同一系列中的 7B 版本定位适合研究与应用的效率档20B 版本能力更强、可支撑更复杂场景1.8B 则是这一体系里兼顾能力与资源开销的轻量入口。二、模型 Zoo 与获取渠道官方模型卡给出了 InternLM2.5-1.8B 与 InternLM2.5-1.8B-Chat 的完整发布矩阵两个模型均于2024-08-05发布README.md 的 News 板块在 2024.08.01 宣布了 1.8B 与 20B 尺度的发布。下表保留原始格式信息下载渠道以模型标识给出模型Transformers(HF)ModelScope(HF)OpenXLab(HF)OpenXLab(Origin)发布日期InternLM2.5-1.8Binternlm/internlm2_5-1_8bShanghai_AI_Laboratory/internlm2_5-1_8bOpenLMLab/internlm2_5-1_8bOpenLMLab/internlm2_5-1_8b-original2024-08-05InternLM2.5-1.8B-Chatinternlm/internlm2_5-1_8b-chatShanghai_AI_Laboratory/internlm2_5-1_8b-chatOpenLMLab/internlm2_5-1_8b-chatOpenLMLab/internlm2_5-1_8b-chat-original2024-08-05关于格式模型卡特别说明HF指 HuggingFace 在 transformers 生态中使用的权重格式Origin指 InternLM 团队在 InternEvo 训练框架中采用的原始格式。因此使用 transformers / LMDeploy 等常见推理框架时应下载HF 格式权重若要在 InternEvo 中进行继续预训练等研究性工作则可选用Origin 格式权重。仓库根目录 README.md 同样维护了完整的系列 Zoo 表格覆盖 InternLM2.5 全系列1.8B/7B/20B 及各自的 Chat 版本可作为模型选型与下载的统一入口。三、核心能力解析模型卡将 1.8B 尺度的能力概括为两个核心特征突出的推理能力与更强的工具使用能力。结合仓库配套材料可以分别展开如下。3.1 数学推理以 1.8B 体量对标更大模型官方在模型卡中给出的定位是在 Math 推理上达到当前尺度下领先的表现超越 MiniCPM-2 与 Qwen2-1.5B 等同类模型。这一结论在下文的 Chat 模型评测表中MATH 0-shot CoT 达到 40.2可以得到直接佐证——这是对话模型中最能体现推理能力的指标之一。仓库还提供了更深一层的验证路径tests/test_hf_model.py 中TestMath针对 InternLM2-Math 系列internlm/internlm2-math-7b、internlm/internlm2-math-plus-1_8b等执行了11的数学问答测试并断言回答包含2而 agent/streaming_inference.py 则展示了 InternLM 模型结合代码解释器在 MATH 数据集lighteval/MATHload_dataset(lighteval/MATH, splittest)上做分步推理 Python 执行评测的完整工程实现其中系统提示词要求模型Integrate step-by-step reasoning and Python code to solve math problems并以\boxed{}输出最终结果——这正是 InternLM2.5 系列数学能力背后的训练与评测范式。3.2 工具使用从多网页搜索到函数调用与反思模型卡强调 InternLM2.5 支持从超过 100 个网页收集信息对应实现已随 MindSearch 发布并在指令遵循、工具选择tool selection与反思reflection上具备更好的工具利用能力官方示例指向仓库中的 agent/lagent.md。这条能力链路在仓库中有完整闭环chat/chat_format.md详细定义了 InternLM2.5-Chat 的对话格式除常规的system/user/assistant三角色外新增environment角色用于支持通用 AI Agent 应用。词表为全功能预留了专门的映射特殊 token含义Token ID|im_start|每个角色对话的起始 token92543|im_end|每个角色对话的结束 token92542|action_start|调用外部工具解释器或插件的起始 token92541|action_end|调用外部插件的结束 token92540|interpreter|代码解释器92539|plugin|外部插件、常规工具92538函数调用的完整流程是工具协议以|im_start|system name|plugin|开头的 system prompt 注入 → 模型流式输出|action_start||plugin|与 JSON 格式的调用参数并以|action_end|结束 → 环境以|im_start|environment name|plugin|返回执行结果。代码解释器Code Interpreter走同样的协议仅将plugin替换为interpreter且代码以 markdown 代码块形式输出。agent/lagent.md提供了直接用 InternLM2.5-Chat 搭建 ReAct Agent 的可运行示例用HFTransformer(internlm/internlm2_5-7b-chat)作为 LLM挂载GoogleSearch与PythonInterpreter两个 Action即可回答需要实时搜索与计算的数学问题示例输出为$-\frac{1}{3}\frac{\sqrt{3}}{3}i$。agent/streaming_inference.py进一步展示了 Agent 流水线在数据级上的运作它导入lagent中的INTERNLM2_META、Internlm2Agent、Internlm2Protocol、IPythonInteractiveManager等组件以--backend lmdeploy|hf、--model_path、--max_turn默认 5 轮人机/环境交互、--temperature 0.1、--top_p 0.8、--top_k 40、--stop_words [|action_end|, |im_end|]、--max_new_tokens 512等参数驱动批式数学推理并给出基于 sympy 的答案归一化与数值/符号双通道判分逻辑math_equal/symbolic_equal。这些实现细节可以让读者看到更强的工具使用在工程侧的真实形态。四、性能评测OpenCompass 基准官方使用开源评测工具OpenCompass对 InternLM2.5 系列进行了评估1.8B 尺度的结果如下以下数据均来自 model_cards/internlm2.5_1.8b.md评估配置可在 OpenCompass 官方配置文件中找到更完整结果可查阅 OpenCompass 排行榜。4.1 基座模型Base ModelBenchmarkInternLM2.5-1.8BInternLM2-1.8BQwen2-1.5BMMLU53.5245.9957.45CMMLU65.4445.2770.58BBH41.1636.0335.75MATH27.289.4224.38HUMANEVAL35.9830.4934.15GPQA24.2424.2431.82对比上一代 InternLM2-1.8BInternLM2.5-1.8B 在 MMLU7.53、CMMLU20.17、BBH5.13、MATH17.86、HUMANEVAL5.49上均有大幅提升其中 MATH 从 9.42 跃升至 27.28直接支撑了数学推理能力突出的定位。在 GPQA 上与上一代持平较 Qwen2-1.5B 仍有一定差距读者选型时可结合任务类型参考。4.2 对话模型Chat ModelBenchmarkInternLM2.5-1.8B-ChatMiniCPM-2Qwen2-1.5B-InstructMMLU (5-shot)50.754.255.7CMMLU (5-shot)62.250.665.2BBH (3-shot CoT)41.941.536.5MATH (0-shot CoT)40.215.521.4GPQA (0-shot)27.823.727.3对话模型维度上InternLM2.5-1.8B-Chat 的BBH41.9、MATH40.2、GPQA27.8三项均为表中最高加粗标注尤其在 MATH 上以 40.2 大幅领先 MiniCPM-215.5与 Qwen2-1.5B-Instruct21.4——这是 1.8B 尺度对话模型中数学推理领先的直接证据。CMMLU62.2显著高于 MiniCPM-250.6MMLU 则略逊于两者。4.3 评测口径说明基座模型的多选题评测使用pplperplexity指标评测结果来自 OpenCompass其配置由 OpenCompass 官方仓库提供由于 OpenCompass 版本迭代数据可能存在数值差异请以最新评测结果为准表格中标*的结果复制自原论文。评测数据的可复现性提示若读者希望自行复现需要固定 OpenCompass 版本并采用相同的 prompt 模板如 CoT 示例数、few-shot 数量这与仓库 README 中评估数据可能因 OpenCompass 版本迭代存在数值差异的官方声明一致。五、本地部署与推理实践5.1 环境要求仓库根目录 README.md 与 requirements.txt 给出的运行前提为Python 3.8PyTorch 1.12.0推荐 2.0.0 及以上Transformers 4.38基础依赖sentencepiece、streamlit、transformers4.381.8B 模型显存占用较小是低资源设备上部署 Chat 模型的经济选择。5.2 基于 Transformers 的加载与对话model_cards/internlm2.5_1.8b.md 依赖trust_remote_codeTrue加载模型模型权重自带代码实现这一模式与仓库测试 tests/test_hf_model.py 中TestChat对internlm/internlm2_5-1_8b-chat的验证方式完全一致。参考该测试标准加载与对话代码如下import torch from transformers import AutoModelForCausalLM, AutoTokenizer model_dir internlm/internlm2_5-1_8b-chat tokenizer AutoTokenizer.from_pretrained(model_dir, trust_remote_codeTrue) # 以 float16 加载否则默认 float32 可能导致 OOM model AutoModelForCausalLM.from_pretrained( model_dir, trust_remote_codeTrue, torch_dtypetorch.float16, ).cuda() model model.eval() # 单轮对话 response, history model.chat(tokenizer, 你好, history[]) print(response) # 多轮流式对话 history [] for response, history in model.stream_chat(tokenizer, 你好, history[]): print(response, end, flushTrue)要点说明trust_remote_codeTrue必不可少——InternLM 系列的自定义模型结构与对话模板以远程代码形式随权重发布显存有限时可考虑将模型加载在 CPU 或结合量化手段官方建议torch_dtypetorch.float16以避免 float32 加载导致的 OOM测试中同时覆盖了use_fastTrue/False两种分词器模式实际使用可根据场景选择基座模型非 Chat则直接使用tokenizermodel.generate的方式tests/test_hf_model.py的TestBase中给出了max_length128, top_p10, temperature1.0, do_sampleTrue, repetition_penalty1.0的生成参数示例。5.3 基于 LMDeploy 的批量推理与 API 服务针对服务化与高吞吐场景chat/lmdeploy.md 给出了 LMDeploy面向 LLM 压缩、部署与服务的工具包的完整用法。安装与离线批量推理将模型 ID 替换为 1.8B Chat 版本即可pip install lmdeploy0.2.1from lmdeploy import pipeline pipe pipeline(internlm/internlm2_5-1_8b-chat) response pipe([Hi, pls intro yourself, Shanghai is]) print(response)如需处理长上下文LMDeploy 的 Turbomind 引擎支持动态 NTK 扩展文档示例中对 InternLM2 使用TurbomindEngineConfig(session_len200000, rope_scaling_factor2.0)即可把上下文窗口拉到 200K1.8B 模型同样适用这一配置思路。启动 OpenAI 兼容的 API 服务并与之交互# 启动服务默认端口 23333 lmdeploy serve api_server internlm/internlm2_5-1_8b-chat # 在终端与已启动的服务对话 lmdeploy serve api_client http://0.0.0.0:23333服务启动后还可以直接访问 Swagger UIhttp://0.0.0.0:23333在线调试 RESTful API。仓库的 tests/test_hf_model.py 也展示了 LMDeploy 与 AWQ 4-bit 量化权重TurbomindEngineConfig(model_formatawq)pipeline(internlm/internlm2-chat-20b-4bits)配合的用法说明 LMDeploy 是 InternLM 系列压缩-部署-服务一体化的推荐路径。5.4 构建带工具的 Agent 应用若要将 1.8B Chat 模型接入工具调用可参考 agent/lagent.md 的 ReAct 模式将模型名替换为 1.8B 即可并结合 chat/chat_format.md 中的plugin/interpreter协议理解底层交互大规模评测型任务则可复用 agent/streaming_inference.py 的批式 Agent 流水线支持--backend lmdeploy|hf双后端。注意运行 HuggingFace 模型前需先执行pip install -e .[all]安装 lagent 的完整依赖。六、仓库源码级佐证能力与实现如何对应为了让读者对模型卡上的表述形成可验证的理解这里将关键结论与仓库实现一一对应模型卡表述仓库佐证关键证据Chat 模型经 SFT 在线 RLHF 对齐README.md 模型 Zoo 说明明确写出 undergoes supervised fine-tuning (SFT) and reinforcement learning from human feedback (RLHF)更好的指令遵循 / 对话体验 / 函数调用chat/chat_format.md定义了environment角色、|action_start|等工具 token 与 JSON 调用协议更强的工具使用能力agent/lagent.md、agent/streaming_inference.pyReAct Agent 可运行示例INTERNLM2_META、Internlm2Agent、代码解释器执行器1.8B Chat 可正常加载与多轮对话tests/test_hf_model.pyTestChat参数化覆盖internlm/internlm2_5-1_8b-chat断言输出非空且不含异常 tokenUNUSED_TOKEN、Mynameis、Iama数学推理能力突出agent/streaming_inference.pyMATH 数据集上代码解释器 分步推理评测流水线与 sympy 判分面向下游应用推荐 Chat 版本README.mdrecommended for downstream applications 的系列说明需要说明的是internlm2_5-1_8b-chat已在仓库测试的 Chat 用例中显式覆盖而internlm2_5-1_8b基座虽未出现在 tests/test_hf_model.py 的TestBase参数列表中该列表覆盖的是 7B/20B 与上一代 1.8B但从模型卡与系列测试模式可以推断其加载方式与同系列基座模型AutoModelForCausalLMtokenizermodel.generate一致。从源码结构看1.8B 与 7B/20B 共享 InternLM2.5 系列的模型实现与对话模板这也是官方将三者统一在模型 Zoo 表格中的原因。七、使用限制与注意事项最后需要强调官方在 README 中同步声明的边界与注意点安全限制尽管训练过程致力于让模型输出符合伦理与法律要求但由于模型规模与概率生成范式输出仍可能包含偏见、歧视或其他有害内容。请勿传播此类内容官方不对有害信息的传播后果负责。评测可复现性基准结果依赖 OpenCompass 的具体版本与配置复现时需对齐版本与 prompt 模板基座模型多选题以ppl为指标Chat 模型则需注意 few-shot / CoT 设置。能力边界从评测表可见1.8B 在通用知识MMLU上仍低于同尺度竞品优势集中在数学与推理类任务MATH、BBH、GPQA。选型时应结合任务类型推理密集型任务可优先考虑 InternLM2.5-1.8B通用问答密集型任务则需对比 CMMLU/MMLU 的差异并结合 7B/20B 档位见 model_cards/internlm2.5_7b.md 与 model_cards/internlm2.5_20b.md综合决策。格式匹配下载权重时需区分 HF 格式与 OriginInternEvo格式避免推理框架与权重格式不匹配。综上InternLM2.5-1.8B 以 18 亿参数的轻量体量在数学推理与工具使用两条能力线上均给出了可验证的领先表现结合仓库内 tests/test_hf_model.py、chat/chat_format.md、agent/lagent.md、agent/streaming_inference.py 等一手材料开发者可以从模型卡 → 评测 → 部署 → Agent 应用全链路快速上手。若需更长上下文或更强复杂场景能力可进一步参考同系列的 model_cards/internlm2.5_7b.md含 1M 上下文版本见 long_context/README.md与 model_cards/internlm2.5_20b.md。赞分享大模型人工智能基础模型AI Agent【免费下载链接】InternLMOfficial release of InternLM series (InternLM, InternLM2, InternLM2.5, InternLM3).项目地址https://gitcode.com/gh_mirrors/in/InternLM点击查看免费下载相关推荐InternLM2.5-7B 模型全解析版本选型、性能基准与推理部署实战指南InternLM2.5 7B 模型全解析版本选型、性能基准与推理部署实战指南 导读 本篇指南围绕 InternLM2.5 7B 模型卡片 https://li大模型人工智能基础模型AI Agent3步部署InternLM2-Chat-1.8B2025轻量化AI模型性能实测3步部署InternLM2 Chat 1.8B2025轻量化AI模型性能实测 你是否还在为AI模型部署的硬件成本发愁2025年轻量级大模型评测报告显示In大模型人工智能基础模型AI AgentWindows Web开发环境的革命性重构从零到一的Wnmp技术栈实践Windows Web开发环境的革命性重构从零到一的Wnmp技术栈实践 当传统配置成为开发者的噩梦 每一个Windows平台上的Web开发者都曾经历过这样的场开发工具上一篇如何使用a-sheep-assistant一键闯关羊了个羊新手必备的5个核心技巧下一篇closure-compiler量子计算优化探索未来计算的前端准备创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询