【Agent】LLM的接入方式

发布时间:2026/9/27 11:33:32
【Agent】LLM的接入方式 这一篇我们进行大模型如何接入的说明比较简单。一、LLM 的接入方式前面我们演示的都是通过现成的客户端来进行 AI 行为如聊天、生图等。如果现在要我们自己写一个 AI 应用来实现相关 AI 行为则需要我们自行接入 LLM。常见的原生 LLM不经过第三方平台或复杂的代理层直接与大语言模型提供方进行交互的方法接入方式有三种【API 远程调用】、【开源模型本地部署】和【SDK 和官方客户端库】1.1 API 接入这是目前最主流、最便捷的接入方式尤其适用于快速开发、集成到现有应用以及不想管理硬件资源的场景。通过 HTTP 请求通常是 RESTful API直接调用模型提供商部署在云端的模型服务。代表厂商OpenAI (GPT-4o)Anthropic (Claude)Google (Gemini)百度文心一言阿里通义千问智谱 AI 等。典型流程就是注册账号并获取 API Key在模型提供商的平台上注册获得用于身份验证的密钥。查阅 API 文档了解请求的端点、参数如模型名称、提示词、温度、最大生成长度等和返回的数据格式。构建 HTTP 请求在你的代码中使用 HTTP 客户端库如 Python 的 requests 构建一个包含 API Key通常在 Header 中和请求体JSON 格式包含你的提示和参数的请求。发送请求并处理响应将请求发送到提供商指定的 API 地址然后解析返回的 JSON 数据提取生成的文本。以 Deepseek为例官网地址DeepSeek - 探索未至之境调用curl https://api.openai.com/v1/responses \ -H Content-Type: application/json \ -H Authorization: Bearer $OPENAI_API_KEY \ -d { model: gpt-5, input: Write a one-sentence bedtime story about a unicorn. }或使用 HTTP 客户端如 Apifox发起调用输出{ id: resp_68da0ae40f40819c8f33465a1d923fcb0b003ac22034ffda, object: response, created_at: 1759120100, status: completed, background: false, billing: { payer: developer }, error: null, incomplete_details: null, instructions: null, max_output_tokens: null, max_tool_calls: null, model: gpt-4o-mini-2024-07-18, output: [ { id: msg_68da0ae4ab90819cb9544144353167060b003ac22034ffda, type: message, status: completed, content: [ { type: output_text, annotations: [], logprobs: [], text: 你好我是一个人工智能助手旨在回答你的问题和提供帮助。有什么我可以为你做的呢 } ], role: assistant } ], parallel_tool_calls: true, previous_response_id: null, prompt_cache_key: null, reasoning: { effort: null, summary: null }, safety_identifier: null, service_tier: default, store: true, temperature: 1.0, text: { format: { type: text }, verbosity: medium }, tool_choice: auto, tools: [], top_logprobs: 0, top_p: 1.0, truncation: disabled, usage: { input_tokens: 11, input_tokens_details: { cached_tokens: 0 }, output_tokens: 27, output_tokens_details: { reasoning_tokens: 0 }, total_tokens: 38 }, user: null, metadata: {} }API 参考https://platform.openai.com/docs/api-reference/introduction1.2 本地接入大模型本地部署这种方式就是将开源的大型语言模型如 Llama、ChatGLM、Qwen 等部署在你自己的硬件环境本地服务器或私有云中。核心概念就是将下载模型的文件权重和配置文件使用专门的推理框架在本地服务器或 GPU 上加载并运行模型然后通过类似 API 的方式进行交互。典型流程是1. 获取模型从 Hugging Face国外、魔搭社区国内等平台下载开源模型的权重。2. 准备环境配置具有足够显存如 NVIDIA GPU的服务器安装必要的驱动和推理框架。3. 选择推理框架使用专为生产环境设计的框架来部署模型例如◦ vLLM特别注重高吞吐量的推理服务性能极佳。◦ TGIHugging Face 推出的推理框架功能全面。◦ Ollama非常用户友好可以一键拉取和运行模型适合快速入门和本地开发。◦ LM Studio提供图形化界面让本地运行模型像使用软件一样简单。4. 启动服务并调用框架会启动一个本地 API 服务器如 http://localhost:8000 你可以像调用云端 API 一样向这个本地地址发送请求。1.2.1 下载并安装 OllamaOllama 是一款专为本地部署和运行大型语言模型 (LLM) 设计的开源工具旨在简化大型语言模型 (LLM) 的安装、运行和管理。它支持多种开源模型 (如 qwen、deepseek、LLaMA)并提供简单的 API 接口方便开发者调用适合开发者和企业快速搭建私有化 AI 服务。Ollama 官网: Ollama1. 下载 Ollama2. 安装 Ollama下载完成之后一步一步安装即可。3. 验证安装完成后Ollama 默认会启动。访问: http://127.0.0.1:114341.2.2 拉取模型Ollama 可以管理和部署模型我们使用之前需要先拉取模型。・修改模型存储路径模型默认安装在 C 盘个人目录下 C:\Users\XXX.ollama 可以修改 ollama 的模型存储路径使得每次下载的模型都在指定的目录下。有以下两种方式1. 配置系统环境变量变量名: OLLAMA_MODELS变量值: ${自定义路径}2. 通过 Ollama 界面来进行设置设置完成后重启 Ollama 。・拉取模型查找模型: Ollama以 DeepSeek-R1 为例 DeepSeek-R1 是一系列开放推理模型其性能接近 O3 和 Gemini 2.5 Pro 等领先模型。 DeepSeek-R1 有不同的版本我们需要根据自己机器的配置及需求来选择相应的版本。分为 1.5b 7b 8b 等b 是 Billion (十亿) 的缩写代表模型的 参数量级。 671b 表示 满血 版本其他版本称为 蒸馏 版本。参数越多 → 模型 知识量 越大 → 处理复杂任务的能力越强硬件需求也越高。根据需求及电脑配置选择合适的模型版本以 1.5b 为例ollama run deepseek-r1:1.5b下载完成之后就会出现命令行可以通过命令行和 AI 模型对话。1.2.3 测试模型拉取之后可以通过命令行和 AI 模型对话。ollama run deepseek-r1:1.5b我们可以对比下 1.5b 和 70b 的区别1.5b70b可以通过接口调用curl http://127.0.0.1:11434/api/chat \ -d { model: deepseek-r1:1.5b, messages:[ {role: user, content: 夸夸我} ], stream: false }1.3 SDK 接入这并非一种独立的接入方式而是对第一种 API 接入的封装和简化。模型提供商通常会发布官方编程语言 SDK为我们封装好了底层的 HTTP 请求细节提供一个更符合编程习惯的、语言特定的函数库。典型流程以 OpenAI Python SDK 为例安装库pip install openai安装 OpenAI SDK 后可以创建一个名为 example.py 的文件并将示例代码复制到其中from openai import OpenAI client OpenAI(api_keyyour-api-key) response client.responses.create( modelgpt-5, input介绍一下你自己。 ) print(response.output_text)相比直接构造 HTTP 请求代码更简洁、更易读、更易维护。6.4 问题与思考对于以上三种接入方式我们该如何选择・看数据敏感性如果数据极其敏感必须留在内部本地部署是唯一选择。・看技术实力和资源如果团队没有强大的 MLops机器学习运维能力也没有预算购买和维护 GPU 服务器云端 API 是更实际的选择。・看成本和规模如果应用规模很大长期来看本地部署的固定成本可能低于持续的 API 调用费用。反之小规模应用 API 更划算。・看定制需求如果只是使用模型的通用能力云端 API 足够。如果需要用自己的数据微调模型则需要选择支持微调的 API 或直接本地部署。实际上只要是原生 LLM无论怎么接入都有限制。为什么输入长度限制所有 LLM 都有固定的输入长度如 4K、8K、128K、400K Token。我们无法将一本几百页的 PDF 或整个公司知识库直接塞给模型。缺乏私有知识模型的训练数据有截止日期且不包含我们的私人数据如公司内部文档、个人笔记等。让它基于这些知识回答问题非常困难。复杂任务处理能力弱原生 API 本质是一个 “一问一答” 的接口。对于需要多个步骤的复杂任务如 “分析这份财报总结要点并生成一份 PPT 大纲”我们需要自己编写复杂的逻辑来拆解任务、多次调用 API 并管理中间状态。输出格式不可控虽然可以通过提示词要求模型输出 JSON 或特定格式但它仍可能产生格式错误或不合规的内容需要我们自己编写后处理代码来校验和清洗。像 LangChain 这样的框架正是为了系统性地解决这些问题而诞生的。这篇过后大家就可以将LLM接入进行一些简单的使用了。

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询