
text-generation-inference 启动器完全指南text-generation-launcher 全部参数详解与源码级解析【免费下载链接】text-generation-inferenceLarge Language Model Text Generation Inference项目地址: https://gitcode.com/GitHub_Trending/te/text-generation-inference本文是 Hugging Face text-generation-inferenceTGI项目中text-generation-launcher启动器的参数权威参考。TGI 部署的核心入口就是text-generation-launcher可执行程序它负责模型下载、跨 GPU 分片sharding、量化、批处理策略、HTTP 服务与可观测性配置等全部部署层面的工作。读完本文你将掌握启动器的每一个命令行参数、同名环境变量、默认值与取值约束并能结合源码理解这些参数如何影响推理性能、显存预算与请求调度从而为你的生产环境做出正确的部署调优决策。启动器在 TGI 架构中的角色在深入参数之前先明确text-generation-launcher在 TGI 整体架构中的位置。从 launcher/src/main.rs 的main函数第 2038 行起可以看到启动器是一个进程编排器其核心职责依次是解析配置通过 clap 框架解析命令行参数与环境变量Args::parse()launcher/src/main.rs读取模型配置从本地目录或 Hugging Face Hub 读取config.json用于推断量化方法、head 维度、显存占用等get_configlauncher/src/main.rs决定注意力实现根据模型类型与硬件计算能力自动选择flashinfer/paged/flashdecoding注意力后端并决定是否启用 prefix cachingresolve_attentionlauncher/src/main.rs下载并转换权重调用text-generation-server download-weights子命令download_convert_modellauncher/src/main.rs启动分片进程为每个 GPU shard 启动一个text-generation-server serve进程并通过 Unix Domain SocketUDS与它们通信shard_manager/spawn_shardslauncher/src/main.rs启动 Web 服务器最后拉起text-generation-router进程对外提供 HTTP/gRPC 服务spawn_webserverlauncher/src/main.rs。因此所有部署相关的旋钮都集中在启动器这一层本文档列出的每一个参数都对应 launcher/src/main.rs 中Args结构体的一个字段。参数通用约定所有参数既可作为 CLI 参数传入也可通过同名环境变量设置源码中每个字段都标注了env例如MODEL_ID对应--model-id环境变量的优先级与 CLI 参数相同clap 的env特性实际部署中尤其是 Docker 场景常用环境变量方式注入每个参数都有明确默认值或为可选项未显式配置时按默认值生效。一、模型加载参数MODEL_ID--model-id MODEL_ID指定要加载的模型。可以是在 hf.co/models 上列出的模型 ID如gpt2、OpenAssistant/oasst-sft-1-pythia-12b也可以是包含 transformerssave_pretrained(...)所保存文件的本地目录。环境变量MODEL_ID默认值bigscience/bloom-560m从源码看launcher/src/main.rsget_config会先检查model_id是否为本地已存在的路径若不是则假定为 Hub ID通过hf-hub的ApiBuilder下载config.json并支持通过HF_TOKEN环境变量携带访问令牌加载 gated 模型时必需。REVISION--revision REVISION当引用 Hub 上的模型时指定实际 revision可以使用具体的 commit id 或分支名如refs/pr/2。环境变量REVISION源码中该值同时被用于下载权重launcher/src/main.rs、启动 shard第 1011-1014 行与启动 router第 1916-1919 行保证三个进程加载的是同一版本的模型文件。TRUST_REMOTE_CODE--trust-remote-code是否允许执行 Hub 上的建模代码。当模型带有自定义 modeling 代码时需要开启。官方强烈建议加载带自定义代码的模型时显式指定revision以确保不会运行到新提交中可能混入的恶意代码。环境变量TRUST_REMOTE_CODE默认值falseTOKENIZER_CONFIG_PATH--tokenizer-config-path TOKENIZER_CONFIG_PATH指定 tokenizer 配置文件的路径用于加载可能包含chat_template的 tokenizer 配置。未提供时使用模型 Hub 上的默认配置。环境变量TOKENIZER_CONFIG_PATH该参数会透传给 routerlauncher/src/main.rs用于对话模板的渲染与请求校验。HUGGINGFACE_HUB_CACHE 与 WEIGHTS_CACHE_OVERRIDE--huggingface-hub-cache HUGGINGFACE_HUB_CACHE --weights-cache-override WEIGHTS_CACHE_OVERRIDE两者均用于覆盖 Hugging Face Hub 缓存位置典型场景是把缓存放到挂载的独立磁盘上。源码注释说明weights_cache_override主要用于 HuggingFace Inference Endpoint 场景launcher/src/main.rs会以WEIGHTS_CACHE_OVERRIDE环境变量形式传给下载与 shard 进程。环境变量HUGGINGFACE_HUB_CACHE、WEIGHTS_CACHE_OVERRIDE二、并行与分片参数Tensor ParallelismSHARDED--sharded SHARDED是否将模型分片到多张 GPU 上运行。默认情况下 TGI 会使用机器上所有可用 GPU设置为false会取消num_shard的作用。环境变量SHARDED可选值true、false默认值未设置时根据 GPU 数量推断NUM_SHARD--num-shard NUM_SHARD如果不想使用机器上全部 GPU可指定分片数量。官方示例在一台 4 卡机器上可以用如下命令启动两个各占 2 卡的实例CUDA_VISIBLE_DEVICES0,1 text-generation-launcher ... --num_shard 2 CUDA_VISIBLE_DEVICES2,3 text-generation-launcher ... --num_shard 2环境变量NUM_SHARD从源码find_num_shardslauncher/src/main.rs可以看到完整的解析逻辑--sharded--num-shard行为true未设置从CUDA_VISIBLE_DEVICES/NVIDIA_VISIBLE_DEVICES/ZE_AFFINITY_MASK推断 GPU 数量少于 2 卡时报错true设置了使用指定数量但num_shard 1会报错false设置了使用指定数量不强制要求 1false未设置1未设置未设置GPU 数量无 GPU 时为 1未设置设置了指定数量此外源码还在main中做了约束exl2量化不支持分片num_shard 1时直接报错launcher/src/main.rs。SHARD_UDS_PATH--shard-uds-path SHARD_UDS_PATHWeb 服务器与各 shard 之间 gRPC 通信使用的 Unix Domain Socket 名称。每个 shard 会在该路径后追加-{rank}后缀launcher/src/main.rsrouter 连接的是 rank 0 的 socket{path}-0第 1868-1869 行。环境变量SHARD_UDS_PATH默认值/tmp/text-generation-serverMASTER_ADDR 与 MASTER_PORT--master-addr MASTER_ADDR --master-port MASTER_PORTtorch distributed 使用的 master 地址与端口用于分片进程间的集合通信NCCL。源码中会以RANK、WORLD_SIZE、MASTER_ADDR、MASTER_PORT环境变量注入每个 shard 进程并额外设置TORCH_NCCL_AVOID_RECORD_STREAMS1launcher/src/main.rs。环境变量MASTER_ADDR、MASTER_PORT默认值localhost、29500三、量化参数QUANTIZE--quantize QUANTIZE指定模型的量化方法。对于预量化模型无需指定——量化方法会从模型配置中自动读取源码中Config::quantize由quantization_config.quant_method解析而来launcher/src/main.rs。对于 GPTQ/AWQ 模型会自动使用 Marlin 内核。完整取值如下与 launcher/src/main.rs 的Quantization枚举一一对应取值说明awq4 bit 量化。需要特定的 AWQ 量化模型hf.co/models?searchawq。延迟表现优于 GPTQ应尽可能替代 GPTQ 使用compressed-tensorsCompressed tensors可以是多种量化方法的混合eetq8 bit 量化不需要特定模型。可作为 bitsandbytes 的即插即用替代品性能显著更好内核来自 EETQ 项目exl2可变 bit 量化。需要特定 EXL2 量化模型。需要 exllama2 内核不支持张量并行num_shard 1gptq4 bit 量化。需要特定 GPTQ 量化模型。TGI 会优先使用 exllama更快内核不支持时回退到 triton 内核覆盖更广。AWQ 内核更快marlin4 bit 量化。需要特定的 Marlin 量化模型bitsandbytesBitsandbytes 8bit。可应用于任意模型显存需求减半但运行速度明显慢于原生 f16源码中已标注 deprecated建议改用eetqlauncher/src/main.rsbitsandbytes-nf4Bitsandbytes 4bit。可应用于任意模型显存需求降至 1/4但速度明显慢于原生 f16bitsandbytes-fp4Bitsandbytes 4bit。多数场景优先使用 nf4但 fp4 可能对某些模型有更好的困惑度表现fp8FP8e4m3量化适用于 H100 及以上。该 dtype 有原生算子应是最快的选择但目前由于本地解包与矩阵乘法限制的 padding尚未达到最快环境变量QUANTIZE重要约束--quantize不能与--dtype同时使用见下文。DTYPE--dtype DTYPE强制指定模型权重 dtype。环境变量DTYPE可选值float16、bfloat16不能与--quantize同时使用源码中Dtype枚举定义了float16与bfloat16两个值launcher/src/main.rs。KV_CACHE_DTYPE--kv-cache-dtype KV_CACHE_DTYPE指定 KV 缓存的 dtype。未指定时使用模型的 dtype通常是float16或bfloat16。目前仅 CUDA 上支持fp8_e4m3fn和fp8_e5m2。环境变量KV_CACHE_DTYPE可选值fp8_e4m3fn、fp8_e5m2CUDA_MEMORY_FRACTION--cuda-memory-fraction CUDA_MEMORY_FRACTION限制 CUDA 可用显存比例实际可用显存 总可见显存 ×cuda-memory-fraction。环境变量CUDA_MEMORY_FRACTION默认值1.0该值会以同名环境变量传给 shard 进程launcher/src/main.rs同时也参与启动器侧自动计算max_batch_prefill_tokens时的显存预算估算vram_maximumlauncher/src/main.rs。显存计算还受TGI_WIGGLE_ROOM环境变量影响默认 0.95作为安全余量系数见 launcher/src/main.rs。四、投机解码参数SPECULATE--speculate SPECULATE投机解码speculative decoding时要预测的input_ids数量。若使用 Medusa 模型heads 会被自动识别否则使用 n-gram 投机该方法计算开销相对较小但加速效果高度依赖任务类型。环境变量SPECULATE五、序列长度与显存预算参数这一组参数直接决定请求能占用的显存与批处理效率是部署调优的核心。MAX_INPUT_TOKENS--max-input-tokens MAX_INPUT_TOKENS用户允许发送的最大输入长度以 token 数计。值越大可接受的 prompt 越长但会直接影响处理负载所需的整体显存。注意部分模型对序列长度有上限。默认值为min(max_allocatable, max_position_embeddings) - 1。环境变量MAX_INPUT_TOKENSMAX_INPUT_LENGTH--max-input-length MAX_INPUT_LENGTHmax_input_tokens的旧版名称仅为了命名一致性而保留。源码中两者不能同时设置否则报错并提示只使用max_input_tokenslauncher/src/main.rs。环境变量MAX_INPUT_LENGTHMAX_TOTAL_TOKENS--max-total-tokens MAX_TOTAL_TOKENS最重要的参数之一它定义了运行客户端请求的显存预算。客户端发送输入序列并在其上请求生成max_new_tokens。例如设为1512时用户既可以发送 1000 token 的 prompt 并请求生成 512 个新 token也可以发送 1 token 的 prompt 并请求 1511 个新 token。该值越大每个请求占用的显存越多、批处理的有效性越低。默认值为min(max_allocatable, max_position_embeddings)。环境变量MAX_TOTAL_TOKENSMAX_BATCH_TOTAL_TOKENS--max-batch-total-tokens MAX_BATCH_TOTAL_TOKENS官方标注 IMPORTANT这是让硬件利用率最大化的关键控制项之一。它代表一个 batch 内的潜在 token 总量。在使用 padding不推荐时它等价于batch_size × max_total_tokens而在非 paddingflash attention版本中可以精细得多。例如max_batch_total_tokens1000时可以容纳 10 个total_tokens100的请求或 1 个 1000 token 的请求。总体而言该值应设置为模型加载后剩余显存能容纳的最大值。由于实际显存开销取决于量化方式、flash attention、模型实现等参数未提供时 TGI 会自动推断该值确保尽可能大。环境变量MAX_BATCH_TOTAL_TOKENS源码中还做了交叉校验max_total_tokens必须 max_batch_total_tokens否则直接报错launcher/src/main.rs。MAX_BATCH_PREFILL_TOKENS--max-batch-prefill-tokens MAX_BATCH_PREFILL_TOKENS限制 prefill 操作的最大 token 数。prefill 是显存占用最大且计算密集的操作限制它可以控制同时进入 prefill 的请求规模。默认值为max_input_tokens 50留一点余量。环境变量MAX_BATCH_PREFILL_TOKENS如果未提供源码会自动计算默认值launcher/src/main.rs基于 GPU 的 f16 算力与模型总计算量估算compute_optimal默认 4096qwen2_vl/qwen2_5_vl 为 10000gemma3 为 8000再取min(默认值, max_position_embeddings)并与基于显存预算估算的vram_maximum取较小值若显存不足还会打印告警提示降低 prefill 上限。MAX_BATCH_SIZE--max-batch-size MAX_BATCH_SIZE强制限制每个 batch 的最大请求数。这是针对不支持非 padding 推理的硬件目标的特殊参数例如某些后端。环境变量MAX_BATCH_SIZE六、动态批处理与并发控制参数WAITING_SERVED_RATIO--waiting-served-ratio WAITING_SERVED_RATIO等待中的请求数与运行中请求数的比值用于决定何时考虑暂停当前运行批次、把等待请求并入同一 batch。例如waiting_served_ratio1.2表示当 12 个请求在等待、而当前批次只剩 10 个请求在运行12/10 1.2时检查能否将这 12 个等待请求塞入批处理策略如果可以则执行 batching——用一次 prefill 运行来延迟当前 10 个运行中的请求。该设置仅在 batch 内还有空间由max_batch_total_tokens定义时生效。环境变量WAITING_SERVED_RATIO默认值0.3MAX_WAITING_TOKENS--max-waiting-tokens MAX_WAITING_TOKENS定义在强制将等待请求放入 batch 之前最多能放行多少 token前提是 batch 容量允许。新请求需要 1 次 prefill 前向这与 decode 不同因此必须暂停当前运行批次以执行 prefill才能为等待请求生成正确的 KV 状态以加入批次。调参要诀值过小请求会频繁抢占计算资源执行 prefill导致运行中的请求被严重延迟值过大等待请求可能等待过久才获得批次槽位。服务繁忙时原本空载 2 秒就能跑完的请求可能因为等待 18 秒而最终耗时 20 秒。该值以 token 数表示使其更具模型无关性但最终应关注的是端到端延迟。环境变量MAX_WAITING_TOKENS默认值20MAX_CONCURRENT_REQUESTS--max-concurrent-requests MAX_CONCURRENT_REQUESTS部署实例允许的最大并发请求数。设低可以让客户端请求被拒绝而不是长时间等待通常有利于正确的背压backpressure处理。环境变量MAX_CONCURRENT_REQUESTS默认值128MAX_CLIENT_BATCH_SIZE--max-client-batch-size MAX_CLIENT_BATCH_SIZE控制单个客户端请求中最多能携带的输入数量。环境变量MAX_CLIENT_BATCH_SIZE默认值4VALIDATION_WORKERS--validation-workers VALIDATION_WORKERSrouter 内用于 payload 校验与截断的 tokenizer worker 进程数。源码要求必须大于 0validation_workers 0直接报错launcher/src/main.rs。环境变量VALIDATION_WORKERS默认值2七、客户端能力上限参数这类参数定义了客户端在单个请求中可使用的高级能力上限。MAX_BEST_OF--max-best-of MAX_BEST_OF客户端可设置best_of的最大允许值。best_of会同时做n次生成并返回整段生成序列整体对数概率最优的那一个。环境变量MAX_BEST_OF默认值2MAX_STOP_SEQUENCES--max-stop-sequences MAX_STOP_SEQUENCES客户端可设置stop_sequences的最大允许值。stop sequences 让模型不只依赖 EOS token 停止还支持更复杂的提示工程——用户可以按特定方式预置 prompt 并定义与 prompt 对齐的自定义停止 token。环境变量MAX_STOP_SEQUENCES默认值4MAX_TOP_N_TOKENS--max-top-n-tokens MAX_TOP_N_TOKENS客户端可设置top_n_tokens的最大允许值。top_n_tokens用于在每个生成步返回最可能的n个 token 的信息而不只是采样得到的 token这些信息可用于分类、排序等下游任务。环境变量MAX_TOP_N_TOKENS默认值5PAYLOAD_LIMIT--payload-limit PAYLOAD_LIMIT请求 payload 的大小上限字节。环境变量PAYLOAD_LIMIT默认值20000002MBENABLE_PREFILL_LOGPROBS--enable-prefill-logprobs启用 prefill logprobs。prompt 的 logprobs 默认关闭因为它们会消耗大量显存尤其是长 prompt。开启该标志后用户才被允许请求 prompt 的 logprobs。环境变量ENABLE_PREFILL_LOGPROBS默认值false源码中该标志会以REQUEST_LOGPROBS1环境变量传给 shard 进程launcher/src/main.rs。八、内核与精度调优参数CUDA_GRAPHS--cuda-graphs CUDA_GRAPHS指定要为哪些 batch size 预计算 CUDA graphs。设为0可禁用。环境变量CUDA_GRAPHS默认值1,2,4,8,16,32源码中 CUDA graphs 的启用逻辑launcher/src/main.rs显式指定时使用指定值自动过滤掉 0未指定且使用bitsandbytes或exl2量化时自动禁用两者与 CUDA graphs 不兼容其余情况使用默认的[1, 2, 4, 8, 16, 32]。DISABLE_CUSTOM_KERNELS--disable-custom-kernelsTGI 为部分模型如 bloom实现了自定义 CUDA 内核以加速推理但这些内核只在 A100 上测试过。如果运行在其他硬件上遇到问题可用此标志禁用。环境变量DISABLE_CUSTOM_KERNELS默认值falseROPE_SCALING 与 ROPE_FACTOR--rope-scaling ROPE_SCALING --rope-factor ROPE_FACTOR仅对 RoPE 模型生效用于重新缩放位置旋转编码以容纳更长的 prompt。两者配合使用--rope-factor 2.0因子 2.0 的线性缩放--rope-scaling dynamic因子 1.0 的动态缩放--rope-scaling linear因子 1.0 的线性缩放基本不改变任何东西--rope-scaling linear --rope-factor X完整描述你想要的缩放方式。环境变量ROPE_SCALING、ROPE_FACTORROPE_SCALING可选值linear、dynamic源码中若只提供rope_factor而未提供rope_scaling会自动按linear处理launcher/src/main.rs并以环境变量ROPE_SCALING/ROPE_FACTOR形式传给 shard第 1080-1083 行。九、网络与服务参数HOSTNAME 与 PORT--hostname HOSTNAME -p, --port PORTHTTP 服务监听的 IP 地址与端口。环境变量HOSTNAME、PORT默认值0.0.0.0、3000PROMETHEUS_PORT-p, --prometheus-port PROMETHEUS_PORTPrometheus 指标端口。TGI 会在此端口暴露监控指标可配合 assets/tgi_grafana.json 的 Grafana 面板使用。环境变量PROMETHEUS_PORT默认值9000CORS_ALLOW_ORIGIN--cors-allow-origin CORS_ALLOW_ORIGIN允许的 CORS 来源可指定多个源码中为VecStringlauncher/src/main.rs。环境变量CORS_ALLOW_ORIGINAPI_KEY--api-key API_KEY为服务设置 API 密钥用于鉴权。环境变量API_KEYNGROK、NGROK_AUTHTOKEN、NGROK_EDGE--ngrok --ngrok-authtoken NGROK_AUTHTOKEN --ngrok-edge NGROK_EDGE启用 ngrok 隧道便于本地服务对外暴露。启用--ngrok时ngrok-authtoken与ngrok-edge都必须设置否则启动报错launcher/src/main.rs。router 的 Cargo 特性中ngrok默认开启router/Cargo.toml。环境变量NGROK、NGROK_AUTHTOKEN、NGROK_EDGE十、可观测性与日志参数JSON_OUTPUT--json-output以 JSON 格式输出日志适合遥测采集。环境变量JSON_OUTPUT默认值false源码中该标志同时作用于启动器自身日志tracing_subscriber的 json 格式launcher/src/main.rs与 router 进程第 1925-1927 行并且 shard 进程总是以 JSON 日志启动第 977 行由启动器统一解析后按日志级别转发log_lines/PythonLogMessage第 1344-1372 行。OTLP_ENDPOINT 与 OTLP_SERVICE_NAME--otlp-endpoint OTLP_ENDPOINT --otlp-service-name OTLP_SERVICE_NAMEOpenTelemetryOTLP上报端点与服务名用于分布式追踪与指标采集。环境变量OTLP_ENDPOINT、OTLP_SERVICE_NAMEOTLP_SERVICE_NAME默认值text-generation-inference.router两者会同时透传给 shard 与 router 进程launcher/src/main.rs、第 1930-1938 行。ENV-e, --env打印大量关于运行时环境的信息GPU、驱动、系统环境等。从源码看它调用env_runtime::Env::new()并以日志形式输出launcher/src/main.rs运行时信息还包括nvidia-smi的详细查询结果参见 router/src/usage_stats.rs 中定义的信息结构。USAGE_STATS--usage-stats USAGE_STATS控制是否收集匿名使用统计。三个取值on默认选项匿名收集使用统计off关闭所有统计收集no-stack不发送错误堆栈与错误类型但仍允许发送崩溃事件。环境变量USAGE_STATS默认值on该值会传给 routerlauncher/src/main.rsrouter 中对应UsageStatsLevel枚举与上报实现router/src/usage_stats.rs。十一、扩展功能参数LORA_ADAPTERS--lora-adapters LORA_ADAPTERSLoRA adapter 列表如repo/adapter1,repo/adapter2在启动时加载调用方可通过请求中的adapter_id字段使用。源码支持adapter_idpathrevision的增强格式并在启动时逐一下载每个 adapterlauncher/src/main.rs若 adapter id 中出现多个会报格式错误。adapter 会以LORA_ADAPTERS环境变量传给 shard第 1096-1098 行。环境变量LORA_ADAPTERSDISABLE_GRAMMAR_SUPPORT--disable-grammar-support禁用 outlines 语法约束生成grammar constrained generation该功能允许按特定语法生成文本如 JSON Schema 约束。环境变量DISABLE_GRAMMAR_SUPPORT默认值falseWATERMARK_GAMMA 与 WATERMARK_DELTA--watermark-gamma WATERMARK_GAMMA --watermark-delta WATERMARK_DELTA文本水印watermarking算法的两个参数以环境变量WATERMARK_GAMMA/WATERMARK_DELTA传给 shard 进程launcher/src/main.rs。环境变量WATERMARK_GAMMA、WATERMARK_DELTAGRACEFUL_TERMINATION_TIMEOUT-g, --graceful-termination-timeout GRACEFUL_TERMINATION_TIMEOUTTGI 服务器优雅终止的超时时间秒。源码中收到终止信号后先发SIGTERM等待进程自行退出超过超时时间后强制killterminate函数launcher/src/main.rs对 webserver 与各 shard 均适用。环境变量GRACEFUL_TERMINATION_TIMEOUT默认值90HELP 与 VERSION-h, --help # 打印帮助-h 显示精简版 -V, --version # 打印版本所有参数均可用text-generation-launcher --help查看-V打印启动器版本。十二、参数校验规则与启动流程中的自动推断除了逐项配置外启动器在真正拉起服务前还会做一系列校验与自动推断均位于 launcher/src/main.rs 的main函数max_input_tokens与max_input_length互斥两者同时设置会报错第 2100-2112 行输入必须小于总量max_input_tokens max_total_tokens否则报错第 2157-2163 行总量不能超过 batch 预算max_total_tokens max_batch_total_tokens第 2199-2208 行validation_workers必须大于 0第 2187-2191 行exl2与分片互斥第 2091-2096 行ngrok需要 authtoken 与 edge第 2210-2222 行注意力后端与 prefix caching 自动推断根据模型 head_dim64/128/256 支持 flashinfer否则回退paged/flashdecoding、VLM/seq2seq 模型、LoRA adapter 等条件自动禁用或启用 prefix cachingresolve_attention第 131-200 行max_batch_prefill_tokens自动计算结合 GPU 算力、模型 FLOPs、显存与cuda_memory_fraction综合估算第 2114-2154 行CUDA graphs 自动降级bitsandbytes/exl2下自动禁用第 2169-2185 行。十三、典型部署示例以下命令综合演示了本文档中主要参数的组合用法text-generation-launcher \ --model-id meta-llama/Llama-3.1-8B-Instruct \ --revision main \ --num-shard 4 \ --max-input-tokens 4096 \ --max-total-tokens 8192 \ --max-batch-prefill-tokens 8192 \ --max-batch-total-tokens 65536 \ --max-concurrent-requests 256 \ --waiting-served-ratio 1.2 \ --max-waiting-tokens 20 \ --max-best-of 4 \ --max-stop-sequences 6 \ --max-top-n-tokens 20 \ --port 3000 \ --prometheus-port 9000 \ --json-output \ --cors-allow-origin https://example.com \ --api-key your-api-key \ --huggingface-hub-cache /mnt/hf-cache等效的环境变量写法适合 Docker 注入export MODEL_IDmeta-llama/Llama-3.1-8B-Instruct export NUM_SHARD4 export MAX_INPUT_TOKENS4096 export MAX_TOTAL_TOKENS8192 export MAX_BATCH_PREFILL_TOKENS8192 export MAX_BATCH_TOTAL_TOKENS65536 export MAX_CONCURRENT_REQUESTS256 export WAITING_SERVED_RATIO1.2 export PORT3000 export PROMETHEUS_PORT9000 export JSON_OUTPUTtrue text-generation-launcher延伸阅读启动器全部参数与进程编排源码launcher/src/main.rs启动器的 GPU 检测与运行时环境信息launcher/src/gpu.rs、launcher/src/env_runtime.rsrouter对外 Web 服务实现router/src/server.rs、router/src/lib.rs使用统计上报实现router/src/usage_stats.rsshard 端 Python 服务 CLIserver/text_generation_server/cli.py部署安装方式docs/source/installation.md快速上手docs/source/quicktour.md监控指标说明docs/source/reference/metrics.md【免费下载链接】text-generation-inferenceLarge Language Model Text Generation Inference项目地址: https://gitcode.com/GitHub_Trending/te/text-generation-inference创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考