部署与推理

TensorRT-LLM

GPU 吞吐的最后几个百分点,代价是构建复杂度和硬件锁定。

vLLM 和 SGLang 是让你快速拿到一个不错的默认值,TensorRT-LLM 则要求你按「每个模型 × 每种 GPU 配置 × 每种精度」编译一个引擎,换来接近硬件极限的吞吐。当你在已知硬件上以极高流量服务一两个模型时,这个交易是划算的。在评估阶段、模型和硬件每周都变的时候,就很不划算。请把构建步骤当作部署流水线的一部分,而不是一次性动作。

适合场景:在固定 NVIDIA 硬件上高流量服务一组稳定模型