部署与推理

推理服务栈、推理引擎、GPU 编排与成本控制工具。

该分类下的工具

部署与推理 ★ 29.2k

9router

一层路由,让某个供应商限流时你的编码 Agent 还能继续跑——光是自动回退这一项就值。

重度使用 Agent 时经常被供应商限流的个人与小团队 阅读全文 →
部署与推理 ★ 62.0k

vLLM

基于 PagedAttention 的高吞吐推理引擎——要在同一张卡上压出更多吞吐,通常就是它。

NVIDIA / AMD 显卡上的自托管生产推理 阅读全文 →
部署与推理 ★ 118.0k

Ollama

一条命令在笔记本上跑起大模型——把模型摆到客户面前最快的方式。

本地演示、隔离网试点、开发机 阅读全文 →

该分类下的文章