Deployment & Inference ★ 19.0k

SGLang

Mesin serving yang dirancang untuk output terstruktur dan reuse prefix yang berat.

SGLang memadukan runtime cepat dengan RadixAttention untuk prefix caching — sangat menguntungkan ketika banyak request berbagi system prompt yang panjang. Dukungan constrained decoding-nya juga kelas satu, sehingga agent mode JSON tetap andal saat beban tinggi.

Cocok untuk: Output terstruktur, beban prefix bersama, agent

Deployment: Bisa self-host