自托管 vs 托管推理:成本曲线的真实交叉点在哪
「自托管更便宜」只有在利用率超过某个水平之后才成立。低于这个水平,你在为闲置的 GPU 和工程师的注意力付费——而第二项,几乎没人写进表格。
发生了什么
团队常把托管 API 的每 token 价格和 GPU 实例的小时费用对比,得出自托管更划算的结论,然后发现平均利用率不到 30%,而且还得有人盯着驱动升级。
对交付团队意味着什么
诚实的对比有三项:按真实利用率算的算力、运行与升级这套栈所需的工程时间、以及你因此继承的延迟或容量上限的代价。托管厂商本质上是在把第二项和第三项加价卖给你。
可以立刻做的事
先测利用率再决策。如果 p50 利用率低于约 40%,先用托管,每季度复盘一次——预留容量与更好的推理栈在不断把交叉点往后推。
可以立刻做的事
- 决定之前先测真实 GPU 利用率
- 要算工程时间,不只是算力小时数
- 每季度重算一次这笔账