·tian
大多数团队都会搞错的 LLM 基础设施“自研还是购买”决策
大多数团队在做 LLM 基础设施“自研还是购买”的决策时,都低估了双方的总拥有成本 (TCO)。本文将为你分析各个阶段的盈亏平衡计算,以及那些没人列入预算的隐藏成本。
llm
infrastructure
cost
self-hosting
·tian
开源权重模型的生产实践:自托管何时真正优于 API
一个关于自托管 Llama、Mistral 和 Qwen 等开源权重模型与使用前沿 API 的实用决策框架——涵盖真实成本分析、合规触发条件、运维负担,以及大多数生产团队实际需要的混合架构。
llm
self-hosting
open-weight-models
infrastructure
+1·tian
生产环境下的自托管 LLM:没人告诉你的 GPU 显存计算公式
生产环境下的自托管 LLM GPU 显存规划几乎总是出错,因为团队往往只根据模型权重估算而忽略了 KV 缓存。本文将详细解析其中的计算逻辑、INT4/FP8/FP16 之间的量化权衡、推理框架选择,以及从云端 API 转向自托管的真实盈亏平衡计算。
insider
llm-inference
self-hosting
gpu
+2