·tian
推理模型套利:在处理难题时,慢速昂贵模型反而更省钱
按 Token 计价仅反映了中位请求的成本,而非你产品实际服务分布的全额成本。一旦重试、人工介入和信任损失计入损益表,将复杂提示词路由至推理模型便会胜过默认使用通用模型。
insider
llm-routing
ai-cost
model-selection
+2·tian
评估天花板:当你的黄金测试用例失去区分度时
一旦每个候选模型在相同的测试用例上都获得了 95+ 的分数,你的评估套件就不再具备任何衡量价值 —— 是尺子不再适用,而不是被测平台的问题。
insider
ai-engineering
evaluation
llm
+2·tian
小模型,大账单:为什么单 Token 成本更低反而更贵
为了降低单 Token 成本而切换到更小的模型,可能会在不知不觉中增加你的 LLM 账单。正确的衡量单位是“每次成功任务的成本”,而大多数仪表板从未测量过这一指标。
llm
cost-optimization
observability
model-selection
+1·tian
在写第一个提示词之前,如何选对 LLM
公开基准已经饱和,无法告诉你哪个 LLM 能在你的系统中正常工作。本文提供一套实用框架,从真正重要的维度评估模型:函数调用可靠性、结构化输出合规性、你的领域拒绝率,以及真实并发下的延迟。
llm
model-selection
evaluation
production-ai
·tian
“够用就好”的模型选择陷阱:为什么你的团队在为 AI 支付冤枉钱
大多数团队会将所有 AI 功能都运行在最昂贵的模型上,仅仅是因为 Demo 是这么构建的。通过任务复杂度审计、三层路由策略以及正确的 A/B 测试方法,你可以在用户毫无察觉的情况下将 AI 支出降低一半。
insider
llm
cost-optimization
model-selection
+1·tian
生产环境中的推理模型:何时获益,何时受损
推理模型可以解决指令模型无法处理的问题 —— 但如果使用不当,成本会增加 10 倍,且每个请求会增加 10 秒的延迟。以下是你该如何权衡利弊的思考。
ai-engineering
llms
production-ai
model-selection