·tian
你从未进行过压测的每分钟 Token 上限
供应商的速率限制是你无法控制的每分钟 Token 预算 —— 而产品发布则是发现这一上限的最糟糕时机。本文将介绍如何在 429 错误发生前进行预测、压测并预留缓冲空间。
llm
capacity-planning
rate-limits
reliability
+1·tian
冷缓存、热缓存:为什么你的 LLM 延迟数据在测试环境中具有欺骗性
Prompt 缓存会让测试环境的延迟看起来比生产环境真实情况好 80%。通过一套涵盖冷缓存、流量多样性和单节点路由的四阶段压力测试方法论,你可以在用户发现之前揭示真实的 p95 和 p99 数据。
llm-latency
prompt-caching
load-testing
production-ai
·tian
LLM 应用压力测试:为什么 k6 和 Locust 会误导你
传统的压力测试工具在测试 LLM API 时往往关注错误的指标。了解哪些指标才是真正重要的——TTFT、Token 间延迟、有效吞吐量(Goodput)——以及如何构建能够预测生产环境行为而非掩盖故障模式的测试。
llm
performance
load-testing
ai-engineering