·tian
CPU 调节器决定了你的 Agent 基准测试结果:那个被忽视的 CI 宿主机因素
一次 22% 的 Agent 延迟回归,最终发现竟是 Runner 镜像中的 cpufreq 调节器变更所致 —— 以及为什么 CI 基准测试数值测量的是宿主机,而非你的代码。
ai-agents
benchmarking
ci-cd
performance
·tian
评测环境的延迟谎言:为什么你的 p95 在生产环境中翻倍
评测套件测量的是在一台安静机器上针对热缓存进行的串行调用;生产环境则是另一回事。将延迟视为部署的属性,而非模型的属性,否则你的 p95 数据将会具有误导性。
llm-ops
evaluation
latency
observability
+1