·tian
Prompt Caching 的隐形代价:当缓存命中提供错误的用户上下文时
Prompt 缓存键是一个正确性边界,而非一个计费开关。如果你只为了提高命中率而设计它,就会引发跨租户上下文泄露和过时的个性化。
ai-agents
prompt-caching
llm
architecture
+1·tian
Prompt 的 Pre-Commit Hooks:LLM 团队一直缺失的内环工具链
如今 Prompt 对行为的影响已经超过了代码,但大多数团队仍在使用 2008 年时代的工具进行评审。本文介绍了五种 pre-commit hooks —— 格式化工具、静态检查器、密钥与 PII 扫描器、冒烟评估以及缓存影响评估器 —— 旨在以应有的严谨态度对待 Prompt 的修改。
prompt-engineering
llm-ops
pre-commit
ci-cd
+1·tian
滑动窗口税:为什么 30 轮对话的成本远超单次对话的 30 倍
多轮 AI 功能在仪表板上按调用次数计费,但在实际支出中却遵循对话增长曲线。其长尾效应呈超线性增长,而这正是账单激增的根源。
insider
ai-engineering
llm-cost
prompt-caching
+1·tian
Prompt Cache 作为隐蔽信道:TTFT 探测泄露跨租户 Prompt
Prompt 缓存通过在租户间共享 KV 状态,可为缓存请求节省 80–90% 的开销——但也让首词延迟 (TTFT) 变成了一个侧信道,能以 92% 的准确率恢复其他客户的 Prompt。这是大多数团队尚未权衡过的成本与隔离之间的博弈。
insider
ai-security
llm-infrastructure
multi-tenancy
+2·tian
Prompt 缓存抖动:当最大租户上线导致所有人账单翻三倍时
Prompt 缓存的折扣在某个租户上线并逐出其他所有人的前缀之前是真实的。共享推理缓存是一个租户耦合面,而账单往往在事件发生几周后才送达。
llm
prompt-caching
multi-tenancy
observability
+1·tian
提示缓存命中率:你的成本仪表盘缺失的生产指标
缓存命中率是大多数团队从未监控的最具影响力的LLM成本杠杆。本文揭示了哪些因素会悄悄破坏它,以及如何在生产环境中加以防御。
llm
prompt-caching
cost-optimization
observability
·tian
冷缓存、热缓存:为什么你的 LLM 延迟数据在测试环境中具有欺骗性
Prompt 缓存会让测试环境的延迟看起来比生产环境真实情况好 80%。通过一套涵盖冷缓存、流量多样性和单节点路由的四阶段压力测试方法论,你可以在用户发现之前揭示真实的 p95 和 p99 数据。
llm-latency
prompt-caching
load-testing
production-ai
显示第 13–19 篇,共 19 篇
上一页2 / 2