跳转到主要内容

14 含有标签「caching」

Posts tagged "caching" on TianPan.co.

查看所有标签

·tian

你的 Agent 每一轮都在重新生成对话摘要,只因缓存键包含了一个时间戳

一行为了调试而做的代码变更,在摘要缓存键中加入了一个时间戳,导致 LLM 账单在两周内悄无声息地翻了三倍 —— 本文探讨了为什么缓存键是一项契约而非简单的工程细节,以及为什么缓存命中率必须作为核心观测指标。

insider
llm-infrastructure
caching
observability
+2
·tian

由于注册表缓存存在一小时延迟,你的智能体仍在调用已被撤销的工具

当用户移除一个智能体工具时,一小时的注册表缓存以及将拒绝视为暂时性错误的重试策略,会将一次常规的撤销变成一个安全事件,而用户只能通过审计日志才发现这一问题。

agents
tool-use
mcp
caching
+1
·tian

你的 AI 功能无法使用 CDN 边缘缓存,因为响应因用户而异

个性化 AI 功能继承了与缓存网页不同的物理特性。你的团队从 CDN 支持的界面借鉴的延迟 SLO,对于按用户生成的响应来说,在结构上是无法实现的 —— 以及你应该如何应对。

ai-engineering
latency
caching
slo
+1
·tian

自信地返回错误答案的语义缓存

语义缓存用精确匹配的保证换取了低延迟,而代价则是将误命中作为流畅的事实返回。本文将探讨如何衡量误命中率、选择 Embedding 模型、缓存检索而非生成,并将阈值调优作为一项安全决策。

llm
caching
ai-engineering
rag
+1
·tian

Agent 记忆是一个没有失效策略的缓存

长期记忆通常被作为一项功能发布,但它本质上是一个关于不断变化的世界的事实缓存。如果没有失效、溯源和冲突规则,它就会变成一个缓慢发生的正确性 Bug。

ai-agents
memory
caching
llm
+1
·tian

首个Token在撒谎:为什么上下文加载——而非推理——才是AI功能延迟的真正瓶颈

AI功能的感知速度在模型生成第一个Token之前就已决定。上下文预热——预加载用户历史、预热嵌入缓存、投机性获取工具Schema——才是真正影响首Token时间的工程纪律。

insider
ai-engineering
latency
context-engineering
+2
·tian

你的工具结果缓存是一份你从未签署过的过期数据契约

链路追踪中看似正常的缓存工具结果,正在悄无声息地产生言之凿凿的错误答案。请将缓存视为一种单工具的新鲜度契约 —— 根据波动性设置 TTL、在结果中包含新鲜度元数据、建立绕过层,并增加过期缓存评估切片。

ai-engineering
agents
caching
llm-observability
+1
·tian

语义缓存是安全隐患,而非性能提升

语义缓存能在不到一毫秒的时间内返回另一个用户的响应,而你的命中率仪表盘还会因此变绿。本文探讨如何通过缓存键设计、溯源封装和审计追踪,从架构层面防止跨用户数据泄漏。

insider
llm
security
caching
+2
·tian

AI缓存失效:为什么答案可以改变时每个缓存层都更难处理

传统的TTL和基于标签的缓存失效机制在AI系统中失效了。本文逐层拆解每个缓存层——语义缓存、RAG知识库、提示缓存和嵌入索引——各层特有的故障模式,以及在生产中保持一致性的设计模式。

insider
ai-engineering
caching
rag
+2
·tian

AI Agent 工作负载的缓存层级:多数团队止步于第二层的五层架构

生产级 AI Agent 需要五个缓存层 —— 提示词、语义、工具结果、计划和会话状态 —— 每个层级都有独特的 TTL 和失效策略。大多数团队只做了前两层,白白流失了一半的节省空间。

ai-agents
caching
llm-optimization
system-design
·tian

合并再调用:无需降低用户体验即可削减成本的 LLM 请求批处理模式

请求合并是一种分层架构——飞行中去重、精确缓存和语义批处理——可在不降低用户体验的情况下将 LLM 推理成本降低 40–60%。本文介绍如何实现以及在哪些地方会遇到问题。

llm
cost-optimization
system-design
caching
·tian

LLM 语义缓存:大多数团队都会忽略的成本控制层

语义缓存可以消除语义等效查询的 LLM 调用 —— 但实际生产环境中的命中率通常在 10% 到 70% 之间。在构建之前,本文将为你分析其中的数学原理、阈值权衡、失效陷阱以及故障模式。

llm
caching
cost-optimization
production
+1
显示第 1–12 篇,共 14 篇
1 / 2下一页