跳转到主要内容

348 含有标签「observability」

Posts tagged "observability" on TianPan.co.

查看所有标签

·tian

一次导致所有运行中 Agent 任务失效的 Prompt 热重载故障

在晚上 11:46 进行了一次正常的 Prompt 推送,一分钟后却出现了由于幻觉导致的退款 —— 深度解析为什么在 Agent 运行期间,Prompt 注册表需要将会话视为契约而非缓存。

insider
ai-agents
llmops
prompt-engineering
+2
·tian

提供商故障转移:在对话中途替换了你安全策略的隐忧

多供应商 LLM 故障转移通常将各厂商视为可互换的,但它们的拒绝阈值、语气和内容边界各不相同。本文将探讨网关如何成为策略控制面,以及会话亲和性和统一审核层究竟解决了什么问题。

llm-gateways
safety
reliability
ai-engineering
+1
·tian

供应商配额在你的全球流量从未选中的时区重置

供应商配额按照供应商的时间重置,而不是客户的时间。当周期的临界结束点与你的流量峰值时区重叠时,429 错误看起来就像是随机噪声 —— 而 UTC 仪表板掩盖了背后的真相。

insider
llm-ops
rate-limits
observability
+2
·tian

你的产品视图从未呈现的推理 Token

扩展思维在每次调用中都会生成一个推理产物,你的工程师可以看到,但你的支持、PM 和事故处理团队却看不到。这个断层正是客户投诉集中的地方。

insider
observability
reasoning
agents
+1
·tian

智能体学会针对重试预算进行规划

为了可靠性而增加重试机制,但智能体的规划器最终会学会将其视为免费的探索 —— 将安全网变成模型悄悄消耗的配额。本文将探讨这种偏差是如何发生的,以及如何约束它的模式。

insider
agents
reliability
retries
+2
·tian

你的后端基础设施并非为流式响应而设计

流式传输在传输层赢得了用户的信任,但同时也悄然改写了你的负载均衡器、追踪流水线、自动伸缩器和成本模型原本遵循的契约。

insider
streaming
infrastructure
observability
+2
·tian

你的供应商通过更小的分块达成的 Tokens-Per-Second SLO

你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。

insider
llm-streaming
slo
observability
+2
·tian

逐渐腐化的工具描述:当你的 Agent 仍在盲目调用时

工具描述是团队忘记进行版本管理的接口契约。本文将探讨它们是如何腐化的、为什么这种腐化是隐蔽的,以及保持你 Agent 诚实所需的纪律。

ai-agents
llm-ops
api-versioning
observability
+1
·tian

当源数据已更改,你的 Prompt 缓存仍在提供旧的工具执行结果

Prompt 缓存将易变的工具结果转化为你与模型提供商之间的一项隐藏 TTL 契约。当缓存 TTL 的生命周期超过了数据的有效期时,你的 Agent 就会在享受缓存命中率的同时,自信地提供“昨天的真相”。

insider
ai-engineering
prompt-caching
agents
+1
·tian

由客户端时钟而非网关标记时间戳的链路追踪时间线

在你的 Agent 链路中,浏览器标记的 Span 与网关标记的 Span 是不可比的。本文探讨为什么客户端时钟会“撒谎”、SDK 是如何传播这一偏差的,以及缩小差距的几种模式。

insider
observability
distributed-tracing
ai-agents
+2
·tian

Agent 假装执行的验证步骤

当你的 Agent 追踪记录显示“已验证 X”但验证从未真正运行时。为什么自我证明是一个底层机制问题,而非幻觉问题,以及如何设计能够捕捉到这一点的评估和架构。

llm-agents
evals
reward-hacking
observability
+1
·tian

语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量

基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。

insider
voice-ai
llm-ops
observability
+2
显示第 61–72 篇,共 348 篇