跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

被反向代理剥离的 SSE Keep-Alive,以及你支付了两次费用的 Prompt

LLM 流式响应看起来像是从模型到用户的通畅管道 —— 直到一次 35 秒的工具调用导致反向代理断开连接,你的客户端针对无状态 API 重试整个 Prompt,最终用户的账单为同一个响应支付了两次费用。

insider
ai-engineering
llm
observability
+2
·tian

你发出的流式中止信号,供应商照样收了费:账单中隐藏的 14% 差额

你的停止按钮触发了 AbortController.abort(),但供应商会持续生成直到下一个批处理边界,并对差额部分计费。这种差额是一个可衡量的工程问题,且涉及财务责任。

llm-cost
finops
streaming
inference
+1
·tian

那些将模型未完成的残缺回答存入数据库的流式 UI

当流在生成中途报错时,乐观写入的内容可能会变成正式记录。本文探讨了为什么聊天 UI 会将残缺回答误认为完整答案,以及修复该问题的“定稿契约”。

insider
streaming
llm-ops
ux
+2
·tian

那个把用户的字面问题“改写”没了的摘要器

对话摘要器会将旧的轮次压缩成改写后的文字,这往往会丢掉用户问题所依赖的核心动词,导致模型在第 41 轮对话时自信地回答了一个错误的问题。你应该把摘要器视为关键路径上的模型:锁定用户的确切原话,评估实体覆盖率,不要再让 Token 预算的旋钮来决定你的产品会忘记什么。

llm
context-engineering
summarization
evals
·tian

那个因为共享 Prompt 模板而对子代理盲目“盖章”放行的监督代理

一个共享 Prompt 模板的“监督代理审查子代理”循环并不是独立的检查——它本质上是同一个模型在自我肯定,而极高的批准率正是其破绽。

insider
multi-agent
llm-as-judge
evaluation
+1
·tian

你在供应商支持呼叫中通过屏幕共享泄露的系统提示词

系统提示词保护方案加固了应用程序边界,却忽略了屏幕像素。泄露面覆盖了你的工程师参与的每一次屏幕共享、Loom 录制和供应商支持呼叫。

insider
ai-security
llm-ops
operational-security
+1
·tian

那个通过后门污染了你评估集的点赞按钮

隐式的点赞反馈会使你的评估集向点击人群倾斜,而偏离了付费人群。本文将详细分析这种泄漏是如何发生的,以及如何围绕它进行治理。

llm-evaluation
mlops
product-analytics
feedback-loops
·tian

客户端估算的 Token 数量与供应商结算账单的差异

本地分词器估算值与供应商计费 Token 之间的细微漂移,通常只会被视为背景噪声,直到其在多语言内容、粘贴的代码以及工具 Schema 上集中体现 —— 此时财务部门会开始询问,为什么 AI 费用项与你自己的日志不再匹配。

insider
cost-management
llm
tokenization
+1
·tian

使所有 Prompt 缓存前缀失效的分词器升级

一次分词器的变更可能会在其他所有信号显示正常的情况下,让你的 Prompt 缓存命中率在一夜之间从 80% 跌至个位数。本文将探讨哪些环节会出问题、为什么这种现象难以察觉,以及你应该监控哪些指标。

insider
prompt-caching
llm-cost
tokenizers
+2
·tian

与工具本身脱节的工具描述

当工具的 JSON Schema 和其文本描述存放在不同位置时,它们会各自独立演进并产生偏差 —— 导致模型遵循了描述中的错误,而这些错误本可以通过 Schema 捕获。本文将探讨为什么工具描述是你有效系统提示词的一部分,以及如何确保它们的真实性。

insider
llm-tools
agent-engineering
tool-calling
+1
·tian

导致你的智能体重试机制失效两周的工具 Schema 迁移

为期六周的弃用窗口对每一位人类消费者都运作完美,却让智能体静默失效了整整十四天。本文探讨了重试预算、解析错误和优雅降级为何会交织成一场无人报警的故障,以及捕获这些问题的关键指标。

ai-agents
observability
api-design
reliability
·tian

你的网关在 LLM 调用与工具执行之间丢失的 traceparent 请求头

生产环境中的 LLM 智能体技术栈经常在模型调用与工具执行之间丢失 W3C traceparent 请求头,导致原本连贯的用户交互逻辑碎裂成一堆“孤儿追踪”森林 —— 本文将揭示泄漏发生的环节以及如何修复它。

insider
observability
llm-agents
opentelemetry
+2
显示第 217–228 篇,共 2312 篇