跳转到主要内容

8 含有标签「llm-observability」

Posts tagged "llm-observability" on TianPan.co.

查看所有标签

·tian

那些被静音的 LLM 报警:当每一次值班看起来都和上一个一模一样

当看起来完全相同的报警不断出现却无法触发任何后续行动时,LLM 功能的告警疲劳便悄然而至。随之而来的静音规则虽然是理性的适应行为,却最终破坏了生产环境的检测机制。

insider
llm-observability
on-call
alert-fatigue
+2
·tian

你在调试时无意中构建的微调数据集

当你在测试环境 UI 中的“踩”按钮被悄悄用作训练流水线时,你实际上是在针对过去六个月里个人的品味、客户文本以及工程师的吐槽进行微调。请务必将调试界面与标注界面分开,否则你交付的模型可能是基于你团队那一周的心情训练出来的。

insider
fine-tuning
mlops
data-quality
+1
·tian

思维标记(Thinking Tokens)在你的日志中隐身,但在账单上却震耳欲聋

推理标记(Reasoning tokens)按输出计费,但它们存在于一个大多数 LLM 可观测性栈在构建时尚未涉及的字段中。本文将分析为什么财务部门总是先于技术人员发现成本回归,以及你该如何弥合这一差距。

insider
llm-observability
reasoning-models
ai-cost
+2
·tian

流式响应追踪模式鸿沟:为什么你的 APM 在 LLM 延迟上撒了谎

流式 LLM 响应打破了请求/响应的 Span 模型。duration 字段具有误导性;故障发生在边界之间——如 TTFT 回归、中途停顿、内容死循环——而解决方案是采用基于检查点的 Token 时间事件,并建立真正的尾部事件分类体系。

llm-observability
streaming
opentelemetry
tracing
+1
·tian

仪表盘视为噪点的周一早晨 AI 性能下降

大多数 AI 功能仪表盘通过取平均值抹平了一种导致真金白银损失的故障模式 —— 这种每周循环的性能下降,只有当你按小时维度拆解延迟、缓存命中率和重试次数时才会显现。

llm-observability
production-ai
capacity-planning
sre
+1
·tian

你的工具结果缓存是一份你从未签署过的过期数据契约

链路追踪中看似正常的缓存工具结果,正在悄无声息地产生言之凿凿的错误答案。请将缓存视为一种单工具的新鲜度契约 —— 根据波动性设置 TTL、在结果中包含新鲜度元数据、建立绕过层,并增加过期缓存评估切片。

ai-engineering
agents
caching
llm-observability
+1
·tian

归因鸿沟:如何将用户投诉追溯到具体的模型决策

当用户反馈AI给出错误建议时,大多数团队无法重建是哪个模型版本、哪个提示词或哪段检索上下文产生了该输出。本文介绍让AI投诉可追查的日志方案、追踪传播和采样策略。

llm-observability
ai-engineering
distributed-tracing
rag
+1
·tian

智能体调试难题:当代码会思考时,Printf 为何失效

智能体的 Bug 不会抛出异常——它们以 200 状态码返回自信但错误的答案。本文是关于基于链路追踪的调试、回放工作流以及制约生产环境 AI 智能体发展的工具缺口的实用指南。

agent-debugging
llm-observability
ai-agents
production-ai