跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

Prompt 迭代中的“局部最大值”陷阱:如何判断你调错了地方

提示词调优了六周,评估分数依然在 4 分的区间内波动?你正处于局部最大值。本文将教你如何诊断你究竟撞到了哪块天花板——是提示词、检索、模型、规范还是数据——并选择能打破僵局的关键杠杆。

llm
prompt-engineering
evals
production-ai
+1
·tian

主权崩塌:记录你的 Prompt 究竟去了哪里

应用日志显示请求发送到了 eu-west-1,但提供商在故障转移期间将其路由到了美国和新加坡。构建单次请求的主权路径,将审计转化为可查询的资产。

insider
llm
compliance
gdpr
+2
·tian

RAG 流水线中被你忽略的查询重写层

大多数检索失败源于查询形态的问题,而非嵌入模型本身。本文将深入探讨 HyDE、查询分解、多查询并行分发以及排名融合等技术,并教你如何在盲目更换编码器之前,诊断出你的 RAG 流水线真正需要的优化方案。

insider
rag
retrieval
llm
+2
·tian

Agent 的链路追踪采样:每日千万级 Span 中哪些值得保留

为什么默认的均匀采样在 Agent 工作负载中会失效,以及决定你的链路账单和故障平均修复时间 (MTTR) 的四个关键决策 —— 开始、结束、分层与保留。

agents
observability
llm
sampling
+1
·tian

智能体无法察觉的死锁:生成计划中的循环工具依赖

LLM 编写的智能体计划通常包含经典死锁检测无法发现的隐式循环。通过静态计划图处理结合运行时看门狗,可以在 Token 耗尽前捕获这些问题。

insider
ai-agents
llm
observability
+2
·tian

冷启动评估:如何在零生产环境追踪的情况下发布 AI 功能

没有生产追踪意味着没有免费的评估信号 —— 但等待真实用户也不是解决办法。本文介绍一套四层冷启动评估栈:结构化的内部试用、基于角色的场景模拟、专家标注的种子集,以及公开的对抗性探测库。通过明确权重,确保声音最大的内部用户不会左右评估标准。

ai-evaluation
llm
product
agents
+1
·tian

对话历史是你的提示词从未承认的负担

聊天历史并非免费的上下文。每一轮对话都会增加噪声,干扰注意力,并导致单轮准确率下降 —— 本文将介绍如何检测、压缩和整理这些内容。

llm
context-management
ai-engineering
agents
+1
·tian

按功能计费,而非按 Token 计费:AI 预算分配中的缺口

每个端点的 Token 支出掩盖了哪些 AI 功能在赚钱。将推理追踪与产品遥测相结合的打标规范,能将定价、准入控制和功能废弃的决策从“凭感觉”转变为“看数据”。

finops
llm
observability
cost-attribution
+1
·tian

“以后再加评估”的陷阱:测量债务如何产生复利效应

跳过评估能让你在一个季度内发布得更快,但接下来的四个季度会变慢。本文探讨了测量债务如何产生复利效应、早期的预警信号,以及防止这种偏移的组织级强制机制。

insider
evals
llm
ai-engineering
+2
·tian

幻觉成功问题:当你的智能体宣称完成却一事无成时

那些在没有实际完成工作的情况下却自信地报告任务完成的智能体,正在悄悄地破坏你的仪表盘数据。本文将介绍在用户发现之前捕捉这些问题的验证模式。

ai-agents
reliability
observability
llm
+1
·tian

你的 P99 正在受陌生人流量的影响:托管 LLM 推理中的“吵闹邻居税”

托管 LLM API 在你从未见过的租户之间共享 GPU、批处理和 KV 缓存预算,因此你的尾部延迟会随陌生人的流量而波动。本文将介绍如何证明这一点、如何缓解,以及何时决定转向专用算力。

llm
infrastructure
observability
latency
+1
·tian

你的 LLM Span 在撒谎:APM 工具没告诉你的推理延迟真相

标准的 APM 工具将 LLM 调用视为一个不透明的 span —— 但 prefill、decode、缓存未命中和批处理位置都隐藏在这个耗时段中。本文将揭示你真正需要的追踪层面。

insider
llm
observability
opentelemetry
+2
显示第 349–360 篇,共 778 篇