跳转到主要内容

43 含有标签「performance」

Posts tagged "performance" on TianPan.co.

查看所有标签

·tian

CPU 调节器决定了你的 Agent 基准测试结果:那个被忽视的 CI 宿主机因素

一次 22% 的 Agent 延迟回归,最终发现竟是 Runner 镜像中的 cpufreq 调节器变更所致 —— 以及为什么 CI 基准测试数值测量的是宿主机,而非你的代码。

ai-agents
benchmarking
ci-cd
performance
·tian

你的编排器在规划步骤上消耗的延迟预算

智能体的大部分延迟都消耗在了决定下一步该做什么,而不是执行上。将规划器的开销视为一等公民的 SLO 指标,优化方向就会变得显而易见。

agents
llm
observability
performance
+1
·tian

你的供应商通过更小的分块达成的 Tokens-Per-Second SLO

你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。

insider
llm-streaming
slo
observability
+2
·tian

不属于你的那次变慢:对话中途的 KV 缓存逐出

在第十二轮,你对话的首字延迟暴涨 4 倍,而追踪日志什么也解释不了。你所依赖的 KV 缓存被另一个租户的请求驱逐,而你没有任何遥测指标能点出原因。

llm
inference
kv-cache
multi-tenancy
+1
·tian

MCP 冷启动税:工具服务器开销如何在智能体第 7 步发生累加

为什么 200 毫秒的 MCP 工具调用会演变成 4 秒的智能体循环,冷启动税究竟存在于何处,以及如何通过预热池规范将数秒的惩罚降低到 100 毫秒以下。

insider
mcp
agents
latency
+2
·tian

LLM 尾部延迟:为什么在 P50 表现良好时你的 P99 却是一场灾难

LLM 响应时间分布在本质上呈现出传统 API 监控完全无法察觉的重尾特性。本文将教你如何诊断 P99 差距并修复它。

llm
inference
latency
performance
+1
·tian

分析 LLM 流水线:推理之外的性能瓶颈

大多数 LLM 流水线的延迟并不发生在推理阶段。本文将详细分析真正的瓶颈——预处理、重复分词、同步检索、序列化——以及如何通过分阶段追踪使它们可见。

insider
llm
observability
rag
+2
·tian

上下文长度军备竞赛:为什么填满窗口是错误的目标

每个大模型新版本发布时都会宣传更大的上下文窗口。但实践者正在发现,填满窗口会降低质量、增加延迟并消耗预算——而稀疏、精心筛选的上下文始终优于朴素的堆砌方式。

insider
llm
context-window
rag
+2
·tian

端到端延迟并非你的 LLM 调用 P99:代理系统中无人衡量的隐藏乘数

为什么你的 LLM API 调用的 P99 延迟几乎无法反映用户在多步代理工作流中的真实体验 —— 以及填补这一差距的隐藏乘数。

ai-engineering
llm
performance
observability
+1
·tian

智能体管道中的并行陷阱:扇出为何让延迟更糟

拆分出并行子智能体看起来是显而易见的提速方案,但隐藏的协调开销——上下文合并、去重、错误聚合——会让 p99 延迟变得更糟,即便 p50 有所改善。

ai-engineering
agents
performance
latency
·tian

扼杀 AI 流水线吞吐量的预处理瓶颈

大多数团队只对 LLM 调用做性能分析就宣告完成。真正的吞吐量杀手是模型看到第一个 token 之前的所有操作——解析、分块、嵌入和富化,它们悄无声息地主导着端到端延迟。

ai-engineering
rag
performance
mlops
·tian

多步 Agent 的延迟预算:为什么 P50 会说谎,而 P99 才是用户的真实感受

多步 Agent 在中位数延迟上看起来很快,但在尾部延迟上却让人感觉很慢。本文将探讨为什么系统组合会惩罚 P50 仪表板,以及如何设计符合用户实际体验的延迟预算。

insider
agents
latency
observability
+1
显示第 1–12 篇,共 43 篇
1 / 4下一页