跳转到主要内容

118 含有标签「llm-ops」

Posts tagged "llm-ops" on TianPan.co.

查看所有标签

·tian

那个‘总结’掉用户原始提问的压缩策略

自动总结保留了对话脉络,但悄然改变了下游工具所依赖的字面表述。本文将探讨该 Bug 是如何出现的,以及如何针对它进行架构设计。

insider
agents
context-engineering
llm-ops
+1
·tian

那些在评估集中遗漏、却在模型蒸馏中丢失的能力

蒸馏通过有限的样本优化散度,并根据有限的评估集进行交付。评估集未测量的行为是学生模型可以自由丢弃的熵 —— 而它首先丢弃的,通常是那些罕见但关键的能力。

distillation
evals
llm-ops
model-compression
·tian

那个在你的代码冻结期间送达的模型弃用通知

供应商的弃用节奏并非无法预知的外部天气。将供应商的时间表视为生产基础设施,这样下一次的停用通知才不会重新打乱你整个季度的优先级。

insider
ai-engineering
llm-ops
planning
+1
·tian

供应商配额在你的全球流量从未选中的时区重置

供应商配额按照供应商的时间重置,而不是客户的时间。当周期的临界结束点与你的流量峰值时区重叠时,429 错误看起来就像是随机噪声 —— 而 UTC 仪表板掩盖了背后的真相。

insider
llm-ops
rate-limits
observability
+2
·tian

你的仪表盘以三种不同方式统计了那次重试

一个智能体在成功前重试了三次。产品团队看到了转化,SRE 团队看到了 75% 的错误率,财务团队看到了四次计费推理。通过任务结果、步骤健康度和预算消耗这三个层面,在保持数据一致性的同时,无需强求一个指标满足所有人的需求。

insider
ai-engineering
agent-observability
llm-ops
+2
·tian

你的后端基础设施并非为流式响应而设计

流式传输在传输层赢得了用户的信任,但同时也悄然改写了你的负载均衡器、追踪流水线、自动伸缩器和成本模型原本遵循的契约。

insider
streaming
infrastructure
observability
+2
·tian

输入分布与用户实际输入不匹配的合成训练样本

你的合成微调在离线评估中表现惊人,但在生产环境中却下降了 20 分。这是因为教师模型生成的输入形态更接近它接收到的提示词,而不是你用户发送的实际输入。

synthetic-data
fine-tuning
evaluation
llm-ops
·tian

逐渐腐化的工具描述:当你的 Agent 仍在盲目调用时

工具描述是团队忘记进行版本管理的接口契约。本文将探讨它们是如何腐化的、为什么这种腐化是隐蔽的,以及保持你 Agent 诚实所需的纪律。

ai-agents
llm-ops
api-versioning
observability
+1
·tian

语音代理 SLO 定义为首个音频时间,而你的服务商则以首个 Token 时间衡量

基于 LLM 的首个 Token 时间(TTFT)构建的语音代理延迟 SLO 看起来是绿色的,但用户却听到了 600 毫秒的间隙。该 SLO 存在于错误的层级;用户的耳朵才是真正关键的边界。

insider
voice-ai
llm-ops
observability
+2
·tian

你定义‘首个 Token’的位置决定了你的延迟 SLO 是否真实

p99 首个 Token 延迟低于 800 毫秒看起来像是一个承诺——直到推理层的切换悄然重新定义了‘首个 Token’的含义。SLO 衡量的是供应商边界;而用户的感受则完全不同。

insider
llm-ops
observability
latency
+2
·tian

那些悄悄共享长期记忆的智能体 A/B 测试变体

在 A/B 测试变体之间共享长期记忆存储会导致实验本身产生耦合——变体 B 读取了变体 A 写入的记忆,导致测量的增量发生漂移,最终上线后的表现会退化到同一受污染环境下的另一个点上。

ab-testing
ai-agents
memory
experimentation
+1
·tian

第四方风险:当供应商的供应商掌控了你客户的故障

你的合同签署了一家供应商,但你的故障报告却指向了其背后的一层。本文教你如何梳理第四方风险、衡量真实冗余,以及如何撰写一份你无法完全掌控的故障复盘报告。

reliability
vendor-risk
llm-ops
slo
+1
显示第 13–24 篇,共 118 篇