跳转到主要内容

95 含有标签「llmops」

Posts tagged "llmops" on TianPan.co.

查看所有标签

·tian

被你的团队视为独立于模型版本的提示词版本

Prompt v37 是针对 Claude 4.6 调优的。平台团队将别名滚动到了 4.7。你的事故时间线显示没有部署 —— 因为没有人追踪这种配对关系。

insider
llmops
prompt-engineering
model-versioning
+1
·tian

重试预算如何从你的仪表板中隐藏了供应商的真实错误率

一个在悄无声息间实现 99.9% 成功率 SLO 的同时导致账单翻了 3 倍的重试循环 —— 为什么重试后的可用性是向领导层报告的错误指标,你应该衡量什么,以及隐藏在可靠性层中的成本-质量调节开关。

insider
ai-engineering
observability
reliability
+2
·tian

一次导致所有运行中 Agent 任务失效的 Prompt 热重载故障

在晚上 11:46 进行了一次正常的 Prompt 推送,一分钟后却出现了由于幻觉导致的退款 —— 深度解析为什么在 Agent 运行期间,Prompt 注册表需要将会话视为契约而非缓存。

insider
ai-agents
llmops
prompt-engineering
+2
·tian

误将假期低谷视为新基线的 Token 预测

落在假期低谷的四周滚动窗口,会导致在进入新季度的第一天就让 Token 预算崩溃。本文将探讨为什么 LLM 支出预测呈现的是消费者需求而非基础架构成本的形态,以及通过同比基线叠加、日历叠加和残差反馈循环,让容量规划在日历周期中维持稳健。

insider
llm
capacity-planning
forecasting
+2
·tian

你的供应商通过更小的分块达成的 Tokens-Per-Second SLO

你的供应商通过缩小分块达到了每秒 Token 数的 SLA,但你的渲染器却为此付出了代价。为什么流式吞吐量是一个需要协同设计的属性 —— 以及如何编写一个由消费者主导的感官 SLO。

insider
llm-streaming
slo
observability
+2
·tian

你在三月份录制的演示视频是它最后一次正常工作的时候

随着模型快照、提示词、工具目录和检索底层在背后发生漂移,录制的销售演示视频已成为潜在的风险点。通过演示清单结合每晚的评估套件,可以将录像转化为可测试的行为承诺。

insider
llmops
model-drift
sales-engineering
+1
·tian

一路重试穿过你限流器的 agent

你的 token bucket 衡量的是用户点击;账单衡量的是模型调用。当一次点击扇出成三十次调用,HTTP 边界上的限流器就变成了一把纸糊的伞。

insider
agents
rate-limiting
observability
+2
·tian

继承了你客服团队最坏习惯的聊天机器人

在真实的客服对话记录上进行微调,不仅会传输领域知识,还会传输你团队的默契工作流。本文将揭示你的模型实际学到了什么,以及如何通过数据清洗和评估来捕捉这些问题。

fine-tuning
llmops
behavioral-cloning
customer-support
+1
·tian

你的评估集里只有你已经解决的问题

你的 LLM 评估分数在攀升,是因为幸存者偏差过滤掉了那些再也没有回来的用户。本文将告诉你如何发现你的评估套件无法察觉的失败案例。

evaluation
llmops
survivorship-bias
observability
+1
·tian

CFO 在电子表格上看不见的评测预算

评测投资像测试套件一样具有复利效应,但它在账面上表现为没有收入项的成本 —— 因此在与带有演示的新功能竞争优先级时总是落败。以下是如何让其反事实价值在财务部门眼中变得清晰可见。

insider
evals
ai-engineering
engineering-leadership
+1
·tian

故障复盘:根本原因竟是一个无人负责的提示词

一次生产事故追溯到了几周前修改的一个系统提示词(Prompt),由于当时没有 PR、没有审核人、也没有负责人。本文探讨了为什么提示词总是能绕过变更管理,以及如何在不降低迭代速度的前提下,将它们重新纳入审核流程。

insider
prompt-engineering
llmops
incident-response
+2
·tian

演示到生产的悬崖:为什么准确率 90% 的智能体发布率为 0%

每步成功率为 90% 的智能体是一个完美的演示,但却是一个无法发布的产品。这种差距不是打磨问题,而是高昂失败成本的长尾效应,而解决方案是降低这些失败的成本。

ai-agents
reliability
llmops
production-engineering
显示第 13–24 篇,共 95 篇