跳转到主要内容

95 含有标签「llmops」

Posts tagged "llmops" on TianPan.co.

查看所有标签

·tian

在 18 个月后复现 AI 决策

一旦模型、提示词和检索索引都发生了轮换,复现你在 18 个月前做出的 AI 决策几乎是不可能的。本文将介绍如何在推理时捕捉具有说服力的决策记录。

ai-engineering
compliance
observability
llmops
+1
·tian

无法回滚的功能开关:提示词

提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。

insider
llmops
prompt-engineering
release-management
+2
·tian

没有预发布模型的预发布环境

托管模型是你无法建立忠实预发布副本的唯一依赖项。本文将探讨为什么 LLM 的预生产一致性会失效,以及版本固定、重放、黄金转录和影子流量如何分别只能填补部分差距。

insider
llmops
staging
model-versioning
+2
·tian

你的智能体对话记录是可被取证的,且法务从未批准过

你的智能体会记录每一个推理步骤,因为可观测性对此有需求,且存储成本低廉。但帮助你调试的 Trace 追踪记录同样也是传票的磁铁。在数据落地前,保留行动账本,让思考过程过期,并脱敏个人隐私信息(PII)。

ai-agents
observability
compliance
data-retention
+1
·tian

无法回滚的回滚:提示词、工具和记忆必须同步版本化,否则满盘皆输

当工具和记忆持续演进时,单独回滚智能体的提示词并不能恢复到已知的良好状态 —— 这样做只会交付一个未经测试的“怪胎”。本文探讨了为什么智能体部署是一个三位一体的过程,解析了每种单一维度的回滚是如何失败的,并介绍了如何像使用 lockfile 一样锁定提示词、工具契约和记忆。

insider
ai-agents
llmops
release-engineering
+1
·tian

你的 Prompt 拥有外键

重命名一个列,编译器能捕捉到每一个调用方,唯独漏掉了你的系统 Prompt。嵌入在 Prompt 中的 Schema、工具签名和 Few-shot 示例都是未声明的依赖项 —— 本文将介绍如何为它们提供清单、实现部署时生成以及 CI 强制的引用完整性。

ai-engineering
prompt-engineering
llmops
reliability
·tian

模型停滞不前,用户却在持续偏移

在没有进行任何部署的情况下,质量指标在上线 6 周后开始下滑 —— 因为用户的适应速度超过了模型的更迭速度。本文将探讨如何监测输入偏移、对指标进行分群拆解,并根据用户习惯化的周期来更新评估集。

ai-engineering
llmops
evals
monitoring
·tian

碳排放明细:对推理能耗进行预算管理

在同样的金钱成本下,两个完全相同的推理请求在碳足迹上可能相差 5 倍。为什么金钱支出不是衡量排放的有效指标,以及如何将能耗与延迟一起放入仪表盘中。

ai-infrastructure
sustainability
llmops
finops
·tian

3% 的回归不会让报警器响起:应对统计性故障的轮值工作

传统的轮值工作能够捕获系统崩溃和延迟激增。但真正损害 AI 产品的是那些悄无声息的 3% 质量下降,任何阈值都不会被触发。本文将介绍如何为统计性故障构建告警机制。

llmops
observability
machine-learning
reliability
+1
·tian

你的 AI 路线图需要一个“停用”列

只管发布的路线图会在 AI 系统中悄悄积累负债,因为模型、提示词和评估集会按照你无法控制的节奏腐化。请添加一个“停用”列,并将功能下线视为一等交付物。

insider
ai-engineering
technical-debt
roadmap
+2
·tian

从 Demo 到生产环境的“税收”:原型隐藏了 90% 的 AI 开发工作

那个令全场惊叹的 AI demo 只完成了 10% 的工作。剩下的 90% —— 评估、护栏、可观测性、成本控制、回退路径 —— 正是导致 88% 的试点项目在上线前夭折的“税收”。

insider
ai-engineering
llmops
evals
+2
·tian

那些被你的提示词工程师转变为生产环境 Few-Shot 示例的评估集

当提示词工程师将精心挑选的评估示例重新用作 Few-shot 演示时,一种团队级的数据泄漏正潜伏在指标不断攀升的评估仪表盘背后。本文将探讨为什么这种污染是隐形的,真正的独立性究竟需要什么,以及谁必须被赋予说“不”的权力。

insider
ai-engineering
evals
prompt-engineering
+1
显示第 1–12 篇,共 95 篇
1 / 8下一页