跳转到主要内容

95 含有标签「llmops」

Posts tagged "llmops" on TianPan.co.

查看所有标签

·tian

AI 驱动功能的“完工”定义:工程化永恒的 Beta 测试

AI 驱动的功能永远不会进入一个稳定的“完工”状态——模型漂移、现实漂移和预期漂移创造了持续的迭代压力。本文介绍了工程和治理基础设施,如何让“稳定但不断演进”的状态显得更像是高质量的表现,而非未完成。

ai-engineering
llmops
evaluation
product
·tian

AI 系统值班:当 Bug 是模型时的事故响应手册

当故障源于非确定性的模型行为时,标准的值班手册就会失效。本文提供了一个实用的框架,用于检测、分类和遏制 AI 事故 —— 从护栏绕过到成本爆炸 —— 这些手册专为工程师而非 ML 研究人员打造。

llmops
incident-response
ai-engineering
observability
·tian

语义化版本控制对 AI 智能体意味着什么

当你的服务具有非确定性时,传统的语义化版本控制就会失效。本文介绍如何对 AI 智能体进行版本管理,以避免下游消费者遭受静默破坏。

ai-engineering
agents
api-design
testing
+1
·tian

杀死你的 AI 系统的三种隐藏债务

提示词债务、评估债务和嵌入债务是每个 AI 系统中悄然积累的三大隐性负债。本文将探讨它们如何相互作用,以及如何在不进行全面重写的情况下解决每种债务。

ai-engineering
llmops
technical-debt
mlops
+1
·tian

Prompt 金丝雀部署:像资深 SRE 一样发布 Prompt 变更

Prompt 修改与代码部署一样危险 —— 但几乎没有人以这种方式对待它们。本文介绍了流量切分、质量监控和回滚纪律,这些实践将那些能在用户发现之前捕获性能退化的团队,与那些通过 Twitter 才知道出问题的团队区分开来。

llmops
prompt-engineering
deployment
reliability
·tian

为什么渐进式发布对 AI 功能不起作用(以及该怎么做)

特征标志和金丝雀部署假设代码是确定性的。AI 功能是随机的,质量会悄无声息地下降,而且没有实时的标准答案。这里介绍了安全部署 AI 所需的心智模型转变。

ai-engineering
deployment
feature-flags
llmops
+1
·tian

多变量回归问题:当所有因素同时改变时,如何隔离 AI 故障

当你的 AI 功能出现回归,且模型版本、提示词、检索语料库以及工具架构都在同一个周五发生了变化时,归因几乎变得不可能。本文将介绍能够防止最坏结果的受控实验规范和影子评估模式。

ai-engineering
debugging
production-ai
llmops
·tian

AI 回滚仪式:当损害是行为性而非二元性时的事故后恢复

LLM 系统中的行为回归不会导致测试失败或触发警报。本文将介绍如何检测、诊断并从这种看似成功的故障模式中恢复。

llmops
observability
reliability
incident-response
·tian

零停机 AI 部署:这是一个分布式系统问题

大多数团队将 Prompt 更新视为配置更改。事实并非如此 —— 它们是具有四个独立迁移面的生产部署。这里有一个分布式系统框架,可以在模型升级、Prompt 迭代和工具 Schema 更改期间保持 AI 系统的可靠性。

deployment
ai-engineering
llmops
distributed-systems
·tian

生产环境 AI 故障响应:当你的智能体在凌晨 3 点出错时

AI 故障与常规软件故障并不相同 —— 没有堆栈跟踪,没有 500 错误,只有看似笃定的错误答案和失控的循环。这是一份关于生产环境 LLM 系统检测、分类、遏制和复盘的实用指南。

agent-reliability
llmops
production-ai
observability
·tian

提示词所有权问题:当所有团队都将提示词视为配置时会发生什么

一起耗资 34 万美元的生产事故揭示了当提示词缺乏所有者、没有版本历史且没有审核门禁时会发生什么 —— 以及如何通过轻量级治理模型来防止此类事件。

prompt-management
llmops
ai-governance
production-ai
显示第 85–95 篇,共 95 篇
上一页8 / 8