跳转到主要内容

136 含有标签「mlops」

Posts tagged "mlops" on TianPan.co.

查看所有标签

·tian

从影子模式到自动驾驶:AI功能自主性的准备框架

将AI从影子模式逐步推进到咨询、副驾驶和自动驾驶阶段,需要明确的质量门控和监控机制,而不仅仅是组织层面的勇气。这里是工程框架。

insider
ai-engineering
mlops
production-ai
+1
·tian

六个月悬崖:为什么生产环境中的 AI 系统会在没有一行代码改动的情况下发生退化

你的 AI 功能在发布时表现优异,通过了所有测试。但六个月后,它在悄无声息中退化了 20–40% —— 而你的仪表盘却从未发出警告。本文将探讨这种情况发生的原因以及如何阻止它。

llm
production
monitoring
mlops
+1
·tian

生产AI中的子群体公平性测试:为何聚合准确率会撒谎

聚合准确率掩盖了特定人口统计和语言子群体的系统性失败。本文介绍子群体评估方法论、差异SLO以及在用户规模化之前捕获偏见的生产监控模式。

ai-engineering
evaluation
fairness
production-ai
+1
·tian

AI功能维护悬崖:为何你的AI功能老化速度超乎想象

AI功能不只是退化——它们是无声地退化。提示词漂移、模型更新和分布偏移共同侵蚀生产环境中的AI质量,而监控面板全程保持绿色。

llm
production
observability
mlops
·tian

AI 功能下线指南:如何停用那些用户几乎不用的功能

大多数工程团队都知道如何发布 AI 功能,但几乎没有人有下线它们的计划。本文将为你提供一份指南,告诉你何时该放弃,以及如何在不伤害用户或积累合规债务的情况下完成下线。

ai
product
engineering
mlops
·tian

AI 技术债的三座无声时钟

与代码债务不同,AI 特有的技术债——提示词漂移、评估侵蚀和嵌入陈旧——会以隐蔽的方式累积。本文将介绍如何在这些时钟耗尽之前检测它们。

ai-engineering
llmops
technical-debt
production-ai
+1
·tian

标注经济学:每种标签来源背后隐藏的代价

在评测标签来源的选择上——人类领域专家、众包工人、LLM 合成生成和行为推断——的决策框架,以及何时「无标注」才是正确答案。

insider
evaluation
annotation
llm
+1
·tian

你从未闭合的反馈回路:将用户行为转化为 AI 真值

显式的点赞评分可能是表象。编辑率、重试模式和会话中断能更真实地反映 AI 的质量 —— 而且你可以在没有标注预算的情况下,将它们转化为评估数据集。

insider
ai-engineering
evaluation
observability
+1
·tian

AI 模型的持续部署:你的回滚信号是错误的

HTTP 错误率无法检测 LLM 升级中的行为退化。本文将介绍如何以行为差异作为真正的回滚信号,进行蓝绿部署和金丝雀部署。

ai-engineering
mlops
deployment
llm
+1
·tian

AI 功能退役指南:如何在不破坏用户体验的情况下下线智能体

关闭 AI 功能与废弃确定性 API 有本质的不同。这份工程指南涵盖了映射行为依赖、分阶段下线以及避免支持工单雪崩的方法论。

insider
ai-engineering
mlops
agentic-systems
+1
·tian

嵌入偏移:正在杀死你长期运行的 RAG 系统的沉默退化

混合嵌入模型、分块策略变化以及预处理不一致是如何在无声中降低 RAG 检索质量的 —— 以及你该如何应对。

insider
rag
embeddings
vector-database
+2
·tian

评估集衰退:为什么你的基准在构建六个月后会变得具有误导性

静态评估集是用户行为的冻结快照。随着真实流量的演变,你的基准会偏离生产现实——本文介绍如何衡量衰退并保持评估的诚实性。

insider
evaluation
llm
production
+2
显示第 85–96 篇,共 136 篇