跳转到主要内容

136 含有标签「mlops」

Posts tagged "mlops" on TianPan.co.

查看所有标签

·tian

你的标注流水线才是 AI 产品的真正瓶颈

团队在反馈采集 UI 上投入大量精力,而下游的标注流水线 —— 架构版本管理、IAA 评分、队列优先级 —— 却无休止地滞后两个迭代。本文将告诉你如何解决这一问题。

insider
mlops
annotation
rlhf
+2
·tian

标注人力工程:你的标注员就是生产基础设施

大多数 ML 团队把标注当作采购问题来对待,实际上这是一个基础设施问题。本文介绍如何用与生产系统同等的严谨度来运营标注工作。

insider
machine-learning
data-engineering
mlops
+1
·tian

AI 驱动端点的 API 设计:为不可预测性建立版本控制

当你升级 API 背后的 AI 模型时,虽然 JSON 架构保持不变,但语气、拒绝行为和推理风格都可能发生变化。本文介绍了快照固定、结构化输出、行为包络和阴影部署等模式,这些模式能够确保 AI 端点对调用者保持稳定。

api-design
llm
versioning
mlops
·tian

赢得自主权:如何让 AI Agent 从受监督过渡到独立运行

一种基于实测性能历史数据逐步扩大 AI Agent 操作范围的框架,包含回滚触发机制和监管机制,以防止过早赋予自主权。

insider
ai-agents
production-ai
reliability
+1
·tian

将评估覆盖率作为生产指标:你的测试套件真的在测试用户实际行为吗?

绿色的评估套件可能与悄然劣化的生产质量并存。本文介绍如何衡量你的评估是否真正代表用户的实际意图——以及当二者不匹配时该怎么做。

llm
evaluation
production
mlops
+1
·tian

为什么你的 AI 模型总是滞后 6 个月:缩短反馈循环

AI 模型会悄无声息地退化,因为从用户端出现问题到模型完成更新之间往往存在数月的鸿沟。本文将介绍如何埋点隐式信号、运行在线评估,并利用快速路径微调将这一周期从季度缩短至几天。

mlops
ai-engineering
llm
fine-tuning
·tian

AI 智能体的集群健康监控:单智能体可观测性在规模化场景下的盲区

从单个智能体扩展到上千个,会暴露出单智能体可观测性工具完全忽视的集群级故障模式:版本异构性、关联服务商级联故障,以及在几分钟内耗尽月度预算的 Token 消耗螺旋。

ai-engineering
observability
agents
mlops
·tian

多区域 LLM 服务:没人警告过你的缓存局部性问题

在不同区域部署 LLM 推理会产生无状态 HTTP 服务所没有的一致性和延迟问题。本文将介绍一种既能解决这些问题,又不会让你的运维负担增加三倍的路由架构。

insider
llm
infrastructure
mlops
+2
·tian

杀死你的 AI 系统的三种隐藏债务

提示词债务、评估债务和嵌入债务是每个 AI 系统中悄然积累的三大隐性负债。本文将探讨它们如何相互作用,以及如何在不进行全面重写的情况下解决每种债务。

ai-engineering
llmops
technical-debt
mlops
+1
·tian

AI 依赖足迹:每个功能都在增加新的基础设施所有者

你上线的每一个 AI 功能都会引入新的基础设施依赖——向量数据库、嵌入模型、评估框架、GPU 推理层。问题不在于依赖本身,而在于没有人真正拥有它们。

ai engineering
infrastructure
platform engineering
mlops
·tian

持续微调而不污染数据:生产流水线指南

一份关于从用户反馈中持续微调大语言模型的生产工程指南——涵盖数据路由架构、污染检测、灾难性遗忘预防以及自动化安全保护。

insider
mlops
fine-tuning
llm
+1
·tian

微调数据集溯源:六个月后你无法回答的审计问题

大多数生产中的微调模型无法可靠回答训练样本的来源问题。这里提供溯源注册表模式和审计工作流,让你在监管机构询问之前就有答案。

insider
fine-tuning
data-governance
compliance
+1
显示第 109–120 篇,共 136 篇