跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

评估自动化陷阱:当你的流水线偏离用户真实需求时

自动化评估流水线在显示准确率持续提升的同时,用户满意度却在悄然下滑。本文将揭示漂移的发生机制,以及如何在问题扩散到生产环境之前及时发现它。

insider
ai-engineering
evaluation
llm
+1
·tian

评估迁移税:为什么 Prompt Schema 的一次变更会毁掉 800 个测试用例

AI Prompt 的 Schema 变更经常会破坏数百个与该变更无关的测试用例。大多数团队将评估套件视为静态固定装置,而不是版本化数据——并在每次发布时支付一笔隐形成本。

ai-engineering
evaluation
llm
testing
+1
·tian

回退级联:为什么你的 AI 功能需要五种故障模式,而非一种

将模型故障视为二元成功/失败事件的 AI 功能距离灾难仅一步之遥。从前沿模型到人工介入的五级回退级联(Fallback Cascade),能确保在单个层级发生故障时,你的功能依然可用。

insider
ai-engineering
reliability
production
+1
·tian

上线 AI 功能后的头 100 个工单

每个 AI 功能上线都会产生的为期八周的运维工单序列——成本激增、评估偏移、长尾延迟、供应商静默更新——以及预置了应对方案的上线指南。

insider
ai-engineering
llm-ops
incident-response
+2
·tian

人工审核队列是你的 P0 SLA:当 HITL 成为瓶颈时

三个月前你为了安全性而设置的人机回环(HITL)升级路径,现在正成为你 AI 功能的无形瓶颈。本文将探讨如何将其视作一个拥有独立 SLO、容量模型和反馈循环的生产系统来对待——在客户向你投诉之前,先发制人。

ai-engineering
hitl
sre
ai-ops
+1
·tian

LLM 作为验证器的反模式:为什么你的 AI 质量门禁存在盲点

使用 LLM 作为主要的质量门禁来评估 LLM 输出会创建一个循环验证回路,导致对系统性模型失效产生盲点。本文将探讨应采用的替代方案。

insider
ai-engineering
llm
evaluation
+1
·tian

你遗漏订阅的模型提供商 Webhook 通知

主要的 LLM 提供商通过 Webhook 和电子邮件广播故障、模型弃用和账户警告,而大多数团队都关闭了这些渠道。本文将介绍一个小巧的集成方案,帮助你把“从客户那里发现问题”转变为“在自有监控系统报警前就通过提供商获知信息”。

ai-engineering
llm-ops
observability
incident-response
+1
·tian

智能体管道中的并行陷阱:扇出为何让延迟更糟

拆分出并行子智能体看起来是显而易见的提速方案,但隐藏的协调开销——上下文合并、去重、错误聚合——会让 p99 延迟变得更糟,即便 p50 有所改善。

ai-engineering
agents
performance
latency
·tian

单用户 AI 配额:成本看板无法察觉的 UX 层

工程团队通常在完成总支出和每租户成本的监测后就此止步。但如果某个用户在周二下午 3 点触碰了配额上限,并收到一条令人费解的 429 错误代码,他们将再也不会信任这项功能。

ai-engineering
product
cost
ux
+1
·tian

AI 功能的 PRD:为什么你的旧模板会让你在悬崖边失足

确定性的 PRD 缺乏对模型错误、发布评估门槛或系统提示词所有权的定义。这四个章节将为你解决这些问题。

insider
ai-engineering
product-management
llm
+2
·tian

扼杀 AI 流水线吞吐量的预处理瓶颈

大多数团队只对 LLM 调用做性能分析就宣告完成。真正的吞吐量杀手是模型看到第一个 token 之前的所有操作——解析、分块、嵌入和富化,它们悄无声息地主导着端到端延迟。

ai-engineering
rag
performance
mlops
·tian

没上线新功能的 AI 工程师该如何写晋升材料

那些工作重点在于“预防”的 AI 工程师——比如捕捉到的评估回退、未产生的成本、从未发生的事故——该如何编写一份能让校准委员会给出高分的晋升材料。

ai-engineering
career
promotion
eval
+1
显示第 361–372 篇,共 834 篇