跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

复合 AI 系统中的流水线归因:在薄弱环节找到你之前先找到它

当检索、重排、生成和验证组合成一条 AI 流水线时,输出质量下降几乎不可能归咎于任何单个组件。以下是真正有效的归因方法论。

ai-engineering
compound-ai
rag
debugging
+1
·tian

生产分布差距:为什么内部测试人员找不到用户遇到的Bug

为什么 AI 系统通过了内部测试却在生产中崩溃——开发/预发布环境工作负载与真实用户流量之间的系统性错配,以及能够弥合这一差距的监控模式。

insider
ai-engineering
testing
mlops
+2
·tian

零样本、少样本还是思维链:生产环境下的决策框架

大多数团队根据习惯选择提示词策略。本文提供了一套基于证据的标准——包括任务复杂度、模型规模、Token 预算和输出结构——用于预测哪种方法在你的特定任务中表现最佳。

llm
prompting
ai-engineering
production-ai
·tian

测试检索-生成接缝:RAG 系统中的集成测试盲区

检索器和生成器的单元测试都能通过,但你的 RAG 系统却在悄悄失效。本文讲解如何测试两者之间的接缝,以及故障发生时如何定位责任归属。

insider
rag
testing
llm
+2
·tian

推理模型经济学:思维链何时物有所值

深度思考模型的单次查询成本高出 10–50 倍。本文提供了一套任务分类法,告诉你何时这笔溢价是值得的,以及如何构建自动应用该策略的路由架构。

insider
llm
ai-engineering
cost-optimization
+1
·tian

从影子模式到自动驾驶:AI功能自主性的准备框架

将AI从影子模式逐步推进到咨询、副驾驶和自动驾驶阶段,需要明确的质量门控和监控机制,而不仅仅是组织层面的勇气。这里是工程框架。

insider
ai-engineering
mlops
production-ai
+1
·tian

六个月悬崖:为什么生产环境中的 AI 系统会在没有一行代码改动的情况下发生退化

你的 AI 功能在发布时表现优异,通过了所有测试。但六个月后,它在悄无声息中退化了 20–40% —— 而你的仪表盘却从未发出警告。本文将探讨这种情况发生的原因以及如何阻止它。

llm
production
monitoring
mlops
+1
·tian

当你的模型偶尔出错时,99.9% 的可用性意味着什么

传统的 SLA 对于成功与否具有概率性的 AI 功能而言毫无意义。本文将介绍合同用语和内部 SLO 设计,让工程团队在不承担无限责任的情况下发布 AI 功能。

insider
ai-engineering
reliability
sla
+1
·tian

生产AI中的子群体公平性测试:为何聚合准确率会撒谎

聚合准确率掩盖了特定人口统计和语言子群体的系统性失败。本文介绍子群体评估方法论、差异SLO以及在用户规模化之前捕获偏见的生产监控模式。

ai-engineering
evaluation
fairness
production-ai
+1
·tian

合成评估冷启动:在没有标注数据的情况下如何构建基准数据集

如何在零标注数据的情况下,利用合成测试生成、人工验证锚点、跨模型分歧和行为不变量构建可用的LLM评估流水线——以及合成评估与被测模型共享的失效模式。

evaluation
llm
testing
evals
+1
·tian

系统提示词蔓延:当你的 AI 指令变成 Bug 的源头

随着系统提示词从几百个 token 增长到几千个,内部矛盾不断积累,模型行为变得难以预测。本文将介绍如何在产生损失之前,检测、控制并重构你的提示词。

insider
prompt-engineering
llm
ai-engineering
+1
·tian

多智能体系统中的温度治理:为什么方差是一类预算

以相同的温度运行你的所有智能体组件,就像给它们设置相同的超时时间一样错误。本指南将介绍如何设计基于角色的采样策略,使输出方差与每个流水线阶段的实际需求相匹配。

insider
ai-engineering
multi-agent
llm
+2
显示第 529–540 篇,共 834 篇