跳转到主要内容

博客

来自AI智能体经济的洞见、分析与更新。 按标签浏览.

·tian

AI 泛滥反模式:过度使用 LLM 只会让你的流水线更糟

在流水线的每个环节都加 LLM,是让系统变慢、变贵、难以调试的最快方式。这里是一个决策框架,帮你判断 AI 真正有用的场景,以及什么时候查找表才是正确答案。

ai-engineering
llm
production
architecture
+1
·tian

1% 错误率,1000 万用户:规模化 AI 故障的数学逻辑

为什么在离线评估中看起来正常的准确率指标,在生产规模下会变成灾难;如何为考虑尾部行为的 AI 功能设置 SLO;以及当模型已经足够好,但每月仍有数百万次错误时,该如何做出产品决策。

production-ai
reliability
slo
monitoring
+1
·tian

AI 功能下线指南:如何在不破坏用户信任的情况下停止 LLM 功能

面向工程师和产品经理的实用指南,介绍如何干净地停用基于 LLM 的功能 —— 涵盖数据生命周期拆解、行为迁移测试、用户信任动态以及沟通策略。

ai-engineering
llm
mlops
product-engineering
·tian

AI 驱动功能的“完工”定义:工程化永恒的 Beta 测试

AI 驱动的功能永远不会进入一个稳定的“完工”状态——模型漂移、现实漂移和预期漂移创造了持续的迭代压力。本文介绍了工程和治理基础设施,如何让“稳定但不断演进”的状态显得更像是高质量的表现,而非未完成。

ai-engineering
llmops
evaluation
product
·tian

AI 生成代码的维护陷阱:团队在六个月后才发现的真相

采用编程智能体的团队在第一到三个月会看到显著的效率提升。到第十二个月,许多团队发现自己在不理解自身系统的情况下已无法交付功能。这就是失败的规律——以及如何避免它。

insider
ai
technical-debt
code-quality
+2
·tian

AI基础设施碳核算:你的团队尚未衡量的可持续发展成本

AI推理现在占全球排放量的2.5–3.7%,且每年增长15%。本文介绍如何衡量你的团队的贡献,以及为何这将成为合规问题,无论你是否提前规划。

ai-engineering
sustainability
infrastructure
observability
·tian

为生产环境选择向量数据库:基准测试不会告诉你的事

基准测试排行榜衡量的是错误的指标。这里有一套评估框架,能真正预测你的向量数据库是否能在生产环境中经受住考验。

vector-database
production
RAG
embeddings
+1
·tian

AI 轮值:当你的系统在“思考”时,该针对什么发告警

如何为非确定性 AI 系统设计告警,AI 事件与传统故障的区别,以及在凌晨 2 点能真正帮到轮值工程师的 Runbook 结构。

insider
ai-engineering
observability
incident-response
+1
·tian

当每个人都拥有 AI 编程助手:那些无人提醒你的团队动态

当团队中的每位工程师都拥有 AI 编程助手时,个人生产力的提升可能会悄然破坏集体代码所有权,加速知识孤岛的形成,并瓦解代码审查文化 —— 本文将探讨应对策略。

insider
ai
engineering-leadership
code-review
+1
·tian

AI 产品指标陷阱:当参与度看起来像价值却并非如此

团队如何在追踪会话数量和完成率的同时,错过了真正能预测价值的指标——以及为何 AI 功能上线后头 30 天的数据几乎总是具有误导性。

ai-engineering
product-metrics
llm
observability
·tian

SRE 日志分析中的 AI:真正行之有效的分层架构

对流式日志进行实时前沿模型分析在成本和延迟上都是不可行的。本文介绍了一种在生产环境中真正有效的分层方法——通过快速异常检测来触发有选择性的 LLM 调用。

observability
SRE
LLM
monitoring
+1
·tian

AI 接班人计划:当了解提示词的团队离开时会发生什么

当编写你的系统提示词的工程师离职时,每个措辞背后的推理过程也随之而去。以下是如何构建能够应对人员变动的 AI 系统的方法。

insider
ai-engineering
prompt-engineering
knowledge-management
+1
显示第 1501–1512 篇,共 2312 篇