跳转到主要内容
Tian Pan

Tian Pan

Software Engineer

查看所有作者

·tian

演示循环偏见:你的开发流程如何悄然演变为针对“有魅力的失败”进行优化

演示往往会选择流畅、自信的输出,而非正确的输出。本文将探讨 LLM 开发循环如何悄然滑向“有魅力的失败”,以及修复这一问题的评估工作流。

insider
llm-evals
ai-engineering
product
+2
·tian

“完成!”不是返回码:为什么智能体完成需要结构化信号

智能体用自然语言发出完成信号;编排器则需要结构化事件。一个带有状态枚举、原因代码和可恢复句柄的 done 工具,能将静默的智能体失败转变为清晰的模式违规 (schema violations),让你的流水线能够真正进行路由。

ai-agents
orchestration
llmops
agent-design
+1
·tian

持久化智能体:为什么异步队列无法胜任长运行 AI 工作流

多步骤 AI 智能体在生产环境中往往会失败,因为队列采用“至少一次”交付,而 LLM 的规划具有非确定性。解决方案是持久化执行 —— 通过 Saga 模式、幂等检查点以及围绕无状态规划器的有状态底层来构建。

agents
durable-execution
workflow-orchestration
reliability
+1
·tian

Embedding API 的 “隐藏税”:为什么向量支出在不知不觉中超过了生成成本

Embedding API 的支出在规模化过程中会悄然增长,并最终超过生成成本。本文将深入分析主导账单的工作负载、扭转成本曲线的架构杠杆,以及自托管的盈亏平衡计算。

embeddings
cost-optimization
vector-database
rag
+1
·tian

Embedding 模型轮换是数据库迁移,而非代码部署

更换 Embedding 模型并非简单的配置更改——新向量存在于与旧向量不同的流形中,因此这本质上是一次完整的重新 Embedding 加上一次伪装成部署的切换。这是一份包含影子索引、双读一致性指标、分阶段流量切换以及团队经常遗漏预算的运营成本的迁移指南。

insider
rag
embeddings
vector-database
+2
·tian

你的评测框架是单用户运行的,但你的智能体并非如此。

顺序运行的评测框架无法捕获当多个智能体共享基础设施时爆发的漏洞。本文介绍了四种失效模式以及修复它们的架构方案。

ai-agents
evaluation
concurrency
llm-ops
+1
·tian

Eval-Prod 漂移:测试中的智能体并不等同于生产环境中的智能体

为什么你的评估框架所测量的智能体会与用户实际交互的智能体发生隐形偏离 —— 以及如何通过指纹识别、金丝雀测试套件和所有权规范来弥合这一差距。

llm-evaluation
agent-ops
deployment
drift-detection
·tian

你的黄金标签是从你的模型中学到的:通过生产环境泄漏导致的评估集污染

当标签来自生产反馈、查看草稿的人类标注员以及 RLHF 痕迹时,评估集会悄无声息地记住你的模型偏差。本文将探讨防止“镜子”获胜的溯源规范。

insider
evals
llm-ops
ai-evaluation
+2
·tian

“以后再加评估”的陷阱:测量债务如何产生复利效应

跳过评估能让你在一个季度内发布得更快,但接下来的四个季度会变慢。本文探讨了测量债务如何产生复利效应、早期的预警信号,以及防止这种偏移的组织级强制机制。

insider
evals
llm
ai-engineering
+2
·tian

你的微调语料库是 GDPR 数据产物,而不仅仅是机器学习资产

微调后的权重编码了客户的个人身份信息 (PII),这些信息在数据库删除后依然存在。这是一份将训练语料库视为 GDPR 下数据产物的实用指南——涵盖谱系文档、适配器隔离,以及在首个微调模型发布前需要进行的合规对话。

insider
gdpr
fine-tuning
privacy
+2
·tian

首次触达工具损耗:为什么你的智能体在执行任务前要先读 12 个文件

AI 智能体在进行首次编辑前,60–80% 的 Token 预算都损耗在了读取操作上。通过任务类别路由、探索预算上限和“先规划后执行”门控机制可以减少这种浪费。

ai-agents
llm-ops
cost-optimization
agent-architecture
·tian

免费层级滥用经济学:当你的 AI 慷慨被机器人拖垮

为 SaaS 设计的免费层级策略正在悄悄让 AI 产品破产。本文将揭示机器人如何利用你的慷慨牟利,以及如何通过速率限制、工作量证明和指纹识别模式来止血。

insider
ai-economics
free-tier
bot-abuse
+1
显示第 1201–1212 篇,共 2313 篇