·tian
你模型的置信度分数只是一种感觉,而非概率
LLM 自我报告的置信度并非概率 —— 它只是受 RLHF 激励机制影响而产生的流畅 Token。本文将探讨为什么校准是你从未衡量过的特性,以及你应该转而使用什么进行门控。
insider
llm
calibration
ai-reliability
+2·tian
拒绝“大声失败”的 Agent:过度补偿的回退机制如何掩盖生产环境的质量回退
生产环境中的 Agent 积累了大量的重试、回退和修复逻辑,这些逻辑会悄悄掩盖质量回退,直到流量评估指标发生偏移,而团队却无法追踪根本原因。
ai-reliability
observability
agents
sre
+1·tian
过时的文档,肯定的错误答案:AI 帮助中心里隐藏的失效模式
当 RAG 系统检索到过时的上下文时,幻觉率会飙升 6 倍。如何将文档新鲜度视为一个工程问题——通过 TTL 过滤、时间重排序、过时评分以及在发布后保持 AI 帮助中心准确性的运营模型。
rag
knowledge-base
ai-reliability
documentation
+1·tian
过度纠正陷阱:为什么在 AI 功能公开失败后下架它反而让恢复更慢
当你的 AI 功能公开失败时,下架它或堆砌护栏的本能反应会让恢复延迟数月。以下是为什么冷启动信任修复与软件 Bug 修复的运作方式截然不同——以及应该怎么做。
ai-reliability
incident-response
trust
product-strategy
·tian
LLM 作为编译器模式:分离计划生成与执行
引导 LLM 输出由确定性引擎运行的结构化执行计划——而不是让它逐步行动——能以八分之一的成本提供高出 50% 的准确率。本文将探讨该模式何时值得这些额外开销,以及如何在生产环境中实现它。
agent-architecture
llm-engineering
ai-reliability
production-ai
·tian
你的 AI 功能可靠性受限于无人负责的上游 ETL 流水线
大多数 AI 质量退化实际上是伪装成 AI 问题的上游数据问题。数据契约、血缘关系和结对轮值机制能将隐形的 ETL 接缝转化为一等公民工件。
insider
data-engineering
etl
ai-reliability
+2·tian
语义失败模式:当你的 AI 运行完美却事与愿违时
生产环境中的 AI 系统可能会返回有效且自信的响应,但却完全偏离了用户的真实意图。本文提供了一个实用的框架,通过隐式行为信号、轨迹分析和意图对齐评分,来检测并缩小任务完成度与任务正确性之间的差距。
ai-reliability
production-ai
llm-evaluation
intent-alignment
+1