·tian
验证器陷阱:事后防御如何从内部腐蚀你的提示词
你给 LLM 增加的每一个输出验证器听起来都像是一个修复方案。随着时间的推移,这些修复会将你的提示词重写为一份防御性合同,从而剥夺模型的推理能力。本文将介绍如何审计并修复这种损害。
insider
llm
prompt-engineering
ai-engineering
+2·tian
对齐税:当安全功能让你的 AI 产品变得更糟
安全护栏和过于保守的拒绝会在完全无害的查询上降低用户满意度。这里介绍如何衡量误报率,并根据实际部署场景校准阈值。
safety
guardrails
production
llm
+1·tian
对齐税:衡量交付安全 AI 的真实成本
你在生产级 AI 系统中添加的每一层安全措施,都会在延迟、Token 和用户摩擦方面产生可衡量的成本。本文将介绍如何量化这些成本并做出有原则的权衡。
ai-safety
llm
production-ai
observability
+1·tian
设计不拖垮延迟的 AI 安全层
串行安全检查会在响应到达用户之前叠加出数百毫秒的开销。本文介绍如何设计既能维持安全态势、又不破坏用户体验的护栏架构。
insider
guardrails
llm
production
+2·tian
AI 辅助故障响应:为你的值班 Agent 提供运维手册
尽管 AI 投资创下纪录,但由于团队在部署 Agent 时缺乏运维手册或防护栅栏,运维负担反而有所增加。通过采用三层自治模型 —— 咨询型、审批型、条件型 —— 结合结构化运维手册和爆炸半径检查,可以将 AI Agent 转化为可靠的值班伙伴。
incident-response
sre
ai-agents
runbooks
+1·tian
生产环境中的 LLM 防护栏:为什么单层防护永远不够
5 个准确率为 90% 的防护栏仅能为你提供 59% 的系统正确率。这是一份关于分层防护栏架构的实用指南——涵盖输入和输出验证、工具选择、延迟权衡,以及为什么复合错误率是隐藏的失败模式。
llm
guardrails
ai-safety
production
+1·tian
生产环境中的 LLM 护栏:哪些方法真正奏效
一份关于 LLM 护栏的实用工程指南:涵盖分层输入/输出验证、误报累积的原因、串行与并行执行的权衡,以及如何在生产环境中监控重要指标。
llm
guardrails
production
safety
+1显示第 13–19 篇,共 19 篇
上一页2 / 2