跳转到主要内容

19 含有标签「guardrails」

Posts tagged "guardrails" on TianPan.co.

查看所有标签

·tian

没人阅读的审批提示

千篇一律的确认弹窗会训练用户不加阅读就点击『批准』——这与摧毁浏览器警告、医院警报和 SOC 告警的习惯化机制如出一辙。本文讲解如何对智能体操作做风险分级,并设计出人类真正会停下来看的中断提示。

ai-agents
human-in-the-loop
security
ux
+1
·tian

护栏税:当安全分类器让你的延迟和账单翻倍时

外挂式安全分类器堆叠在关键路径中,使延迟增加三倍并推高了你的推理账单。本文介绍如何根据爆炸半径调整护栏规模,并采用并发而非串行的方式运行它们。

llm
ai-safety
guardrails
latency
+1
·tian

真正的后端是电子表格 —— 而你的智能体刚刚获得了写入权限

Excel 和 Google Sheets 承载了大多数公司的业务运营逻辑 —— 无类型、未测试、且缺乏审查 —— 而 AI 智能体现在正以机器速度向其中写入数据。通过保护区域、命名区域、公式差异对比以及迁移式写入,可以防止因公式被误覆盖而导致的业务决策失误。

insider
ai-agents
spreadsheets
data-integrity
+1
·tian

护栏也是模型:那个没人放进仪表盘的隐藏依赖

置于 LLM 之前的审核分类器是关键路径上的第二个模型 —— 它同样存在延迟尾部、模型漂移和停机风险。本文将探讨如何规划其延迟预算,有意识地选择故障开启或故障关闭策略,并像监控核心模型一样监控这道关卡。

ai-engineering
llm
reliability
guardrails
+1
·tian

法律免责声明如何从答案泄露到工具调用参数中

添加到你的系统提示词中的安全免责声明并不仅仅停留在面向用户的回复中。它还会渗透进模型生成的每一个工具调用参数里 —— 并进入这些调用所触发的下游系统中。

llm-agents
prompt-engineering
compliance
tool-calling
+1
·tian

那个在行动已发出后才生效的预算上限

当紧急停机开关正确触发,但智能体已经订好了机票、发送了邮件并关闭了工单时——为什么以 Token 衡量的预算上限忽略了以“行动”衡量的损失,以及如何将支出与不可逆性解耦。

insider
ai-agents
guardrails
observability
+2
·tian

流式回滚问题:你无法收回已发送的 Token

流式输出在任何护栏检查之前就已触达用户。本文将探讨为什么输出审核与 Token 流式传输在结构上存在冲突,以及如何通过缩短暴露窗口来应对这一问题,而非对其视而不见。

insider
llm
guardrails
streaming
+2
·tian

你的拒绝日志其实是伪装的产品需求清单

AI 拒绝的请求是你拥有的最真实的用户研究数据。本文将教你如何像对待产品需求清单一样去解读这些日志,而不是将其视为安全监视名单。

ai-engineering
product
llm
guardrails
·tian

LLM 系统中的软约束与硬约束:为什么失配会导致真正的失败

将系统提示词(System Prompt)视为安全控制是一种会导致泄露的架构错误。本文将详细解析生产环境 LLM 系统中的约束层级,以及如何将执行强度与实际风险相匹配。

insider
llm
security
production
+2
·tian

拒绝延迟税:为什么分层护栏会侵蚀你的 p95 延迟预算

分层安全流水线在长尾效应下会悄然使 p95 延迟和成本增加三倍。应将护栏视为一种受预算限制的资源,通过分层分类器、并行检查和诚实的延迟契约来进行管理。

llm-safety
guardrails
latency
observability
+1
·tian

护栏系统的自研与外购:内容审查 API 已成为安全关键路径上的核心依赖

托管的内容审查 API 将你的安全控制转变为一个同步的外部依赖 —— 本文将探讨自研与外购的决策、故障开启 (fail-open) 与故障关闭 (fail-closed) 之间的权衡,以及如何通过集成规范确保处于安全关键路径上的供应商不会绑架你的事件响应流程。

llm
guardrails
ai-safety
architecture
+1
·tian

AI 工程师的三种品味:为什么 Prompt、Eval 和 Guardrail 往往无法共存于一个大脑中

Prompt 品味、Eval 品味和 Guardrail 品味是 AI 工程师这一职位头衔下隐藏的三种截然不同的直觉。如果你将它们视为同一种技能来进行招聘和晋升,你将交付一个失衡的系统——即便所有的指标都显示正常(全绿),用户却在流失。

hiring
ai-engineering
evals
guardrails
+1
显示第 1–12 篇,共 19 篇
1 / 2下一页