·tian
擦除模型原生对齐的微调过程
有监督微调(SFT)会悄然削弱基础模型自带的拒绝训练。本文将探讨为什么仅针对任务的评估会忽略这一点,并介绍在客户发现之前捕捉这种退化的四种实践方法。
fine-tuning
alignment
llm-safety
mlops
+1·tian
通过了 Schema 验证的虚假工具参数
JSON Schema 只能验证结构,而不能验证事实。当 Agent 虚构出能通过 Schema 检查的引用参数时,重试循环会将这个 Bug 掩盖在看似正常的审计追踪中 —— 本文将介绍缺失的校验层。
ai-agents
tool-calling
llm-safety
json-schema
+1·tian
你那两个独立的评估指标正不断破坏拒绝校准
将拒绝逻辑拆分为安全性评估和帮助性评估,注定会导致每次模型升级时两者此消彼长。解决方案是针对每个案例采用统一的“正确操作”指标进行评分。
insider
evals
llm-safety
refusal-calibration
+2·tian
好奇的顾客:如何为把 AI 智能体当作解谜游戏的用户进行设计
在合作用户和恶意攻击者之间存在着第三类人群:把你的 AI 智能体当作解谜游戏的好奇顾客。本文将介绍如何构建评估、拒绝机制和回退方案,使你的品牌在这些关键时刻经受住考验。
insider
ai-agents
product-design
evals
+1·tian
拒绝审计:为什么单一拒绝率掩盖了一半的失败分布
拒绝率是一个双边分布,但大多数安全仪表盘只绘制了其中一侧。本文介绍了应如何部署监控、如何采样,以及谁应该负责校准。
llm-safety
evals
observability
ai-engineering
·tian
拒绝延迟税:为什么分层护栏会侵蚀你的 p95 延迟预算
分层安全流水线在长尾效应下会悄然使 p95 延迟和成本增加三倍。应将护栏视为一种受预算限制的资源,通过分层分类器、并行检查和诚实的延迟契约来进行管理。
llm-safety
guardrails
latency
observability
+1·tian
对抗性智能体监控:构建无法被规避的监管机制
单层 LLM-as-judge 监控在面对复杂智能体时,失效概率超过 52%。本文介绍了在生产环境中行之有效的四层防御栈:行为指纹识别、动作审计、多监控器共识以及工具层约束。
insider
ai-agents
security
observability
+1·tian
智能体内存投毒:跨会话持久存在的攻击手段
内存投毒允许攻击者在智能体的长期内存中植入指令,这些指令能跨会话存在并在数周后执行——在测试系统中注入成功率高达 95%。本文将介绍如何通过内存分区、来源追踪、时间衰减和行为漂移检测来进行防御。
agent-security
memory-poisoning
llm-safety
multi-agent