跳转到主要内容

8 含有标签「llm-safety」

Posts tagged "llm-safety" on TianPan.co.

查看所有标签

·tian

擦除模型原生对齐的微调过程

有监督微调(SFT)会悄然削弱基础模型自带的拒绝训练。本文将探讨为什么仅针对任务的评估会忽略这一点,并介绍在客户发现之前捕捉这种退化的四种实践方法。

fine-tuning
alignment
llm-safety
mlops
+1
·tian

通过了 Schema 验证的虚假工具参数

JSON Schema 只能验证结构,而不能验证事实。当 Agent 虚构出能通过 Schema 检查的引用参数时,重试循环会将这个 Bug 掩盖在看似正常的审计追踪中 —— 本文将介绍缺失的校验层。

ai-agents
tool-calling
llm-safety
json-schema
+1
·tian

你那两个独立的评估指标正不断破坏拒绝校准

将拒绝逻辑拆分为安全性评估和帮助性评估,注定会导致每次模型升级时两者此消彼长。解决方案是针对每个案例采用统一的“正确操作”指标进行评分。

insider
evals
llm-safety
refusal-calibration
+2
·tian

好奇的顾客:如何为把 AI 智能体当作解谜游戏的用户进行设计

在合作用户和恶意攻击者之间存在着第三类人群:把你的 AI 智能体当作解谜游戏的好奇顾客。本文将介绍如何构建评估、拒绝机制和回退方案,使你的品牌在这些关键时刻经受住考验。

insider
ai-agents
product-design
evals
+1
·tian

拒绝审计:为什么单一拒绝率掩盖了一半的失败分布

拒绝率是一个双边分布,但大多数安全仪表盘只绘制了其中一侧。本文介绍了应如何部署监控、如何采样,以及谁应该负责校准。

llm-safety
evals
observability
ai-engineering
·tian

拒绝延迟税:为什么分层护栏会侵蚀你的 p95 延迟预算

分层安全流水线在长尾效应下会悄然使 p95 延迟和成本增加三倍。应将护栏视为一种受预算限制的资源,通过分层分类器、并行检查和诚实的延迟契约来进行管理。

llm-safety
guardrails
latency
observability
+1
·tian

对抗性智能体监控:构建无法被规避的监管机制

单层 LLM-as-judge 监控在面对复杂智能体时,失效概率超过 52%。本文介绍了在生产环境中行之有效的四层防御栈:行为指纹识别、动作审计、多监控器共识以及工具层约束。

insider
ai-agents
security
observability
+1
·tian

智能体内存投毒:跨会话持久存在的攻击手段

内存投毒允许攻击者在智能体的长期内存中植入指令,这些指令能跨会话存在并在数周后执行——在测试系统中注入成功率高达 95%。本文将介绍如何通过内存分区、来源追踪、时间衰减和行为漂移检测来进行防御。

agent-security
memory-poisoning
llm-safety
multi-agent