跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

当测试集泄露到微调中:你自己造成的污染

基准测试污染通常归咎于模型厂商,但最严重的泄露往往是你自己的团队造成的 —— 故障分流、合成数据以及共享的 RAG 语料库,这些因素正悄无声息地将评估案例转移到训练中。

insider
evaluation
fine-tuning
data-contamination
+2
·tian

那个记得你撤回了什么的智能体:将删除作为一等公民的记忆操作

只增(append-only)的智能体记忆存储在存储的事实失效的那一刻就开始腐烂。为什么删除、撤回和失效必须是一等公民操作 —— 以及如何设计可被查找、反驳和移除的记忆写入。

insider
ai-agents
memory
llm
+1
·tian

你的工具描述是模型遵循的指令通道

工具描述是模型视为权威指令的散文,但代码审查和输入清理从未检查过它们。本文将探讨被投毒的元数据和地毯式攻击是如何渗透进来的,以及弥合这一差距的规范。

insider
ai-engineering
security
mcp
+2
·tian

你在没告诉智能体的情况下修改了工具 Schema

重命名一个字段对你的后端来说只是常规的 API 变更,但对于调用该工具的 LLM 而言,这却是一个无声的破坏性变更。本文探讨如何将工具 Schema 视为拥有两个消费者的版本化契约。

insider
ai-agents
function-calling
api-design
+1
·tian

原本运行良好的工具,直到两个智能体同时调用它

智能体工具通过了单调用者测试,但在第二个智能体出现的那天崩溃了。本文将探讨为什么并发漏洞在结构上对串行评估是不可见的,以及幂等性、锁定和负载测试如何修复这些问题。

insider
ai-agents
concurrency
idempotency
+2
·tian

停止并非一种状态:为什么智能体需要类型化的终端原因协议

智能体仪表板通常会报告完成率,但一个因为放弃而停止的运行在表面上与成功的运行看起来完全一样。类型化的终端原因协议让智能体的结束方式成为一个一等的、可监控的信号。

insider
ai-agents
observability
reliability
+1
·tian

你的智能体假设存在的“撤销”按钮

AI 智能体在规划时往往假设每个动作都是可以撤销的,这是在可逆的代码沙盒中养成的习惯。通过在工具中编码可逆性分级,确保“单向门”决策的安全性。

insider
ai-agents
llm
system-design
+1
·tian

你的向量索引是一个没有失效策略的缓存

向量索引是你源数据的派生副本,这使得它成为了一个会过时的缓存:修改内容永不自动同步、已删除的文档留下“残影”、被撤销的权限导致泄露。为什么 RAG 的可靠性是一个缓存失效问题,而不是相似度搜索问题。

insider
rag
vector-database
ai-engineering
+1
·tian

向量索引存在一个没人定义的陈旧度 SLO

每晚进行的重新索引任务是一个没人写下来的新鲜度承诺。本文介绍如何将向量索引延迟转化为可衡量的 SLO,向智能体和用户展示数据账龄,并根据衰减率而非习惯进行重新索引。

insider
rag
ai-agents
reliability
+2
·tian

温池与冷真相:Serverless LLM 推理中隐藏的延迟底线

将 GPU 推理缩容至零会将稳定的资金成本转化为隐藏在 p99 尾部延迟中的尖峰延迟成本。本文将为你介绍盈亏平衡计算方法和缓解工具集。

insider
llm
inference
serverless
+2
·tian

当升级请求无人响应时:人机回环是一个人员配置问题

人机回环(Human-in-the-loop)的前提是有人响应升级请求。在生产环境中,这是一个包含到达率、服务时间和放弃率的队列——而无人响应的升级请求比没有升级请求更糟糕。

insider
ai-agents
human-in-the-loop
reliability
+1
·tian

当 Agent 出错时谁会被呼叫:针对非确定性系统的轮值制度

Agent 的故障难以复现、无法回滚,且在所有的基础设施仪表板上都显示正常。本文将教你如何针对无法单步调试的系统,重写运行手册、警报规则和轮值预期。

insider
ai-agents
observability
sre
+2
显示第 253–264 篇,共 990 篇