跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

Agent 分支覆盖率:你的评测仅命中了 Happy Path,而非 Planner 的 If-Else 逻辑

Agent Prompt 中隐藏了评测套件从未执行过的 If-Else 分支。借鉴 MC/DC 的严谨性,通过分支 ID 监测 Planner 的决策,并基于覆盖率对 Prompt Diff 进行拦截,防止隐性的路由错误流入生产环境。

insider
ai-agents
evaluation
testing
+1
·tian

智能体内存驱逐:为什么 LRU 在模型升级中屹立不倒,而显著性评分却不行

基于显著性权重的内存驱逐在上线首日看起来像是提升了质量,但每次模型升级都会演变成一场迁移工程 —— 本文将探讨为什么 LRU 这种“无聊”的选择才是最终的赢家。

insider
agents
memory
llm-ops
+1
·tian

智能体临时目录:无人盘点的无主文件系统 PII 暴露面

智能体工作线程在无人分类的磁盘上累积了临时文件系统状态——提取的 PDF、转录的音频、缓存的附件。解决方案在于为这一层级命名,而非追求架构上的复杂性。

insider
ai-agents
security
data-classification
+2
·tian

团队间的 Token 预算之战:当你的 AI 平台团队变成“财政部”

有限的供应商配额加上三个面临上线期限的产品团队,就构成了一个预算分配系统。负责运行你 LLM 网关的团队往往被要求进行配额分配——通常是在没有政策支持、没有发起人、甚至没有遥测数据来支撑决策的情况下。

insider
ai-platform
finops
llm-gateway
+1
·tian

难度浓缩器:AI 客服分流正在让留下的员工精疲力竭

分流率衡量的是避开的难度,而非消除的难度。当 AI 处理了 80% 的简单工单时,人工队列中剩下的就全是 100% 的极端情况 —— 在数据仪表盘察觉之前,团队早已感受到了这种压力。

insider
ai-engineering
customer-support
operations
+2
·tian

浏览器 Agent 会话泄漏:当单个 Profile 服务于多个租户时

为了规避冷启动成本,长期运行的浏览器 Agent 往往会复用 Profile,但这可能导致一个租户的会话被错误地提供给另一个租户的请求。追踪记录显示成功 —— 而另一个用户的仪表板内容正被读取。

insider
ai-engineering
security
agents
+2
·tian

评估天花板:当你的黄金测试用例失去区分度时

一旦每个候选模型在相同的测试用例上都获得了 95+ 的分数,你的评估套件就不再具备任何衡量价值 —— 是尺子不再适用,而不是被测平台的问题。

insider
ai-engineering
evaluation
llm
+2
·tian

评估数据集是附带正确答案的客户数据

黄金评估集是与标记的正确答案配对的真实客户查询 —— 但大多数团队将其视为工程辅助工具,绕过了为底层生产数据构建的每一项隐私控制。

insider
llm-eval
ai-privacy
gdpr
+2
·tian

评估选择偏差:为什么你的测试集会对那些导致用户流失的失败视而不见

从生产链路中更新的评估集继承了幸存者偏差:遭遇最严重失败的用户已经离开,并停止生成链路。分数在攀升,而留存率在下降。以下是如何打破这一循环的方法。

insider
evals
llm
agents
+2
·tian

流式推理中的海勒姆定律:节奏、停顿和中间 Token 是未成文的契约

当更换模型虽然保留了结构化输出 schema,但改变了 Token 节奏、停顿模式和中间表述时,你实际上发布了一个破坏性变更,违反了一个你从未正式定义的契约。

insider
ai-engineering
llm
streaming
+2
·tian

MCP 冷启动税:工具服务器开销如何在智能体第 7 步发生累加

为什么 200 毫秒的 MCP 工具调用会演变成 4 秒的智能体循环,冷启动税究竟存在于何处,以及如何通过预热池规范将数秒的惩罚降低到 100 毫秒以下。

insider
mcp
agents
latency
+2
·tian

多模态通道冲突:当模型在视觉与文本之间自我矛盾时

多模态模型会静默地将冲突的视觉和文本通道融合为自信的混合答案。本文探讨这种失效发生的场景、评估指标为何会漏掉它,以及如何构建一个冲突检测原语。

insider
multimodal
vision-language-models
evaluation
+2
显示第 313–324 篇,共 990 篇