跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

提示词 Diff 隐藏了自身的爆炸半径

一个三个单词的提示词修改和一段三个段落的重写在文本 Diff 中看起来并无二致,但其行为后果却大相径庭。为什么提示词审查需要评估增量,而不是字符计数。

insider
prompt-engineering
llm
code-review
+2
·tian

重提率:你的评估流水线从未提取出的失败信号

在会话中重复同一个问题的用户是在告诉你之前的回答失败了——但回合级评估和会话结束时的 CSAT 都会忽略这一点。本文将介绍如何将重提率作为核心指标进行检测。

insider
llm-evaluation
conversational-ai
metrics
+1
·tian

Shadow Replay 会惩罚那些本可以改变对话走向的模型

Shadow Replay 评估会悄悄地惩罚更好的模型,因为它根据旧模型引导下的用户对话记录来给新模型评分。本文将探讨其中的原因,以及影子回放仍然可以真实衡量哪些指标。

insider
llm-evals
offline-evaluation
shadow-testing
+2
·tian

那个把上周 Slack 消息当成昨天消息来读的智能体

一个智能体检索到一条 6 周前写的“我们明天发布”的消息,并将其视为当前的计划。检索流水线保留了正文,却弄丢了时钟。

insider
rag
agents
retrieval
+1
·tian

演示成功是因为有人在看:会话长度是你的评测套件遗漏的那个维度

五轮的演示掩盖了在第二十八轮才会出现的误差累积、注意力漂移和承诺粘性。把会话长度当作一等评测维度来对待,否则你交付的可靠性数字,用户其实已经见过它的另一个版本。

insider
ai-engineering
llm-evals
agent-reliability
+1
·tian

语义过时的 Embedding:当向量不再理解当下

随着现实世界的词汇演变,嵌入式知识库正在悄然失效。召回率仪表板往往会忽略这一点,因为它们仍基于过时的相似性定义进行评分。

insider
rag
embeddings
retrieval
+2
·tian

填充式工具调用:当智能体在表演勤奋而不是真正干活

生产环境中的智能体不断发出对答案毫无影响的工具调用——烧掉 token、拖慢延迟、损害准确率。本文讲清楚填充式调用是如何从训练中长出来的、它真正的成本是多少,以及如何用反事实测量和调用预算把它从工作流里剔除出去。

insider
ai-agents
llm
tool-calling
+2
·tian

聚合指标隐藏的首次用户断崖

AI 功能的聚合指标往往看起来健康,但新用户却在一两次尝试后就流失。本文剖析首次用户断崖如何隐藏在你的指标中,以及消除它的几种模式。

insider
ai-product
retention
onboarding
+1
·tian

你的智能体没读过的那条休假自动回复

大多数智能体堆栈按姓名而不是按角色呼叫真人 —— 一旦有人休 PTO,智能体就会和自动回复对打,直到值班同事注意到。

insider
ai-agents
escalation
on-call
+2
·tian

你删除的代码对你的编程 Agent 是不可见的

编程 Agent 会重新引入你昨天删除的代码,因为已删除的内容在仓库中没有留痕。这是一份记录 Agent 需要遵守的“否定决策”的实战指南。

insider
coding-agents
ai-engineering
developer-experience
+1
·tian

那个悄然演变成延迟敏感型服务的夜间批处理作业

随着一个又一个合理需求的加入,一个夜间批处理作业最终演变成了对延迟要求极高的服务。本文将探讨为什么批量推理和在线推理的优化目标截然相反,架构漂移如何导致隐蔽的故障,以及如何有针对性地进行重新架构。

insider
ai-engineering
system-design
mlops
+2
·tian

你的智能体没有营业时间的概念

AI 智能体在做出决定后会立即行动,完全不考虑凌晨 3 点是否是不合适的发送时间。本文探讨如何将全天候工作与日间工作区分开来,并构建一个能够识别等待时机的定时层。

insider
ai-agents
agent-design
reliability
+1
显示第 217–228 篇,共 990 篇