跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

用户习以为常的“你确定吗?”确认步骤

AI 智能体中统一的确认提示会导致习惯化:用户会以处理低风险操作的反射动作来点击高风险操作。具备风险意识的摩擦预算、制品预览和量化的点击响应时间可以重建安全层。

insider
ai-agents
ux
safety
+2
·tian

那些被你的智能体“触发并遗忘”的异步工具调用

函数调用将同步和异步工具视为相同的形式。智能体触发了一个任务,收到了一个 ID,随后标记该步骤已完成 —— 而实际工作却从未落地。

insider
ai-agents
tool-calling
mcp
+2
·tian

在解码中途缩减至零的自动伸缩器:当推理被视作无状态网络流量时

一个成本驱动的缩容策略将一个 30 分钟的长上下文作业视为无状态的 HTTP 请求。Pod 在解码中途被回收,唯一的信号是一个小时后网关日志中的 499 错误。这篇复盘报告将自动伸缩重新定义为一个工作负载形态问题。

insider
inference
autoscaling
kubernetes
+2
·tian

那个在行动已发出后才生效的预算上限

当紧急停机开关正确触发,但智能体已经订好了机票、发送了邮件并关闭了工单时——为什么以 Token 衡量的预算上限忽略了以“行动”衡量的损失,以及如何将支出与不可逆性解耦。

insider
ai-agents
guardrails
observability
+2
·tian

针对你已不再提供服务的模型版本的 Bug 报告

客户针对你上个月已轮换掉的权重提交 Bug 报告的那一刻,你的模型版本控制政策就不再仅仅是内部的 MLOps,而变成了面向客户的可见合约。

insider
ai-engineering
mlops
model-versioning
+1
·tian

那个‘总结’掉用户原始提问的压缩策略

自动总结保留了对话脉络,但悄然改变了下游工具所依赖的字面表述。本文将探讨该 Bug 是如何出现的,以及如何针对它进行架构设计。

insider
agents
context-engineering
llm-ops
+1
·tian

会话摘要抹掉了用户授予你的同意标志

压缩保留了智能体的回答,却遗忘了用户的选择。应将对话记忆视为语义和结构化两个流,否则你交付的将是隐私违规。

insider
ai-engineering
agents
privacy
+2
·tian

那个定价模型假设提示词由人类编写的数据标注商

当 LLM 生成的提示词取代手写提示词时,你在 2023 年签署的按任务计费的标注单价就成了一种无形的利润转移,直到续约周期迫使双方进行一场价格博弈。

insider
data-labeling
vendor-contracts
ai-ops
+2
·tian

让你的 A/B 测试整整一个季度都失效的嵌入模型轮换

为什么供应商端的嵌入模型升级会悄无声息地破坏你对检索功能的 A/B 测试,以及填补这一鸿沟的实验规范。

insider
embeddings
ab-testing
rag
+2
·tian

重新路由回智能体的升级路径

当下游队列开始自行自动化时,`escalate_to_human` 工具就不再是人机回环了。探讨为什么契约的生命周期必须长于消费者。

insider
ai-agents
human-in-the-loop
escalation
+2
·tian

裁判模型被悄悄升级的评估框架

终端被悄悄更新的 LLM 裁判是一个没有校准契约的测量工具。固定快照版本、构建锚点集并运行双裁判窗口,确保 6 分的提升代表的是你的系统得到了改进 —— 而不是尺子变了。

insider
llm-eval
judge-model
calibration
+2
·tian

被两个漂移向量拉扯的评估准则

一个同时由人类和 LLM 裁判阅读的评估准则会在两个轴向上同时发生漂移。综合得分掩盖了这种波动。本文介绍了一种测量协议,使每种漂移都变得可追溯。

insider
evals
llm-judge
measurement
+2
显示第 133–144 篇,共 990 篇