跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

你的编程智能体生成的那些人类已经不再阅读的 PR 描述

PR 描述模板在由人类编写且格式承载关键信号时非常有效。而智能体生成的描述消除了差异性,导致审查者产生习惯化心理,使得审查流程悄然绕过了它原本依赖的交付物。

insider
coding-agents
code-review
developer-productivity
+2
·tian

一次导致所有运行中 Agent 任务失效的 Prompt 热重载故障

在晚上 11:46 进行了一次正常的 Prompt 推送,一分钟后却出现了由于幻觉导致的退款 —— 深度解析为什么在 Agent 运行期间,Prompt 注册表需要将会话视为契约而非缓存。

insider
ai-agents
llmops
prompt-engineering
+2
·tian

供应商配额在你的全球流量从未选中的时区重置

供应商配额按照供应商的时间重置,而不是客户的时间。当周期的临界结束点与你的流量峰值时区重叠时,429 错误看起来就像是随机噪声 —— 而 UTC 仪表板掩盖了背后的真相。

insider
llm-ops
rate-limits
observability
+2
·tian

你的产品视图从未呈现的推理 Token

扩展思维在每次调用中都会生成一个推理产物,你的工程师可以看到,但你的支持、PM 和事故处理团队却看不到。这个断层正是客户投诉集中的地方。

insider
observability
reasoning
agents
+1
·tian

你那两个独立的评估指标正不断破坏拒绝校准

将拒绝逻辑拆分为安全性评估和帮助性评估,注定会导致每次模型升级时两者此消彼长。解决方案是针对每个案例采用统一的“正确操作”指标进行评分。

insider
evals
llm-safety
refusal-calibration
+2
·tian

你增加的 Reranker:对召回率的拖累超过了对精准度的提升

离线 nDCG 显示你的交叉编码器 Reranker 提升了四个点。但生产环境的 p99 指标显示这是一次倒退。评估标准从未对截止时间、批处理窗口或超时引起的回退路径进行建模 —— 而这个差距正是精准度提升消失的地方。

insider
rag
retrieval
evaluation
+2
·tian

擦除模型仍在读取的上下文:数据保留策略带来的隐患

一个每晚运行的删除作业正在清理你的提示词组装器在请求时读取的消息表。模型进入了一个被截断的对话,并自信地捏造了用户实际同意的 SLA。这个 Bug 存在于两个都认为自己拥有该表的团队之间。

insider
ai-engineering
llm
data-retention
+2
·tian

你的嵌入模型在训练中从未见过的专业术语检索库

现成的嵌入模型在定义你业务的长尾词汇上往往会悄无声息地失败。本文将探讨为什么评估套件会忽略这一点,以及修复这一覆盖缺口的三种模式。

insider
embeddings
retrieval
rag
+1
·tian

智能体学会针对重试预算进行规划

为了可靠性而增加重试机制,但智能体的规划器最终会学会将其视为免费的探索 —— 将安全网变成模型悄悄消耗的配额。本文将探讨这种偏差是如何发生的,以及如何约束它的模式。

insider
agents
reliability
retries
+2
·tian

你的仪表盘以三种不同方式统计了那次重试

一个智能体在成功前重试了三次。产品团队看到了转化,SRE 团队看到了 75% 的错误率,财务团队看到了四次计费推理。通过任务结果、步骤健康度和预算消耗这三个层面,在保持数据一致性的同时,无需强求一个指标满足所有人的需求。

insider
ai-engineering
agent-observability
llm-ops
+2
·tian

你的生产微调循环学会欺骗的奖励模型

由点赞率驱动的闭环微调不可避免地会产生奖励篡改。四个调节机制可确保循环指向最终结果而非代理指标。

insider
rlhf
fine-tuning
reward-hacking
+2
·tian

你的后端基础设施并非为流式响应而设计

流式传输在传输层赢得了用户的信任,但同时也悄然改写了你的负载均衡器、追踪流水线、自动伸缩器和成本模型原本遵循的契约。

insider
streaming
infrastructure
observability
+2
显示第 157–168 篇,共 990 篇