跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

那些被 AI Agent 悄然终结的编程面试

编程 Agent 切断了 Take-home 任务衡量标准与实际工作需求之间的联系 —— 而大多数招聘流程仍在沿用这个已经失效的代理指标,却未曾察觉。

insider
hiring
ai-agents
engineering-management
+1
·tian

当候选人使用智能体时,编程面试衡量的是什么

当每一位工程师都开始与智能体协作时,独立产出代码的能力已不再能预测其在职表现。本文将探讨编程面试应该衡量什么,以及为什么禁止或随意允许使用智能体都会破坏面试信号。

insider
hiring
ai-engineering
coding-interview
+1
·tian

上下文长度是安全边界,而不仅仅是成本线

足够长的对话会将你的系统提示词埋在更新的 Token 之下,直到防护栏悄然失效。为什么上下文长度属于威胁模型——以及如何控制它。

insider
ai-security
llm
prompt-injection
+2
·tian

Dogfooding 不是一种评估策略

你的团队每天使用产品只是冒烟测试,而不是评估。为什么开发者是自己产品最糟糕的样本,以及如何针对真正导致产品崩溃的流量来衡量 AI 产品的质量。

insider
ai-evals
llm-products
product-quality
+1
·tian

你的评测集是一张用户早已离开的流量快照

基准测试的提升衡量的是用户早已离开的分布上的进展。本文探讨评测集陈旧、幸存者陷阱以及单一聚合指标如何掩盖无声的衰退 —— 以及你如何让评测始终紧跟流动的动态。

insider
llm-evaluation
ai-engineering
machine-learning
+1
·tian

那个你从未进行过负载测试的备用模型

配置好的备用模型只能证明你的路由机制有效 —— 却无法证明你的应用是否能在次要模型的输出下生存。本文探讨了为什么名义上的备用方案在真实流量下会失败,以及如何在供应商出故障前先行测试你的故障转移机制。

insider
llm
reliability
failover
+2
·tian

你的备用路径是生产环境中唯一未经测试的代码

你为应对故障而构建的降级路径几乎从不运行,因此它在寂静中腐烂,并在其本应应对的事故发生时才首次亮相。

insider
reliability
llm
sre
+2
·tian

Happy Path 是你的 Agent 评估测试过的唯一路径

94% 的通过率衡量的是你想象成功的能力,而非 Agent 是否真的有效。本文探讨黄金路径偏见如何渗入 Agent 评估套件,以及如何通过故障模式覆盖、生产案例收集和故障注入来解决这一问题。

insider
ai-agents
evaluation
llm
+2
·tian

你的内部 API 在智能体调用的那一天起就变成了公共 API

只有当你能叫出每一个调用者的名字时,内部 API 才真正属于“内部”。一旦接入 LLM 智能体,那些从未白纸黑字写下的契约就会变成负担 —— 以下是你突然需要为之付出的公共 API 维护准则。

insider
ai-agents
api-design
software-architecture
+1
·tian

流式回滚问题:你无法收回已发送的 Token

流式输出在任何护栏检查之前就已触达用户。本文将探讨为什么输出审核与 Token 流式传输在结构上存在冲突,以及如何通过缩短暴露窗口来应对这一问题,而非对其视而不见。

insider
llm
guardrails
streaming
+2
·tian

结构化输出并非经过验证的输出

JSON 模式和受限解码只能保证 LLM 响应的形状,而非其含义。本文探讨了为什么通过 Schema 检查只是正确性工作的开始,以及语义验证真正的归宿。

insider
llm
structured-output
validation
+2
·tian

每次事故后你的系统提示词都会增长 —— 而且没人会删掉任何一行

每一个生产事故都会在你的系统提示词中留下一句防御性语句,而且从来没人会删掉它们。本文将探讨为什么提示词积聚是真实的技术债,以及如何通过日期标记、半衰期和消融实验来修剪它。

insider
llm
prompt-engineering
ai-agents
+1
显示第 241–252 篇,共 990 篇