跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

MCP 工具弃用:为什么模型仍然调用旧名称

重命名 MCP 工具不仅仅是 API 弃用 —— 这是一种模型分布的转变。本文将探讨为什么旧名称会持续出现,以及如何在不触发运维告警的情况下逐步淘汰它。

insider
mcp
tool-calling
deprecation
+1
·tian

模型迁移的双重账单:被忽视的评测重锚税

更换基础模型会悄无声息地使你的评测基准失效——人工锚定的评分、LLM 裁判、快照以及团队直觉都需要重新锚定,而由此产生的人工成本通常比节省的 token 费用更高。

insider
evals
model-migration
llm-ops
+1
·tian

按客户定制的提示词分支:为什么你的下一次模型迁移是 47 次迁移

针对每个客户的系统提示词定制会在不知不觉中累积,直到模型迁移那一天,单一供应商的版本弃用演变成了 47 个独立的重新验证任务。本文探讨了能够防止这种情况的“基础加覆盖”架构和审批规范。

insider
prompt-engineering
llm-ops
enterprise-ai
+2
·tian

Prompt 即文档:当系统 Prompt 成为唯一可信的交付物时

当 PM、支持团队和销售开始通过阅读系统 Prompt 来了解产品功能时,这既是一种褒奖,也是一种结构性失效。本文将介绍如何保留有效的部分并修复其余问题。

insider
ai-engineering
prompt-engineering
product-management
+1
·tian

Agent 内部的提示词图谱:无人绘制的跨提示词回归链

规划器中四个词的修改,会导致下游验证器的通过率波动三个百分点。解决方案是将你的 Agent 提示词组合视为微服务网格——关注图谱、边、契约、爆炸半径 PR 审查、逐边回归评估以及边负责人。

insider
ai-agents
prompt-engineering
evals
+2
·tian

季度模型迁移:将其变成日程安排,而非消防演习

基础模型提供商退役模型的节奏往往不在你团队的计划之内。将每次迁移视为一次性项目,意味着每年要支付三到四次相同的设置成本。相反,应该进行季度演练——指定负责人 (DRI)、候选模型、回归测试重跑、运行手册更新——这样当下一次弃用邮件寄达时,它只是团队既定节奏中的一部分。

insider
llm-ops
model-migration
production-ai
+2
·tian

评估员吞吐量是评估流水线中隐藏的瓶颈

在任何重视人工评分的 AI 系统中,评估员的吞吐量都限制了评估速度。本文介绍了一套运营规范——包括校准周期、感知队列的优先级排序以及评分标准反馈循环——旨在将标注产能视为一个 SRE 问题,而非招聘问题。

insider
evals
ai-engineering
operations
+1
·tian

重复问题检测:你的单轮评估无法察觉的会话级盲点

单轮评估分数可以保持在绿色状态,但用户可能在三次重新表述同一个问题后流失。这种失败发生在会话层面——这里告诉你如何检测和评分。

insider
ai-engineering
evaluation
chatbots
+2
·tian

检索引用税:为什么合规性会增加 30% 的 RAG Token 账单

在 RAG 系统中添加引用看起来只是改一行系统提示词。但在受监管的租户中,它会悄无声息地让推理成本增加 25%–40%。本文将探讨为什么这种“税收”是结构性的,以及哪些架构层面的调整可以帮你挽回大部分成本。

insider
rag
ai-engineering
compliance
+2
·tian

二稿 Agent 模式:为什么“先探索再交付”优于“自我批判”

一种双阶段的 Agent 架构 —— 先进行发散性的初稿探索,再在受限上下文中进行精简执行 —— 在质量和成本上通常都优于 n-of-k 的自我批判循环。

insider
ai-agents
llm
agent-patterns
+2
·tian

思维标记(Thinking Tokens)在你的日志中隐身,但在账单上却震耳欲聋

推理标记(Reasoning tokens)按输出计费,但它们存在于一个大多数 LLM 可观测性栈在构建时尚未涉及的字段中。本文将分析为什么财务部门总是先于技术人员发现成本回归,以及你该如何弥合这一差距。

insider
llm-observability
reasoning-models
ai-cost
+2
·tian

你的 PRD 只是一个未经测试的 Prompt —— 直到你对其进行评测

AI 功能的 PRD 本质上是一个未经编译的系统提示词。在验收前进行评测,能让定义不明确的问题在上线前就暴露出来。

insider
ai-engineering
product-management
prompt-engineering
+1
显示第 277–288 篇,共 990 篇