跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

评估了错误的 RAG 管道环节

一个 RAG 系统本质上是由两台机器组成的,但大多数评估框架只给生成器评分。本文将解释为什么检索环节需要独立的评分体系,以及如何构建它。

insider
rag
evaluation
retrieval
+2
·tian

淘汰嵌入模型:在不中断搜索的情况下重新索引数百万个向量

更换嵌入模型表面上看起来只是配置更改,但实际上是一次完整的数据迁移。本文将介绍如何重新嵌入语料库、执行双索引切换、预估成本和时间,并在你的用户发现问题之前证明新索引的效果更佳。

insider
embeddings
vector-search
rag
+2
·tian

那个因等待另一个 Agent 而死锁的 Agent

两个能力出色的 Agent 可能会在你的账单飞涨时永远互相等待。为什么是协作——而非模型能力——导致了 Agent 群体的崩溃,以及分布式系统准则如何修复这一问题。

insider
ai-agents
multi-agent-systems
distributed-systems
+2
·tian

你的智能体读不懂的弃用通知

智能体不会阅读更新日志或 Sunset 响应头。本文将探讨为什么工具弃用对大语言模型智能体来说会静默失败,以及如何对工具契约进行版本化,从而让模型能够真正接收到通知。

insider
ai-agents
api-design
tooling
+2
·tian

无法回滚的功能开关:提示词

提示词的修改会瞬间改变所有用户的生产环境行为,既没有金丝雀发布,也没有有效的回滚机制。本文将探讨提示词和模型版本固定为何脱离了发布规范,以及将其重新纳入规范的五个原语。

insider
llmops
prompt-engineering
release-management
+2
·tian

FinOps 鸿沟:为什么没有人批准你那 4 万美元的 AI 账单

模型支出通过你的变更管理流程从未审查的代码路径进入生产环境。本文将探讨为什么 Token 成本在审批中是不可见的,以及弥补这一鸿沟的归因、成本分摊(Showback)和支出闸门(Spend-gate)等原语。

insider
finops
llm
cost-optimization
+2
·tian

腐烂的黄金数据集:为什么你的评估集会与产品脱节

一个持续通过的黄金评估集可能在对你撒谎。本文探讨评估数据集如何因覆盖范围缺失、标签陈旧和分布偏斜而腐烂,以及如何通过数据卫生保持评分的真实性。

insider
ai-engineering
llm-evaluation
mlops
+1
·tian

P99 是产品决策,而非基建决策

你的尾部延迟目标并不是基建团队单纯优化出的一个数字 —— 这个数字本身就是一个产品选择。本文探讨了 UX 交互设计与延迟预算如何相互权衡,以及为什么 P99 应该出现在设计评审中。

insider
latency
ux
llm-inference
+2
·tian

没人使用的长尾:工具带是如何变得尾大不掉的

你给智能体增加的每一个工具,都在削弱它选择正确工具的能力。那几十个无人问津的工具正在悄悄降低那三个核心工具的被选概率 —— 本文将探讨如何保持工具目录的精简与高效。

insider
ai-agents
tool-use
mcp
+2
·tian

间接提示注入:你以为处于惰性的数据平面

你的智能体将检索到的每个文档都视为惰性数据,但检索到的文本实际上是以系统提示词的权限运行的。本文将探讨间接提示注入的工作原理、为什么 EchoLeak 证明了它的存在,以及真正有效的防御手段。

insider
ai-security
prompt-injection
llm
+2
·tian

没人会为你的智能体承保

你的智能体准确率足以在无人看管的情况下运行,但部署过程却卡在了一个问题上:当它出错时,谁来承担损失。本文探讨了为什么自主性现在成了一个保险问题,以及如何让智能体变得可承保。

insider
ai-agents
liability
insurance
+2
·tian

试点炼狱:廉价的 90% 正是你的 AI POC 无法转正的原因

一个可运行的 AI 演示只是那看起来像 100% 但其实很廉价的 90%。那些能确保其在生产环境中安全运行的评估、护栏、可观测性、成本上限和权属划分,才是没人预估过的昂贵的 10% —— 这里有一份清单,帮你提前预估这些成本。

insider
ai-engineering
llm
mlops
+1
显示第 1–12 篇,共 990 篇
1 / 83下一页