跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

RAG 读后写竞争:当你的向量索引引用了一个已不存在的文档

生产环境中的 RAG 流水线往往默认检索与生成之间存在快照隔离。然而,由于从未真正强制执行,导致了已删除数据块被引用、已编辑数据块内容倒置以及过期权限泄露等 Bug。

rag
vector-database
ai-engineering
consistency
+1
·tian

智能体动作空间的可达性分析:为你从未测试过的分支提供评测覆盖

你的工具目录加上规划器构成了一个可达的执行计划图,而你的评测(Evals)可能从未覆盖过这些路径。借鉴编译器的可达性分析方法,找出那些可能最先由事故频道(Incident Channel)发现的隐藏分支。

insider
ai-engineering
agents
evaluation
+2
·tian

路由即产品:为什么你的低成本分类器比旗舰模型决定了更多行为

成本感知型 LLM 路由让低成本模型成为了大多数用户的实际产品面。如果你的评估体系仍聚焦于旗舰模型,那么你在 70% 的流量上都是盲目的 —— 这里有能解决该问题的“路由即产品”框架。

llm-routing
ai-engineering
evals
observability
+1
·tian

你的影子评估集是一个合规性定时炸弹

生产追踪评估管道积累了用户从未被承诺会以这种方式处理的 PII。其修复方法是在写入边界进行清理、使用架构化类型的 span 以及基于标签的数据保留 —— 而不是在读取时使用正则表达式脱敏器。

ai-engineering
privacy
evaluation
compliance
+1
·tian

AI 功能指标陷阱:为什么 DAU 和留存率在随机化表面 (Stochastic Surfaces) 上会产生误导

DAU、转化率和留存率是为点击流设计的。而 AI 功能产生的是任务弧 (Task Arcs) —— 请求、响应、后续、解决 —— 你从确定性策略指南中引入的仪表盘会告诉你该功能表现优异,但实际上用户正在绕过它。

ai-engineering
product-metrics
observability
llm
·tian

你的 stop_reason 在说谎:构建生产环境故障排查真正需要的停止分类法

厂商提供的 stop_reason 值只给了你四个分类,但生产环境的故障排查通常需要八个。本文将介绍如何构建并行停止分类法,将黑盒式的终止转换为可调试的信号。

llm
observability
ai-engineering
incident-response
+1
·tian

流式 JSON 解析器:Token 与类型化对象之间的鸿沟

JSON.parse 是全量或全无的,但 LLM 的 Token 流并非如此。为什么流式结构化输出是 API 和 SDK 必须共同解决的设计难题,以及一个真正的部分解析器必须具备哪些功能。

insider
llm
streaming
structured-output
+2
·tian

系统提示词作为代码、配置或数据:影响全局的架构决策

大多数团队在选择系统提示词的存储位置时非常随意,随后却要在数年内为此承担后果。在代码、配置和数据存储之间的选择会直接影响部署频率、评估范围和租户灵活性 —— 这里有一套在 MVP 阶段前就应应用的框架。

llm
ai-engineering
architecture
prompt-engineering
+1
·tian

AI 工程师的三种品味:为什么 Prompt、Eval 和 Guardrail 往往无法共存于一个大脑中

Prompt 品味、Eval 品味和 Guardrail 品味是 AI 工程师这一职位头衔下隐藏的三种截然不同的直觉。如果你将它们视为同一种技能来进行招聘和晋升,你将交付一个失衡的系统——即便所有的指标都显示正常(全绿),用户却在流失。

hiring
ai-engineering
evals
guardrails
+1
·tian

Token 放大:烧掉你账单的提示词注入攻击

大多数提示词注入威胁模型都集中在数据泄露上。更隐蔽的一类攻击是账单放大 —— 0.01 美元的请求变成了 40 美元的推理发票。这里是阻止该攻击的防御准则。

insider
ai-engineering
security
prompt-injection
+2
·tian

Tokenizer Churn:你的“兼容”模型升级中隐藏的破坏性变更

供应商的模型升级可能会在保持 API 字节级稳定的同时,悄悄更换底层的 tokenizer —— 从而在无形中破坏上下文预算、停止序列和 few-shot prompt。本文将介绍如何审计、固定以及在 tokenizer churn 中生存。

insider
llm
model-upgrades
tokenization
+1
·tian

拒绝还是上报:置信度门控 AI 中的双阈值问题

单个置信度阈值将“拒绝”和“上报”这两个截然不同的决策强行合并为一个数字,而这种妥协正是导致你的信任度指标持续下滑的原因,即便在准确率看起来还不错的情况下也是如此。

insider
llm
ai-engineering
calibration
+2
显示第 457–468 篇,共 834 篇