跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

Eval 异味目录:让你的 LLM 评估套件比没有评估还糟糕的反模式

一份关于毒害 LLM 评估套件的反模式实战指南 —— 包括数据污染、脆弱的断言、评估腐化、评委合谋、虚荣聚合指标 —— 以及在无需重写整个测试框架的情况下恢复有效信号的重构模式。

insider
ai-engineering
evaluation
llm
+2
·tian

用稀疏标注构建 LLM 评估体系:你不需要一万个样本

大多数团队以等待足够标注数据为由,迟迟不投入评估体系建设。已有证据表明,通过主动学习、弱监督和 LLM 自动标注精心挑选的 50–200 个样本,完全能够产生可靠的评估信号。本文介绍如何在数据集尚小时就构建值得信赖的评估体系。

evaluation
llm
ai-engineering
evals
+1
·tian

优雅地下架 AI 功能:如何在不损害用户信任的情况下弃用模型驱动的功能

弃用一个 AI 功能不像删除一个按钮——用户围绕模型个性、输出结构和行为特征构建了工作流。这里提供了一个四阶段生命周期,用于在不引发用户流失的情况下退出模型驱动的功能。

ai-engineering
llm
product
reliability
·tian

LLM 工程师招聘:面试究竟该测试什么

标准的代码筛选和机器学习数学题无法预测 LLM 工程的成功。以下是实际的面试练习如何揭示候选人交付 AI 产品能力的真实情况。

llm
hiring
engineering-leadership
ai-engineering
·tian

大多数 Agent 路由器跳过的意图分类层

大多数 Agent 路由器在每次请求时都加载所有工具 Schema,让 LLM 自行决策。当工具数量达到 417 个时,这种方式的准确率会崩跌至 20%。本文解释意图分类层如何解决这一问题——以及跳过它如何在规模化后悄然损毁准确率和成本。

insider
ai-engineering
agents
llm
+1
·tian

裁判模型独立性:当评分者与被评分者共享盲点时,你的评测为何会失效

使用同一模型家族同时担任产品和裁判会因共享盲点导致评分虚高 8–16%。本文介绍如何构建真正能捕获模型遗漏问题的评测系统。

insider
evaluation
llm-as-judge
ai-engineering
+1
·tian

让合成评估数据保持真实

用 LLM 生成自己的测试用例会制造一个令人满意却具有误导性的反馈循环。以下介绍对抗性注入、人工标注分流和多样性差距分析如何修复合成评估的结构性盲点。

ai-engineering
evaluation
llm
testing
·tian

知识图谱作为 RAG 的替代方案:当结构化检索优于向量嵌入时

向量相似度搜索在处理多跳查询和依赖模式的事实时往往会悄然失效。本文将探讨属性图遍历查询在何时优于嵌入查找,以及如何构建兼顾两者的混合系统。

rag
knowledge-graphs
llm
retrieval
+1
·tian

LLM 在安全运营中心的应用:在不承担责任风险的情况下实现加速

如何将 LLM 接入安全运营,以便在加速警报分拣的同时,避免在悄无声息中批准真实的入侵行为——涵盖置信度阈值、日志投毒防御以及关键指标。

security
llm
soc
ai-engineering
+1
·tian

你的 AI 功能应该先输给正则表达式一次

在你投入微调或 RAG 之前,你的 AI 功能应该被要求击败你能构建的最简单的确定性基准。大多数团队跳过了这个环节,并为此付出了代价。

ai-engineering
llm
production
engineering
·tian

多模型一致性:当你的流水线中的连续 LLM 调用相互矛盾时

在单个工作流中,三次 LLM 调用可能会产生相互冲突的事实、实体引用和状态声明。本文将介绍如何设计能够保持连贯性的流水线。

ai-engineering
llm
architecture
reliability
·tian

多会话评估设计:捕捉随时间推移而恶化的 AI 功能

单轮评估往往会忽略那些只有在状态累积后才会出现的 AI 故障。本文将探讨如何设计多会话评估框架、衰减曲线和回归方法,在用户流失之前捕捉到质量腐烂。

ai-engineering
evaluation
llm-memory
observability
+1
显示第 685–696 篇,共 834 篇