跳转到主要内容

172 含有标签「evaluation」

Posts tagged "evaluation" on TianPan.co.

查看所有标签

·tian

为什么你的 AI 听起来不对劲,即使技术上完全正确

技术正确性与交流适当性是两个正交的失效模式。语域不匹配是一个隐性的用户流失驱动因素,它藏在模糊的用户反馈背后,几乎不会出现在你的评估套件中。

ai
llm
prompt-engineering
evaluation
·tian

LLM 分类器的生产实践:为什么准确率是错误的指标

准确率本身并不能预测基于 LLM 的分类器能否在生产环境中存活。真正的约束在于校准性、分类别指标、延迟 SLO,以及揭示生产就绪性的测试模式。

insider
llm
production
classification
+2
·tian

Provider 行为指纹:模型切换中的隐性损耗

切换 LLM Provider 会以能力基准测试永远无法发现的方式破坏生产环境——包括拒绝语气、JSON 序列化怪癖、空白字符约定以及上下文退化曲线,而你的代码库早已悄悄依赖这些行为。以下是如何在迁移前将这些隐性契约暴露出来的方法。

insider
llm
ai-engineering
model-migration
+1
·tian

摘要有效性问题:如何识破 AI 压缩掉的关键信息

看起来忠实原文的 AI 摘要可能会悄无声息地丢失下游任务所需的关键信息。本文将教你如何定义完整性契约、结合覆盖率指标,并构建回归测试,在有损压缩破坏你的流水线之前及时发现问题。

insider
llm
rag
evaluation
+1
·tian

群体感知微调:当单一模型不够,而针对每个用户的微调又负担过重时

大多数微调都处于两个极端:要么一个模型服务所有人,要么每个客户一个模型。中间地带 —— 三到八个针对特定群体的感知微调 —— 才是杠杆效应所在。

insider
fine-tuning
llm-ops
evaluation
+1
·tian

评估自动化陷阱:当你的流水线偏离用户真实需求时

自动化评估流水线在显示准确率持续提升的同时,用户满意度却在悄然下滑。本文将揭示漂移的发生机制,以及如何在问题扩散到生产环境之前及时发现它。

insider
ai-engineering
evaluation
llm
+1
·tian

评估迁移税:为什么 Prompt Schema 的一次变更会毁掉 800 个测试用例

AI Prompt 的 Schema 变更经常会破坏数百个与该变更无关的测试用例。大多数团队将评估套件视为静态固定装置,而不是版本化数据——并在每次发布时支付一笔隐形成本。

ai-engineering
evaluation
llm
testing
+1
·tian

LLM 作为验证器的反模式:为什么你的 AI 质量门禁存在盲点

使用 LLM 作为主要的质量门禁来评估 LLM 输出会创建一个循环验证回路,导致对系统性模型失效产生盲点。本文将探讨应采用的替代方案。

insider
ai-engineering
llm
evaluation
+1
·tian

弃权作为一种路由决策:为什么“我不知道”应该属于路由层,而不是提示词

将“我不知道”放在系统提示词中会让弃权行为变得不可测试、无归属且不可扩展。将其移动到路由层,你将获得 SLO、评估机制以及真实的升级路径。

llm
agents
abstention
routing
+1
·tian

Demo 只是一个随机种子:为什么你的 AI 发布面临的是方差问题,而非润色问题

那个令人惊叹的 Demo 只是模型针对同一输入生成的数千种可能性中的一次实现。产品发布之所以受挫,并非因为缺乏“润色”,而是因为没人测量过方差。本文将介绍如何通过 n-of-k 采样、最坏情况输入库和分布偏移检查清单来弥补这一差距。

insider
ai-engineering
evaluation
reliability
+1
·tian

单次正确成本,而非 Token 成本:账单不会告诉你的单位指标

Token 支出是分子,通过评估定级的产出是分母。仅仅追踪账单,往往会导致在向低成本方案迁移时,由于质量悄然下降而推高下游的支持成本。

ai-engineering
finops
llm-costs
evaluation
+1
·tian

评估集毒丸:当你的基准测试成为后门

大多数团队信任评估,因为没人负责对其进行审计。标注流水线是一个人力供应链 —— 而黄金数据集会继承人类引入的任何扭曲。

ai-engineering
evaluation
llm-ops
data-quality
+1
显示第 73–84 篇,共 172 篇