跳转到主要内容

172 含有标签「evaluation」

Posts tagged "evaluation" on TianPan.co.

查看所有标签

·tian

AI 审美难题:在没有标准答案时如何衡量质量

当准确性指标失去意义时,如何评估 AI 的输出——文案创作、创意内容和设计背后的两两比较研究、评分者间信度和 LLM 评审员的工程学科。

ai
evaluation
ml
product
·tian

标注经济学:每种标签来源背后隐藏的代价

在评测标签来源的选择上——人类领域专家、众包工人、LLM 合成生成和行为推断——的决策框架,以及何时「无标注」才是正确答案。

insider
evaluation
annotation
llm
+1
·tian

你从未闭合的反馈回路:将用户行为转化为 AI 真值

显式的点赞评分可能是表象。编辑率、重试模式和会话中断能更真实地反映 AI 的质量 —— 而且你可以在没有标注预算的情况下,将它们转化为评估数据集。

insider
ai-engineering
evaluation
observability
+1
·tian

基准污染:为什么那个90% MMLU分数并不意味着你想象的那样

前沿模型在标准基准上表现亮眼,但污染——测试数据泄漏到预训练中——会显著虚高这些数字。本文揭示实际差距有多大,以及如何设计能给出诚实信号的评估。

insider
ai-engineering
evaluation
llm
+1
·tian

评估集衰退:为什么你的基准在构建六个月后会变得具有误导性

静态评估集是用户行为的冻结快照。随着真实流量的演变,你的基准会偏离生产现实——本文介绍如何衡量衰退并保持评估的诚实性。

insider
evaluation
llm
production
+2
·tian

评估悖论:古德哈特定律如何破坏 AI 基准测试

当 AI 团队为了基准测试分数而非真实能力进行优化时,分数虽然在攀升,但质量却在下降。本文将探讨评估悖论的运作方式,以及哪些结构性变革能真正让评估具备抗操纵能力。

insider
ai
evaluation
benchmarks
+1
·tian

为什么幻觉率不是衡量生产级 LLM 系统的核心指标

幻觉率虽易于衡量,但与用户结果的关联性较弱。本文提供了一个选择行为指标的框架,能真实反映你的 AI 功能是否奏效。

evaluation
observability
production-ai
metrics
·tian

长尾覆盖问题:为什么你的AI系统在最关键的地方失败

准确率和F1等聚合指标看起来很好,但你的AI系统可能在最重要的少数输入上悄然失败。如何在用户发现之前检测、衡量并修复长尾覆盖盲区。

evaluation
testing
production-ai
machine-learning
·tian

区分优秀AI工程师与普通工程师的思维模型转变

从确定性系统到随机系统的过渡会让优秀的工程师陷入困境。以下是真正区分有经验的AI工程师与其他人的思维模型、调试直觉和实践方法。

ai-engineering
engineering-leadership
llm
evaluation
+1
·tian

提示词本地化技术债:隐藏在多语言 AI 产品中的无声质量梯度

为什么在英语中表现为 91% 的提示词,在日语或阿拉伯语中会悄然下降到 72% —— 以及如何构建评估基础设施,在这些回归影响到非英语用户之前捕获它们。

insider
ai-engineering
multilingual
localization
+2
·tian

AI 系统的影子流量:在上线前验证模型变更的最安全方式

如何使用生产流量回放在变更影响用户之前验证 LLM 模型和提示词变更——以 A/B 测试一小部分成本获得信心所需的基础设施、指标与采样策略。

insider
ai-engineering
llm
production
+2
·tian

在写第一个提示词之前,如何选对 LLM

公开基准已经饱和,无法告诉你哪个 LLM 能在你的系统中正常工作。本文提供一套实用框架,从真正重要的维度评估模型:函数调用可靠性、结构化输出合规性、你的领域拒绝率,以及真实并发下的延迟。

llm
model-selection
evaluation
production-ai
显示第 121–132 篇,共 172 篇