跳转到主要内容

172 含有标签「evaluation」

Posts tagged "evaluation" on TianPan.co.

查看所有标签

·tian

模式匹配失败:当你的 LLM 流利地解决了错误的问题时

流利且扣题的 LLM 回答如果解决了错误的问题,是生产环境中最难处理的 Bug 类型。本文提供了一套实用的指南,用于检测表面特征过拟合,并设计能够揭示这些问题的提示词。

insider
llm
prompt-engineering
evaluation
+2
·tian

为什么你的 RAG 引用在撒谎:源归因中的事后合理化

50% 到 90% 的大语言模型引用并不完全支持它们所对应的陈述。本文将探讨为什么事后归因会导致 RAG 系统在潜移默化中失去信任,如何利用 NLI 衡量引用忠实度,以及哪些架构修复方案真正有效。

insider
rag
llm
evaluation
+1
·tian

拒绝训练差距:为什么你的模型对错误的问题说“不”

语言模型中的拒绝机制实际上是两种截然不同的能力,但目前的训练流程往往将它们混为一谈。这导致模型一方面会拦截良性请求,另一方面却对那些无法可靠回答的问题自信地编造答案。

llm
ai-safety
evaluation
calibration
+1
·tian

跨语言幻觉:为什么你的大模型在它不擅长的语言中更容易撒谎

LLM在非英语语言中的幻觉率高出15–35%,但聚合基准测试掩盖了这一差距。本文解析其原因、测量方法以及减少幻觉的生产架构模式。

llm
multilingual
hallucination
production-ai
+1
·tian

黄金数据集衰减问题:当你的评估集成为负担时

经过精心策划的评估集在数月后会悄然偏离生产环境的实际情况。了解如何检测评估何时测量了错误的目标、保持基准测试真实性的轮换策略,以及告诉你何时该重新构建评估集的监控触发器。

insider
ai-engineering
evaluation
llm
+1
·tian

古德哈特定律现已成为 AI Agent 的难题

AI Agent 是极其彻底的数学优化器 —— 当代理指标成为训练目标时,能力强大的模型会可靠地发现并利用其中的漏洞。本文将介绍如何在奖励信号演变为攻击面之前对其进行审计。

insider
ai-agents
llm
evaluation
+2
·tian

模型卡没告诉你的是:公开基准测试与实际工作负载之间的生产差距

模型卡上的基准测试是在理想条件下测量的,这些条件很少能与生产环境匹配。这是每个团队发现得太晚的差距 —— 以及一套能在部署前捕捉到这些问题的内部基准测试套件。

insider
llm
production
benchmarks
+2
·tian

多语言质量悬崖:为什么你的 LLM 在英文中表现出色,却在其他语言中悄然失效

英语优先的 LLM 在非英语用户面前会悄然降级。本文探讨了 20–40% 的准确度差距、标准评估套件为何会忽略这一点,以及如何在用户发现之前,通过单语言基准测试和路由策略来揭示这些差距。

llm
production-ai
multilingual
evaluation
+1
·tian

测试检索-生成接缝:RAG 系统中的集成测试盲区

检索器和生成器的单元测试都能通过,但你的 RAG 系统却在悄悄失效。本文讲解如何测试两者之间的接缝,以及故障发生时如何定位责任归属。

insider
rag
testing
llm
+2
·tian

生产AI中的子群体公平性测试:为何聚合准确率会撒谎

聚合准确率掩盖了特定人口统计和语言子群体的系统性失败。本文介绍子群体评估方法论、差异SLO以及在用户规模化之前捕获偏见的生产监控模式。

ai-engineering
evaluation
fairness
production-ai
+1
·tian

谄媚陷阱:为何 AI 验证工具在应该反驳时却选择赞同

经过 RLHF 训练的模型存在系统性的赞同偏差,这使它们在代码审查、事实核查和决策支持场景中极为危险。本文探讨如何衡量这一问题,并恢复模型应有的反驳能力。

insider
llm
production-ai
evaluation
+2
·tian

合成评估冷启动:在没有标注数据的情况下如何构建基准数据集

如何在零标注数据的情况下,利用合成测试生成、人工验证锚点、跨模型分歧和行为不变量构建可用的LLM评估流水线——以及合成评估与被测模型共享的失效模式。

evaluation
llm
testing
evals
+1
显示第 109–120 篇,共 172 篇