跳转到主要内容

11 含有标签「benchmarks」

Posts tagged "benchmarks" on TianPan.co.

查看所有标签

·tian

模型指标卡的基准测试:当你的合同引用该数字时,其方法论已发生偏移

基准测试数字是协议下的测量结果,而协议是由你的供应商控制的。请锁定方法论,或在合同中规定使用你自己的评估套件。

insider
llm
benchmarks
procurement
+2
·tian

即使你发誓绝不分享,你的评估集仍需要的水印

私有评估集会像其他任何东西一样泄露 —— 通过 Bug 票据、Slack 粘贴、供应商流水线和调试日志。请为它们添加水印,以便在下一次模型升级到来时,你能分辨出真实的性能提升与污染造成的假象。

insider
evals
ai-engineering
benchmarks
+1
·tian

厂商基准测试是你的天花板,而非预测

厂商基准测试数据描述的是受控环境下的表现,而非你的技术栈。你的产品所获得的实际增益在结构上会更小——而唯一值得据此批准预算的预测,是你自己的影子评估。

llm
evaluation
benchmarks
finops
+1
·tian

基准测试泄露:你的评估集是如何悄悄加入训练语料库的

公开的 LLM 基准测试正悄然变成训练数据,并导致评分虚高 5–15 分。本文将介绍实用的污染审计方法(n-gram、金丝雀字符串、留存测试),以及你的评估团队不愿执行这些审计的组织层面原因。

llm-evaluation
benchmarks
contamination
ai-engineering
·tian

模型卡没告诉你的是:公开基准测试与实际工作负载之间的生产差距

模型卡上的基准测试是在理想条件下测量的,这些条件很少能与生产环境匹配。这是每个团队发现得太晚的差距 —— 以及一套能在部署前捕捉到这些问题的内部基准测试套件。

insider
llm
production
benchmarks
+2
·tian

基准污染:为什么那个90% MMLU分数并不意味着你想象的那样

前沿模型在标准基准上表现亮眼,但污染——测试数据泄漏到预训练中——会显著虚高这些数字。本文揭示实际差距有多大,以及如何设计能给出诚实信号的评估。

insider
ai-engineering
evaluation
llm
+1
·tian

评估集衰退:为什么你的基准在构建六个月后会变得具有误导性

静态评估集是用户行为的冻结快照。随着真实流量的演变,你的基准会偏离生产现实——本文介绍如何衡量衰退并保持评估的诚实性。

insider
evaluation
llm
production
+2
·tian

评估悖论:古德哈特定律如何破坏 AI 基准测试

当 AI 团队为了基准测试分数而非真实能力进行优化时,分数虽然在攀升,但质量却在下降。本文将探讨评估悖论的运作方式,以及哪些结构性变革能真正让评估具备抗操纵能力。

insider
ai
evaluation
benchmarks
+1
·tian

长周期评估鸿沟:为什么你的智能体通过了所有基准测试却仍在生产环境中失败

单轮基准测试为生产环境中的 AI 智能体提供了一种虚假的安全感。在 SWE-Bench Verified 上得分 75% 的模型,在真实的工程任务中往往会骤降至 25% 以下——本文将探讨这种差距的结构性原因,以及如何构建能够捕捉这些问题的评估体系。

ai-agents
evaluation
benchmarks
llm
·tian

生产环境中的 Agentic Coding:SWE-bench 分数没有告诉你的真相

SWE-bench Verified 的评分已达到 80% —— 然而同样的模型在更难的基准测试中仅获得 23% 的分数,一项受控研究发现 AI 工具反而让经验丰富的开发者效率降低了 19%。本文将探讨编程智能体在何处真正交付价值,以及它们在何处悄然失败。

insider
ai-agents
coding-agents
benchmarks
+2
·tian

AI 基准测试究竟衡量了什么(以及为什么你不该迷信排行榜)

AI 基准测试分数看起来很客观,但由于数据污染、格式敏感性和古德哈特定律的影响,排行榜的排名往往无法反映真实的生产环境表现。本文将带你了解其中的核心问题。

evaluation
llm
benchmarks
ai-engineering