跳转到主要内容

151 含有标签「evals」

Posts tagged "evals" on TianPan.co.

查看所有标签

·tian

LLM 应用的测试驱动开发:类比成立与失效之处

大多数团队在编写提示词之后才编写评估——这注定了评估的薄弱。本文将介绍评估优先开发的工作原理,以及 TDD 类比在 LLM 领域失效的四个地方。

llm
evals
testing
ai-engineering
·tian

LLM 评估:什么才真正有效,什么是在浪费时间

一份面向从业者的 LLM 评估指南 —— 为什么错误分析先于基础设施、LLM-as-judge 何时有效、如何避免基准测试分数陷阱,以及为什么评估工作永无止境。

llm-evaluation
evals
ai-engineering
llm-as-judge
·tian

为什么你的 LLM 评估器失准了 —— 以及数据优先的修复方案

大多数团队在阅读数据之前就开始编写 LLM 评估标准 —— 这种本末倒置的做法正是评估器错过最关键失败案例的原因。数据优先的工作流、二元标签以及针对留出集的妥善验证可以从根本上解决这一问题。

llm-evaluation
ai-engineering
evals
llm-as-judge
·tian

生产级 LLM 系统的评估工程

如何构建真正能发现故障的 LLM 评估系统 —— 涵盖错误分析循环、评估成本层级、LLM-as-judge 方法论、CI/CD 集成以及 Agent 特有的陷阱。

evals
llm
production
ai-engineering
·tian

你的 AI 产品需要评估系统

大多数 AI 产品失败并非因为模型本身,而是因为缺乏评估系统。本文提供一份实用指南,教你如何构建评估系统,从单元测试到人工评审再到 A/B 测试——以及为什么尽早开始会带来复合收益。

ai-engineering
evals
llm
testing
+1
·tian

使用 LLM 构建的一年:该领域的实战经验总结

来自将 LLM 驱动的系统推向生产环境的团队的宝贵经验:为什么模型是你技术栈中最不持久的部分,如何构建真正有效的评估基础设施,以及 RAG 何时优于微调。

llm
ai-engineering
rag
evals
+1
·tian

AI 智能体评估就绪清单

一份实用的、循序渐进的清单,旨在帮助你构建真正能发现故障的 AI 智能体评估,内容涵盖追踪审查、数据集设计、评估器模式,以及如何将评估与生产环境连接起来。

ai-agents
evals
llm
production
显示第 145–151 篇,共 151 篇
上一页13 / 13