·tian
LLM 应用的测试驱动开发:类比成立与失效之处
大多数团队在编写提示词之后才编写评估——这注定了评估的薄弱。本文将介绍评估优先开发的工作原理,以及 TDD 类比在 LLM 领域失效的四个地方。
llm
evals
testing
ai-engineering
·tian
LLM 评估:什么才真正有效,什么是在浪费时间
一份面向从业者的 LLM 评估指南 —— 为什么错误分析先于基础设施、LLM-as-judge 何时有效、如何避免基准测试分数陷阱,以及为什么评估工作永无止境。
llm-evaluation
evals
ai-engineering
llm-as-judge
·tian
为什么你的 LLM 评估器失准了 —— 以及数据优先的修复方案
大多数团队在阅读数据之前就开始编写 LLM 评估标准 —— 这种本末倒置的做法正是评估器错过最关键失败案例的原因。数据优先的工作流、二元标签以及针对留出集的妥善验证可以从根本上解决这一问题。
llm-evaluation
ai-engineering
evals
llm-as-judge
·tian
生产级 LLM 系统的评估工程
如何构建真正能发现故障的 LLM 评估系统 —— 涵盖错误分析循环、评估成本层级、LLM-as-judge 方法论、CI/CD 集成以及 Agent 特有的陷阱。
evals
llm
production
ai-engineering
·tian
你的 AI 产品需要评估系统
大多数 AI 产品失败并非因为模型本身,而是因为缺乏评估系统。本文提供一份实用指南,教你如何构建评估系统,从单元测试到人工评审再到 A/B 测试——以及为什么尽早开始会带来复合收益。
ai-engineering
evals
llm
testing
+1·tian
使用 LLM 构建的一年:该领域的实战经验总结
来自将 LLM 驱动的系统推向生产环境的团队的宝贵经验:为什么模型是你技术栈中最不持久的部分,如何构建真正有效的评估基础设施,以及 RAG 何时优于微调。
llm
ai-engineering
rag
evals
+1·tian
AI 智能体评估就绪清单
一份实用的、循序渐进的清单,旨在帮助你构建真正能发现故障的 AI 智能体评估,内容涵盖追踪审查、数据集设计、评估器模式,以及如何将评估与生产环境连接起来。
ai-agents
evals
llm
production
显示第 145–151 篇,共 151 篇
上一页13 / 13