Posts tagged "ai-evals" on TianPan.co.
查看所有标签
你的团队每天使用产品只是冒烟测试,而不是评估。为什么开发者是自己产品最糟糕的样本,以及如何针对真正导致产品崩溃的流量来衡量 AI 产品的质量。
将 LLM 从 fp16 量化到 int4 实际上是发布了一个披着相同权重外壳的不同模型。针对原模型校准的评估套件会无声地给出错误的评分——在客户发现之前,你需要为这些能力衰减做好预算。