·tian
达成共识的 LLM-as-Judge 集成:只因评委都来自同一家族
一个由同一供应商家族构成的 LLM-as-judge 集成,测量的是家族内部的一致性,而非判断质量。所谓的高一致性评分,不过是某种无人提及的供应商选择偏差的产物。
llm-as-judge
evaluation
ensemble
bias
·tian
多模型共识:当单个 LLM 不足以进行最终签核时
大多数 AI 系统信任单个模型,且永远无法察觉系统性故障。多模型共识将输出路由至多个供应商系列的模型中,将分歧作为一种信号暴露出来,从而降低高风险决策中的尾部风险。
llm
ai-architecture
reliability
ensemble