·tian
合规审查员作为评测编写者:为什么法律团队应该为你编写测试用例
合规审查员能发现工程评测系统性遗漏的 LLM 失败模式。将他们从文档审查环节移至回归测试套件中 —— 法律签署将转变为对每次提交时运行的固定测试用例的确认。
insider
ai-engineering
evals
compliance
+2·tian
AI 的依赖注入:在不损失测试保真度的情况下模拟模型调用
在测试中模拟 LLM 调用看起来是一个简洁的抽象,但幼稚的桩代码 (stub) 会悄然失效,变成关于生产环境行为的谎言。通过分层 Fixture 架构 —— 桩模拟、录制回放、实时调用 —— 加上刻意的接缝设计,可以在不为每一次 commit 消耗高昂成本的情况下恢复测试保真度。
insider
llm-testing
dependency-injection
ai-engineering
+2·tian
能力探测:在用户发现之前绘制模型的能力边界
通过探针套件、能力矩阵、金丝雀提示词以及探针到回归的流水线,在部署前绘制 LLM 的失败边界,在模型升级中捕获静默回归。
llm-testing
capability-probing
model-evaluation
production-ai