跳到主要内容

1 篇博文 含有标签「programming-languages」

查看所有标签

编译器是你运行过最廉价的评估 (Eval)

· 阅读需 12 分钟
Tian Pan
Software Engineer

正在构建编程智能体(coding agents)的团队在验证上投入了真金白银。针对每一次模型升级运行精心策划的任务评估套件;对 diff 进行打分的 LLM 裁判;每次迭代都要消耗数分钟算力的沙箱测试。这一切的存在都是为了回答一个问题:模型写出的代码能运行吗?

与此同时,这些团队大多能接触到的最便宜的评估方式就躺在他们的工具链中,而他们在十年前配置它时根本没有考虑过模型。它就是编译器。一个严格的类型检查器是一个免费、即时、确定性的验证器,它在智能体循环中的每一次编辑时运行——而你是否拥有它取决于你的语言选择,而不是你的评估预算。

这种重构带来了一个令人不安的后果。你的团队在多年前确定的技术栈决策——为了速度选择动态语言、类型可选、以测试作为安全网——是针对人类作者优化的。当作者变成模型时,权衡的优先级会重新排序。你团队最擅长的语言可能不再是你的智能体最安全的语言。