你雇用的 ML 工程师并非你所需的 AI 工程师
从你的 ML 团队中抽调人手组建 AI 产品团队是今年最常见的组织架构错误。训练模型的技能与在他人模型之上构建可靠系统的技能几乎没有交集 —— 本文将揭示职级体系中尚未标明的角色分工,以及你真正需要筛选的能力。
当候选人说“我会直接用提示词解决”时,面试官之间出现的 40 分分歧
针对同一位候选人产生的 40 分评价差异,并不是候选人的问题,而是评分标准的问题。本文将探讨当你的团队尚未达成共识时,如何校准 AI 工程师的招聘环节。
为尚未建立职业阶梯的 AI 岗位招聘人才
“评估工程师”(eval engineer)这个头衔在两年前还不存在,因此没有职级标准,也没有完全匹配的简历。围绕真实的失败案例来定义岗位,筛选候选人的判断力而非工具使用能力,从 QA 和平台工程团队进行侧向招聘,并在发出录取通知前先写好职级阶梯。
那些被 AI Agent 悄然终结的编程面试
编程 Agent 切断了 Take-home 任务衡量标准与实际工作需求之间的联系 —— 而大多数招聘流程仍在沿用这个已经失效的代理指标,却未曾察觉。
当候选人使用智能体时,编程面试衡量的是什么
当每一位工程师都开始与智能体协作时,独立产出代码的能力已不再能预测其在职表现。本文将探讨编程面试应该衡量什么,以及为什么禁止或随意允许使用智能体都会破坏面试信号。
Eval 瓶颈:你的 Eval 工程师现在就是路线图
在 2026 年,AI 功能的吞吐量限制不再是模型发布或 Prompt 迭代,而是 Eval 工程。这里有在你的唯一一名 Eval 工程师辞职之前,你所需了解的人员配比、平台投入和领导层认知重构。
AI 工程师面试系统性失灵:停止考实现,开始考评测设计
Leetcode 筛选和系统设计环节是针对编写确定性代码的工程师进行校准的。AI 工程需要一种不同的信号 —— 能捕捉到这种信号的环节是评测设计,而非具体实现。
AI 面试毫无区分度:为什么你的流程无法识别能交付 LLM 产品的人才
标准的工程面试流程往往只筛选确定性系统的技能,却忽略了预测谁能交付 LLM 产品的核心能力——包括评测设计、成本直觉、提示词调试和容错思维。解决方案是重构面试流程,而不是生硬地增加一个 AI 面试环节。
AI 工程师的三种品味:为什么 Prompt、Eval 和 Guardrail 往往无法共存于一个大脑中
Prompt 品味、Eval 品味和 Guardrail 品味是 AI 工程师这一职位头衔下隐藏的三种截然不同的直觉。如果你将它们视为同一种技能来进行招聘和晋升,你将交付一个失衡的系统——即便所有的指标都显示正常(全绿),用户却在流失。
AI 面试崩塌:工程招聘已失去筛选信号
在 19,368 场面试中,技术岗位 AI 辅助作弊比例高达 48%,且 61% 的作弊者成功达标。本文探讨了为何检测手段注定失败、为何禁止 AI 的政策在惩罚诚实候选人,以及正在取代旧模式的新型面试形式。
LLM 工程师招聘:面试究竟该测试什么
标准的代码筛选和机器学习数学题无法预测 LLM 工程的成功。以下是实际的面试练习如何揭示候选人交付 AI 产品能力的真实情况。
AI 招聘评分标准的问题:为什么你的面试流程选错了工程师
传统编程面试对真正预示 AI 工程成功的技能视而不见。以下是真正应该考察的内容。