跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

单次正确成本,而非 Token 成本:账单不会告诉你的单位指标

Token 支出是分子,通过评估定级的产出是分母。仅仅追踪账单,往往会导致在向低成本方案迁移时,由于质量悄然下降而推高下游的支持成本。

ai-engineering
finops
llm-costs
evaluation
+1
·tian

跨团队 Agent SLA 无法简单叠加:你的组织遗漏预算的 99% 数学陷阱

当 Agent 跨越团队边界互相调用时,单个 SLO 将不再能预测端到端的行为。在组合数学耗尽你的可靠性预算之前,必须落地的四个关键要素。

insider
multi-agent
reliability
slo
+1
·tian

Eval 瓶颈:你的 Eval 工程师现在就是路线图

在 2026 年,AI 功能的吞吐量限制不再是模型发布或 Prompt 迭代,而是 Eval 工程。这里有在你的唯一一名 Eval 工程师辞职之前,你所需了解的人员配比、平台投入和领导层认知重构。

evals
ai-engineering
team-structure
hiring
+1
·tian

Eval 差异分析作为分支保护:交付分数变化,而非分数下限

分数下限 (Score Floors) 会让静默回归进入生产环境,同时又可能误报真实的改进。基于基线感知的切片级 Eval 差异分析能将 Eval 门禁转变为你的团队可以信赖的回归检测器。

evals
ci-cd
ai-engineering
prompt-engineering
·tian

评估集毒丸:当你的基准测试成为后门

大多数团队信任评估,因为没人负责对其进行审计。标注流水线是一个人力供应链 —— 而黄金数据集会继承人类引入的任何扭曲。

ai-engineering
evaluation
llm-ops
data-quality
+1
·tian

你的 Gold 评估集已经发生偏移,而它的通过率正是你无法察觉的原因

当生产环境已经偏离时,Gold 评估的通过率可能依然显示为绿色。并行运行一个基于当前流量构建的影子评估集 —— 分歧度指标正是你仪表盘中缺失的偏移检测器。

insider
ai-engineering
evaluation
llm
+2
·tian

人类注意力预算是你的 HITL 系统在默默透支的约束条件

HITL 系统通常将审核员的时间视为无限,但警觉度下降和自动化偏差正悄悄地将安全网变成“橡皮图章”。请针对真实的人类极限进行设计。

hitl
ai-agents
reliability
ai-engineering
+1
·tian

闲置智能体税:当用户在开会时,你的 AI 会话到底产生了多少成本

长时 AI 智能体会话即使在用户开会时也会持续产生费用。本文将揭示这些闲置时间背后的真实支出,并探讨如何通过设计休眠分层来在保证响应速度的同时,避免账单超支。

llm
ai-engineering
finops
agents
+1
·tian

你的推理内部结算正在悄悄侵蚀评估纪律

仅对推理 Token 计费而不奖励评估覆盖率,这在变相鼓励模型升级并惩罚评估工作。结果是:在账单飙升的同时评估覆盖率却在缩减——这与 FinOps 的初衷背道而驰。

finops
llm-eval
ai-engineering
cost-attribution
+1
·tian

推理成本预测:财务团队想要而你写不出来的容量规划

经典的容量规划假设工作负载是可衡量的,且单位成本是稳定的。AI 工作负载打破了这两点——你交给财务部门的 SaaS 风格预测,正是他们不断要求重新调整基准的原因。本文介绍了它应该采取的四项 FinOps 准则。

finops
ai-engineering
llm-cost
capacity-planning
+1
·tian

LLM 裁判的天花板:为什么你的自动评估在关键分数点上不再与用户对齐

LLM 作为裁判与人类的一致性在模糊的中间地带最高,但在决策边界处会崩溃。保持评估诚实的关键规范包括:分片 Kappa 分析、漂移仪表盘、针对高风险分片的跨模型系列集成,以及一个明确的、超过后需由人类评分的天花板。

llm-eval
ai-engineering
llm-as-judge
evaluation
+1
·tian

你的 APM 正在悄悄丢弃 LLM 遥测数据,而 Bug 就隐藏在这些缝隙中

传统的 APM 是为有限维度和无状态服务设计的。LLM 工作负载的基数特征更接近产品分析,这种不匹配会悄悄抹除那些能暴露提示词故障的唯一信号。

insider
ai-engineering
observability
llm-ops
+2
显示第 397–408 篇,共 834 篇