跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

你的 AI 披露在第三轮就消失了,没人察觉,直到监管者发现

你的法务团队批准的单轮披露评审,无法在为它服务的 Agent 循环中存活——到第十四轮,模型已经在用一份悄悄删掉了「我是 AI」的摘要回答用户,而这个缺口如今是一个有牙齿的监管责任。

insider
ai-engineering
compliance
agent-runtime
+2
·tian

团队内部的 AI 素养鸿沟,才是你路线图上最大的交付风险

团队对外宣称的 AI 能力,是成员中最强那一位的水平;而真实的交付速度,是这群人的中位数水平。这道鸿沟是你路线图上定价最不充分的风险。

ai-engineering
team-capability
engineering-leadership
evals
+1
·tian

凌晨 3 点拥有合并权限的 CI Agent

把一个有合并权限的 AI Agent 接入 CI,就在你的体系里创造了一种 SRE 手册从未命名过的新型操作主体。给它的动作分级、把不能无人值守的动作排进队列、为每次变更留下可追溯的归属,并定期演练它的紧急停机开关。

ai-engineering
ci-cd
sre
agents
+1
·tian

在用户说"是"之前就已提交的流式响应

流式 UX 继承了一个工具调用并不遵守的可逆性契约。本文剖析为何停止按钮无法撤回已发送的邮件,以及修复这一问题所需的框架变更。

insider
ai-engineering
agents
tool-calls
+2
·tian

你的智能体审计日志记录了一切,唯独没有记录原因

完整的智能体追踪展示了发生了什么,却从未解释原因。为什么可观测性并不等同于可解释性,为什么记录的思维链可能是虚构的,以及如何捕捉能通过监管机构审查的决策依据。

audit-log
observability
ai-engineering
compliance
+1
·tian

你的 Embedding 并不知晓外包人员已离职

你的向量索引是一个无人更新的权限缓存。当源数据的访问权限发生变更时,Embedding 仍会像什么都没发生一样继续响应——而这正是无人预料到的数据泄露。

rag
vector-databases
security
access-control
+1
·tian

Shadow Replay 会惩罚那些本可以改变对话走向的模型

Shadow Replay 评估会悄悄地惩罚更好的模型,因为它根据旧模型引导下的用户对话记录来给新模型评分。本文将探讨其中的原因,以及影子回放仍然可以真实衡量哪些指标。

insider
llm-evals
offline-evaluation
shadow-testing
+2
·tian

停不下来的 Agent:作为运行时故障模式的范围蔓延

Agent 修复了 Bug,然后继续运行——重构周围的代码、扩大范围、消耗大量 Token。这是一份关于在范围蔓延演变成静默故障模式之前,如何为 Agent 任务设计停止标准、步数预算和“完成”信号的指南。

agents
ai-engineering
reliability
prompt-engineering
·tian

演示成功是因为有人在看:会话长度是你的评测套件遗漏的那个维度

五轮的演示掩盖了在第二十八轮才会出现的误差累积、注意力漂移和承诺粘性。把会话长度当作一等评测维度来对待,否则你交付的可靠性数字,用户其实已经见过它的另一个版本。

insider
ai-engineering
llm-evals
agent-reliability
+1
·tian

没人接线的紧急开关:因为功能从未失效

发布标志会被清理,但紧急开关不会。为什么每个 AI 功能都需要持久的运行时禁用机制、预先确定的备选链,以及一个明确标注了控制杠杆的运行手册。

ai-engineering
feature-flags
incident-response
llm-ops
·tian

你删除的代码对你的编程 Agent 是不可见的

编程 Agent 会重新引入你昨天删除的代码,因为已删除的内容在仓库中没有留痕。这是一份记录 Agent 需要遵守的“否定决策”的实战指南。

insider
coding-agents
ai-engineering
developer-experience
+1
·tian

那个悄然演变成延迟敏感型服务的夜间批处理作业

随着一个又一个合理需求的加入,一个夜间批处理作业最终演变成了对延迟要求极高的服务。本文将探讨为什么批量推理和在线推理的优化目标截然相反,架构漂移如何导致隐蔽的故障,以及如何有针对性地进行重新架构。

insider
ai-engineering
system-design
mlops
+2
显示第 121–132 篇,共 834 篇