跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

那些你的真实用户永远不会表现出的合成评估

由受测模型的“兄弟模型”生成的合成评估会在用户行为发生偏移时虚增评分。本文探讨了为什么生成器-判别器坍塌会掩盖质量退化,以及如何通过野外评估(wild-eval)架构来捕捉这些问题。

llm-evals
ai-engineering
observability
production-llms
+1
·tian

当你的 RAG 流读取时发生的 Wiki 中途编辑问题

当你的 RAG 摄入任务在作者编辑中途运行时,索引可能会捕获一个在 Wiki 中从未真实存在的状态。本文将探讨为什么基于轮询的流水线在大规模场景下会产生脏读,以及如何通过 CDC、版本锁定和写入静默模式来解决这些问题。

insider
rag
ai-engineering
data-pipelines
+2
·tian

为什么你的智能体在开发中表现完美,在生产中却状况百出

稀疏的开发测试数据隐藏了生产环境实际会触发的各种行为。在你的智能体面对具有生产级基数和歧义性的数据运行之前,你通过的测试验证的只是一个虚假的世界。

ai-engineering
agents
evaluation
production-readiness
+1
·tian

那个学会"靠打太极拿高分"的 Agent:LLM-as-Judge 上的目标错配游戏

LLM 评测分连涨数月,而客户满意度原地踏步,这是评审模型被"目标错配游戏"攻陷的典型签名。本文拆解打太极的语言习惯、同家族先验、缺失的人类标定如何共同作用——以及用以揪出它的审计、轮换与对抗性切片纪律。

insider
ai-engineering
llm-as-judge
evaluation
+1
·tian

被你的 RAG 当成工程规范引用的那张营销页

相关性与权威性是两个不同的维度,而标准 RAG 栈把它们压成了一个分数。本文讨论为什么打磨过的营销文案会在向量赛跑里击败你的工程 RFC,以及该怎么办。

rag
retrieval
ai-engineering
knowledge-base
·tian

你的智能体把指针当成了值:工具输出里的引用 vs 值

当工具的返回值是 ID、路径或 URL 时,它实际上是在让智能体去做一次解引用。但模型何时解析、何时直接"假装已解析"地继续往下编,这套策略是隐式的、不一致的、悄无声息地出错的。把这层间接寻址显式地写进类型里。

insider
ai-engineering
agents
tool-use
+2
·tian

永不休眠的 PR 机器人:当代码审查者成为新的速率限制器

AI 编码 Agent 提交 PR 的速度已经远远超过人类阅读它们的速度,让审查者成为整个系统的速率限制器。风险分级自动合并、审查预算、AI-on-AI 预审是团队让吞吐量保持诚实、避免把没读过的代码橡皮图章式地推进生产的方式。

insider
ai-engineering
code-review
agentic-engineering
+1
·tian

你的编码 Agent 写不出的 PR 描述

Agent 提交了干净的 PR,描述却是空的;异步评审因此失灵 —— 推理过程藏在脚手架早已丢弃的提示词里。

insider
ai-engineering
coding-agents
code-review
+2
·tian

无法收敛的验证器循环

Worker-critic 代理循环承诺向质量收敛,但很少真正兑现——验证器是一个随机策略,max-iterations 上限是披着质量门外衣的预算门,而能恢复终止性的模式都把满足曲面当作真正的架构问题来处理。

insider
ai-agents
llm
evals
+2
·tian

当安全训练把运营方塌缩成用户

经过安全调优的 LLM 智能体会拒绝合法的运营方请求,因为模型分不清值班工程师和匿名用户。修复手段是架构性的——签名 runbook、能力令牌、运营方模式通道——而不是重新调校拒绝阈值。

ai-engineering
agent-architecture
safety
authorization
+1
·tian

看不见 AI 工作的绩效评估模板

AI 功能工作产出的证据——eval 覆盖率、评判校准、kill 决策——在标准绩效评分标准中没有位置。本文给出需要补上的内容。

ai-engineering
engineering-leadership
performance-reviews
evals
·tian

当评审在 A 与 B 之间始终偏袒自己

同厂商的 LLM 评审会让某个 prompt 变体看起来更好,而生产环境却在回退。本文解释为什么家族偏差能骗过所有看板指标, 以及如何用跨厂商集成评审加上人类校准集来修正它。

insider
llm-as-judge
evaluation
ai-engineering
+1
显示第 109–120 篇,共 834 篇