跳转到主要内容

834 含有标签「ai-engineering」

Posts tagged "ai-engineering" on TianPan.co.

查看所有标签

·tian

“什么发生了变化”查询是你的索引无法回答的 RAG 问题

向量相似度检索会将同一文档的两个版本视为近乎相同,因此在处理不断演进的文档时,任何 RAG 系统在处理增量查询时都会静默地产生“没有任何变化”的幻觉。本文将解释这种失败为何是结构性的,以及一个能够感知变化的索引究竟长什么样。

rag
retrieval
llm
vector-search
+1
·tian

视频会议中的数字人:构建用于视频会议的实时对话头像 AI

45 毫秒的音视频偏移是人类将对话头像 AI 判定为伪造的阈值。深入实时工程内部——视素调度、音频主时钟,以及那些从未在离线评估中出现的失败模式。

insider
ai-engineering
real-time
multimodal
+2
·tian

并非“全员回复”:智能体出站扇出风险

智能体对“全员回复”没有肌肉记忆。当发送工具的接收方字段无法区分分发列表与个人时,规划器往往会选择动静最大的那扇门。这里有四种将爆炸半径限制在可控范围内的实践。

agents
security
ai-engineering
tools
+1
·tian

你的 AI 功能忘记计入的 SIEM 账单

发布 AI 功能会让你的审计日志量增加 10–50 倍。随之而来的 SIEM 续费账单中,包含着失效的检测规则和没人预料到的法律留存问题。

ai-engineering
observability
security
siem
+1
·tian

当你的模型具有随机性时,快照测试在撒谎

快照测试假设相同的输入加上相同的代码等于相同的输出。一旦 LLM 调用进入循环,这一契约就会失效,测试套件也会悄然变成一种走过场的“橡皮图章”。本文介绍了取代它的测试分类法。

llm
testing
ai-engineering
evals
+1
·tian

为什么 Token 预测在上线后会发生偏移 —— 以及如何在财务发现前捕捉到异常峰值

上线前的成本模型假设的是合成流量组合。当功能真正上线,现实情况就会发生偏移。账单是最糟糕的探测器 —— 这里告诉你如何实时捕捉这种偏移。

insider
llm-ops
finops
ai-engineering
+2
·tian

工具 Schema 设计即是你的爆炸半径:当函数定义成为安全边界

在你的 Agent 可以调用它的那一刻起,工具注册表就不再仅仅是文档了。为什么每个参数类型都是一种安全控制,以及如何设计能够抵御提示词注入的 Schema。

ai-engineering
security
llm
agents
+1
·tian

为什么每周会话记录审查优于你的 AI 仪表板

每周花一小时阅读生产环境的会话记录,可以发现提示词漂移、未分类的意图以及被仪表板平均值掩盖的敷衍措辞。本文将介绍如何主持会议、参会人员、采样方法,以及使其可持续发展的隐私规范。

insider
ai-quality
evals
observability
+2
·tian

你的 Embedding 模型选择决定了 RAG 的上限,而 LLM 无法突破它

Embedding 模型决定了 RAG 质量的上限,而更换 LLM 无法提升该上限。本文提供了一个实用的选择框架:领域匹配、维度选择、多语言表现和指令微调。

insider
rag
embeddings
retrieval
+2
·tian

评估集腐化:为什么评估分数在上升,而用户满意度在下降

评估分数在攀升,但用户投诉也在同步增长。一个基于发布周流量构建的评估集,在六个月后可能已经悄然失去了衡量产品的能力 —— 本文将介绍如何通过影子集、重采样和切片规则来保持仪表板的真实性。

insider
llm-evals
ai-engineering
observability
+1
·tian

为什么你的提示词库应该是 Monorepo,而不是 Cookbook

Cookbook 模式的提示词文件夹在规模化时会失效。应用 Monorepo 规范——语义化版本控制、依赖图、原子重构和评估门禁——以防止提示词漂移、幽灵依赖和迁移瘫痪影响生产环境。

insider
prompt-engineering
llm-ops
ai-engineering
+2
·tian

智能体灾难恢复:当工作记忆随区域一同失效时

智能体运行时将状态隐藏在你的灾难恢复(DR)手册从未提及的地方。解决方案是:明确状态范围、在任务作用域内生成幂等键、在每次工具调用前设置检查点,并优先选择安全中止(fail-safe abort)而非向前重放(fail-forward replay)。

insider
ai-engineering
reliability
disaster-recovery
+1
显示第 373–384 篇,共 834 篇