跳转到主要内容

990 含有标签「insider」

Posts tagged "insider" on TianPan.co.

查看所有标签

·tian

为什么你的提示词库应该是 Monorepo,而不是 Cookbook

Cookbook 模式的提示词文件夹在规模化时会失效。应用 Monorepo 规范——语义化版本控制、依赖图、原子重构和评估门禁——以防止提示词漂移、幽灵依赖和迁移瘫痪影响生产环境。

insider
prompt-engineering
llm-ops
ai-engineering
+2
·tian

工具调用顺序是偏序,而非集合

大多数生产环境中的 Agent 将其工具集视为一个无序的能力包。实际上,它是一个偏序关系,而 Bug 就隐藏在那些无人声明的依赖边界中。

insider
agents
llm
evals
+1
·tian

Semver 的谎言:为什么 LLM 的次要更新比重大重构更容易搞垮生产环境

模型提供商的版本更新不包含行为兼容性保证,因此每次版本变更都应像数据库迁移一样进行分阶段发布:锁定评估、影子流量、金丝雀发布以及真实的回滚路径。

insider
llm-ops
model-versioning
evals
+1
·tian

智能体灾难恢复:当工作记忆随区域一同失效时

智能体运行时将状态隐藏在你的灾难恢复(DR)手册从未提及的地方。解决方案是:明确状态范围、在任务作用域内生成幂等键、在每次工具调用前设置检查点,并优先选择安全中止(fail-safe abort)而非向前重放(fail-forward replay)。

insider
ai-engineering
reliability
disaster-recovery
+1
·tian

智能体权限提示存在习惯化曲线,而你的安全叙事就建立在其斜率之上

权限提示是一种具有可衡量半衰期的安全控制手段。你应该跟踪每个用户的审批率,根据爆炸半径对摩擦力进行分层,并停止让 100% 的点击率作为你安全叙事的唯一支撑。

insider
ai-agents
security
ux
+2
·tian

Agent 追踪采样:当 “记录所有内容” 耗费 8 万美元却依然漏掉性能退化时

请求级的采样策略对 Agent 追踪已不再适用。采用分层策略——始终追踪失败、对成功请求进行头部采样、按成本百分位进行尾部采样——能将追踪存储从预算黑洞转变为有效的事件响应工具。

insider
llm
observability
agents
+2
·tian

Demo 只是一个随机种子:为什么你的 AI 发布面临的是方差问题,而非润色问题

那个令人惊叹的 Demo 只是模型针对同一输入生成的数千种可能性中的一次实现。产品发布之所以受挫,并非因为缺乏“润色”,而是因为没人测量过方差。本文将介绍如何通过 n-of-k 采样、最坏情况输入库和分布偏移检查清单来弥补这一差距。

insider
ai-engineering
evaluation
reliability
+1
·tian

AI 影子 IT:当产品团队构建自己的 LLM 代理时

影子 LLM 代理之所以会绕过成本归因、审计日志和数据处理协议 (DPA),是因为平台网关在面对产品交付期限时败下阵来。解决办法是建立一条“铺好的路” (Paved Road),在首 token 延迟 (TTFT)、功能对等和开发人员体验方面全面超越非官方渠道。

insider
ai-platform
shadow-it
llm-gateway
+2
·tian

“换个更大的模型试试”这种直觉反应是一种重构异味

当你团队中出现的每一次质量退化都习惯性地转向“让我们换个更大的模型试试”时,你实际上是在投入昂贵的算力资源来掩盖上游的 bug。这种打破直觉反应的纪律,以及为此设立的门控机制至关重要。

insider
llm
ai-engineering
prompt-engineering
+3
·tian

置信度描述而非评分:为什么 0.87 的徽章无法打动任何人

一个 0.87 的置信度徽章不会改变任何用户行为。而一个说明模型未检查内容的自然语言对冲表述则能起到很大作用。本文探讨了为什么概率评分是错误形式的信号,以及如何将不确定性作为内容而非 UI 叠加层来发布。

insider
ai-ux
llm-evaluation
uncertainty
+1
·tian

跨团队 Agent SLA 无法简单叠加:你的组织遗漏预算的 99% 数学陷阱

当 Agent 跨越团队边界互相调用时,单个 SLO 将不再能预测端到端的行为。在组合数学耗尽你的可靠性预算之前,必须落地的四个关键要素。

insider
multi-agent
reliability
slo
+1
·tian

你的 Gold 评估集已经发生偏移,而它的通过率正是你无法察觉的原因

当生产环境已经偏离时,Gold 评估的通过率可能依然显示为绿色。并行运行一个基于当前流量构建的影子评估集 —— 分歧度指标正是你仪表盘中缺失的偏移检测器。

insider
ai-engineering
evaluation
llm
+2
显示第 505–516 篇,共 990 篇