跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

你团队的基准测试正在互相欺骗:共享评估基础设施的污染问题

共享评估基础设施通过缓存补全、顺序运行污染和提示词状态渗漏悄无声息地破坏基准测试结果——而大多数团队从未察觉。本文介绍修复这一问题的技术和组织控制措施。

insider
ai-engineering
evaluation
infrastructure
+1
·tian

生产环境AI智能体中的规格博弈:当你的智能体优化了错误的目标

AI智能体如何找到意外捷径来满足你的指标,同时违背你的真实意图——以及能够阻止这种行为的检测信号和加固模式。

insider
ai-agents
reliability
safety
+1
·tian

测试不可测之物:LLM 驱动 API 的集成契约

确定性测试套件无法应对非确定性的 LLM 输出。学习基于属性的测试、行为不变量断言和语义快照策略,在不引入脆弱性的情况下获得回归覆盖。

insider
llm
testing
ai-engineering
+1
·tian

AI 的测试金字塔倒置:为什么单元测试是 LLM 功能的错误投资

经典测试金字塔在 LLM 功能上失效的原因、提示词级单元测试为何带来虚假信心,以及与 AI 故障实际分布相匹配的测试分配策略。

insider
ai-engineering
testing
llm
+2
·tian

Token 是有限资源:复杂 Agent 的上下文预算分配框架

如何将上下文窗口视为稀缺的计算预算,在系统提示、记忆注入、工具结果和暂存空间之间进行显式分配——以及在任务执行中途耗尽预算时对 agent 可靠性的影响。

insider
ai-engineering
llm
agents
+2
·tian

生产环境中的零样本与少样本:示例何时有用,何时有害

关于何时使用零样本与少样本提示的实证分析——以及为什么大规模静态示例往往适得其反。

llm
prompting
production-ai
few-shot
+1
·tian

AI 辅助故障响应:LLM 如何在不取代 SRE 手册的情况下改变它

值班工作流中的 AI 副驾驶可以浮现关联信号、起草运行手册操作——但它们引入了传统 SRE 没有受过训练去识别的故障模式。这是一份将 LLM 整合进故障响应而不让故障更难处理的实践指南。

sre
incident-response
llm
observability
+1
·tian

AI 事故严重程度分类法:幻觉何时算作 Sev-0?

传统的严重程度分类法在概率性 AI 系统中失效了。这是一个用于分类 AI 事故的多维框架——超越了二进制的“故障/正常”,旨在捕捉故障范围、可逆性以及复合型损害。

insider
ai-engineering
reliability
observability
+2
·tian

别再手写提示词了:利用 DSPy 和 MIPRO 实现自动化优化

DSPy 及其 MIPRO 优化器通过声明式签名和贝叶斯搜索取代了手动提示词工程 —— 在复杂任务中生成的提示词效果比手写提示词提升 20–40%。本文将介绍该系统的工作原理以及何时值得投入这些开销。

ai-engineering
llm
prompt-engineering
dspy
·tian

LLM 流水线中的背压:排队论在基于 Token 的服务中的应用

如何将利特尔法则、准入控制、隔板模式和令牌桶背压应用于 LLM 调用图 —— 以及为什么幼稚的重试逻辑会将供应商的瞬时波动演变成系统停机。

insider
llm
backpressure
queue-theory
+2
·tian

你一直在忽略的偏见审计:如何为 LLM 流水线构建人口特征公平性

安全过滤器和公平性检查是不同的问题,需要不同的工程响应。针对性别、种族和语言群体的输出质量差异不会在你的护栏机制中体现 —— 这里有一套能在发布前捕捉这些差异的方法论。

insider
llm
fairness
bias
+2
·tian

上下文压缩改变了你的模型真正看到的内容

Token 剪枝和提示词压缩可以将 LLM 推理成本降低 3 到 10 倍,但它们会在无形中改变模型看到的内容。本文将深入分析其失败模式——如指代链丢失、约束条件遗漏、工具输出幻觉——并探讨如何安全地验证和分配压缩预算。

llm
context-management
prompt-engineering
ai-engineering
显示第 541–552 篇,共 778 篇