跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

对非确定性 AI 功能进行 A/B 测试:为何你的实验框架假设了错误的零假设

标准 A/B 测试框架假设处理是确定性的,但 LLM 驱动的功能会引入处理内方差,从而破坏功效计算、膨胀样本量并产生不可靠的结果。本文为非确定性 AI 实验提供随机化、指标设计、贝叶斯方法和方差缩减的实践指南。

insider
ab-testing
llm
experimentation
+1
·tian

AI 演示跳过的五个关卡:LLM 功能发布就绪清单

为什么“演示效果很好”是 LLM 功能最糟糕的发布标准,以及每个 AI 团队在发布前必须通过的五个生产就绪关卡。

insider
llm
production
engineering
+2
·tian

AI 融入 SRE 循环:哪些有效、哪些失效,以及边界在哪里

LLM 可将 MTTR 缩短 40-70%,并在数分钟内自动生成故障复盘报告 —— 但凌晨三点一个自信却错误的诊断,远比聊天机器人出错危险得多。本文从实战角度拆解 AI 在哪些环节真正增强故障响应、在哪些场景自主行动会适得其反,以及决定最终结果的关键架构决策。

ai
sre
incident-response
llm
+1
·tian

构建多语言 AI 产品:没人衡量的质量悬崖

大多数 AI 团队在发布全球产品时只进行英语评估和汇总满意度评分。本文将揭示他们遗漏的内容 —— 以及如何在你的用户发现之前找到质量悬崖。

insider
ai-engineering
llm
multilingual
+2
·tian

能力激发:让大语言模型用好它已知道的一切

大多数提示优化聚焦于指令清晰度,但真正的瓶颈往往在于知识激活。从专家身份框架到顺序分解,五种激发技术能够解锁模型的潜在能力——这是单纯优化指令无法企及的。

ai-engineering
prompt-engineering
llm
capability-elicitation
·tian

能力激发 vs. 提示工程:让模型调用它已经掌握的知识

为什么大多数提示词优化都在解决错误的问题——以及结构化分解、类比启动和失败分类如何释放模型的潜在能力,而这些是单纯调整指令措辞永远无法触达的。

llm
prompt-engineering
ai-engineering
capability-elicitation
·tian

AI 系统中的差分隐私:'我们添加了噪声'究竟意味着什么

声称使用差分隐私与真正约束模型记忆和输出之间的差距——关于 epsilon 预算、DP-RAG 权衡以及 DP 训练何时完全不适用的实用指南。

insider
ai-engineering
privacy
llm
+1
·tian

动态少样本检索:为什么你的静态示例正在损耗准确率

静态少样本示例看起来很安全,但它们会悄无声息地降低大多数请求的质量。本文从工程角度阐述动态检索的必要性——以及团队在迁移过程中常踩的坑。

llm
prompting
retrieval
production-ai
+1
·tian

大规模 LLM 内容审核:为什么它不仅仅是另一个分类器

生产规模的内容审核需要快速分类器、LLM 判断和人工升级的级联,而不仅仅是单个模型。本文将介绍其架构、对抗性失败模式以及导致用户流失的误报阈值。

insider
ai-engineering
safety
production
+1
·tian

LLM 输出即 API 契约:为下游消费者版本化结构化响应

当多个服务依赖 LLM 结构化输出时,模型升级会悄无声息地破坏下游消费者。本文解析模式漂移与行为漂移的成因,以及在部署前捕获破坏性变更的版本化与契约测试模式。

insider
llm
production-ai
api-design
+3
·tian

大模型驱动的测试生成:利用 AI 发现软件中的 Bug,而不仅仅是编写代码

探讨大模型驱动的测试生成如何捕获手工编写的测试套件容易漏掉的 Bug。涵盖了测试判据问题、变异引导方法、混合架构以及保持构建确定性的 CI 集成模式。

ai-testing
llm
software-testing
mutation-testing
+1
·tian

LLM 作为通用协议翻译器:无人规划却悄然兴起的中间件模式

团队正在使用 LLM 作为运行时协议翻译器来桥接不兼容的 API 和遗留格式。本文介绍了使其安全的架构、使其危险的失效模式,以及判断何时真正适用的决策框架。

insider
llm
middleware
api-integration
+2
显示第 637–648 篇,共 778 篇