跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

模型卡没告诉你的是:公开基准测试与实际工作负载之间的生产差距

模型卡上的基准测试是在理想条件下测量的,这些条件很少能与生产环境匹配。这是每个团队发现得太晚的差距 —— 以及一套能在部署前捕捉到这些问题的内部基准测试套件。

insider
llm
production
benchmarks
+2
·tian

模型可移植性税:如何架构真正可迁移的 AI 系统

每次模型替换都是一次局部重写——如果你在设计时没有考虑可移植性的话。本文介绍了抽象层、能力协商以及回归测试基础设施,能将模型迁移从危机部署转变为有计划的常规操作。

insider
llm
production-ai
architecture
+1
·tian

多语言质量悬崖:为什么你的 LLM 在英文中表现出色,却在其他语言中悄然失效

英语优先的 LLM 在非英语用户面前会悄然降级。本文探讨了 20–40% 的准确度差距、标准评估套件为何会忽略这一点,以及如何在用户发现之前,通过单语言基准测试和路由策略来揭示这些差距。

llm
production-ai
multilingual
evaluation
+1
·tian

AI Agent 的 ORM 阻抗失配:为什么数据层才是真正的瓶颈

ORM 和 REST API 是为人类交互模式设计的 —— 单实体读取、延迟加载和会话范围内的事务。而 AI Agent 根本不按这种方式运作。本文将探讨为什么你的数据层正在悄悄扼杀 Agent 的性能,以及你该如何应对。

ai-agents
data-engineering
orm
api-design
+1
·tian

隐藏在你的 AI 安全过滤器中的精确率-召回率权衡

大多数团队在发布 AI 安全分类器时使用默认阈值,从未衡量误报成本。本文将探讨为什么这会悄无声息地大规模阻止合法用户,以及如何在演变成客服危机之前揭示这种权衡的校准实践。

insider
ai-safety
content-moderation
production-ai
+2
·tian

生产环境中的隐私保护推理:云端API与本地部署之间的光谱

LLM隐私不是云端API与本地部署之间的二选一。了解四层控制光谱——PII脱敏、敏感性路由、差分隐私和可信执行环境——以及每种方式的真实工程成本和风险降低效果。

privacy
security
llm
production
+1
·tian

生产分布差距:为什么内部测试人员找不到用户遇到的Bug

为什么 AI 系统通过了内部测试却在生产中崩溃——开发/预发布环境工作负载与真实用户流量之间的系统性错配,以及能够弥合这一差距的监控模式。

insider
ai-engineering
testing
mlops
+2
·tian

提示缓存命中率:你的成本仪表盘缺失的生产指标

缓存命中率是大多数团队从未监控的最具影响力的LLM成本杠杆。本文揭示了哪些因素会悄悄破坏它,以及如何在生产环境中加以防御。

llm
prompt-caching
cost-optimization
observability
·tian

正确的 Prompt 版本管理:将 LLM 指令视为生产软件

大多数团队把 prompt 当配置文件来对待——直到三个词的修改摧毁了一个创收工作流。这里是防止此类问题的工程纪律。

llm
prompt-engineering
mlops
devops
·tian

零样本、少样本还是思维链:生产环境下的决策框架

大多数团队根据习惯选择提示词策略。本文提供了一套基于证据的标准——包括任务复杂度、模型规模、Token 预算和输出结构——用于预测哪种方法在你的特定任务中表现最佳。

llm
prompting
ai-engineering
production-ai
·tian

RAG 位置偏差:为什么分块顺序会影响你的答案

检索正确性还不够——你的分块出现在提示词中的位置决定了模型实际使用哪些内容。本文探讨生产环境 RAG 系统中位置偏差的工作原理及应对方法。

insider
rag
llm
retrieval
+2
·tian

测试检索-生成接缝:RAG 系统中的集成测试盲区

检索器和生成器的单元测试都能通过,但你的 RAG 系统却在悄悄失效。本文讲解如何测试两者之间的接缝,以及故障发生时如何定位责任归属。

insider
rag
testing
llm
+2
显示第 397–408 篇,共 778 篇