跳转到主要内容

778 含有标签「llm」

Posts tagged "llm" on TianPan.co.

查看所有标签

·tian

反馈信号时序问题:为何你的 AI 指标正在欺骗你

点赞/踩和 CSAT 评分往往与 AI 产品的长期价值背道而驰。本文介绍如何构建真正能捕捉核心价值的度量体系。

insider
ai
product
metrics
+2
·tian

渐进式上下文替换:在长 AI 对话中保持质量的方法

硬截断和朴素摘要在长 AI 对话中都会导致质量下降。滚动替换模式——对近期轮次保持原始状态,同时对较旧内容进行增量压缩——是在会话超过四十轮时保持质量的有效方法。

insider
ai-engineering
context-management
llm
+1
·tian

好帮手 AI 的悖论:为什么遵循指令是一个安全漏洞

让大语言模型(LLM)变得好用的“顺从性”,同时也让它们变得易受攻击。本文将探讨提示词注入攻击背后的工程现实、真实世界的漏洞案例,以及哪些防御措施能真正降低风险。

insider
security
llm
prompt-injection
+1
·tian

LLM-as-Judge 的对抗性失效:当你的评测框架被操控

一个输出固定回复的「空模型」在 AlpacaEval 上拿下了 86.5% 的胜率。本文系统梳理 LLM 评测框架被操控的方式、其内在的结构性偏差,以及让评测流水线保持诚实的审计方案。

insider
evaluation
llm
ai-engineering
+1
·tian

你的负载测试在撒谎:生产环境中的 LLM 供应商容量争用

LLM API 是多租户共享基础设施 —— 你的负载测试在凌晨 2 点通过,但生产环境的延迟在周二上午 9 点却出现飙升。了解共享峰值需求的机制以及保护你 SLO 的架构模式(多供应商对冲、熔断器、预留容量)。

llm
production
reliability
infrastructure
+1
·tian

LLM 自我调试:解释何时是信号,何时是谎言

LLM 在被问到失败原因时会给出流畅的回答——但这个解释和实际的失败机制往往是两回事。本文是一份实践指南,帮助你在采取行动之前分辨两者的区别。

llm
debugging
agents
rag
·tian

LLM 尾部延迟:为什么在 P50 表现良好时你的 P99 却是一场灾难

LLM 响应时间分布在本质上呈现出传统 API 监控完全无法察觉的重尾特性。本文将教你如何诊断 P99 差距并修复它。

llm
inference
latency
performance
+1
·tian

Prompt 中的 PII:你的 AI 流水线缺失的数据最小化模式

客户个人数据正无形地流入上下文窗口、向量数据库和微调数据集。本文介绍了在不破坏模型质量的前提下,使 AI 流水线符合 GDPR/CCPA 合规要求的分类、清洗和架构模式。

ai-engineering
privacy
security
llm
+1
·tian

权重中的幽灵:预训练残留如何在生产环境中破坏你的微调模型

微调调整的是权重,而不是重置它们。预训练先验在分布外输入上持续渗透,产生置信度极高却错误百出的答案,而你的评估套件根本察觉不到。以下是在这些问题触达用户之前如何检测和缓解它们的方法。

insider
llm
fine-tuning
production-ai
+1
·tian

真正信守承诺的隐私模式:在 AI 功能中构建用户可控的数据边界

“大多数 AI 隐私模式都只是”留存剧场” —— 开关虽然在那,但数据照样流动。本文将介绍如何构建真正生效的用户可控数据边界,涵盖从临时推理到用户可验证的审计追踪等技术实现。”

insider
privacy
security
ai-engineering
+2
·tian

分析 LLM 流水线:推理之外的性能瓶颈

大多数 LLM 流水线的延迟并不发生在推理阶段。本文将详细分析真正的瓶颈——预处理、重复分词、同步检索、序列化——以及如何通过分阶段追踪使它们可见。

insider
llm
observability
rag
+2
·tian

多模态输入中的提示注入:纯文本防御所忽视的视觉攻击面

基于文本的提示注入防御对隐藏在图像、PDF 和音频中的攻击视而不见。本文全面梳理多模态 AI 管道的攻击面,并介绍如何构建真正有效的分层防御体系。

security
llm
multimodal
ai-engineering
显示第 181–192 篇,共 778 篇